自拍偷在线精品自拍偷,亚洲欧美中文日韩v在线观看不卡

51CTO首頁(yè)

AI.x社區(qū)

軟考社區(qū)

免費(fèi)課

企業(yè)培訓(xùn)

鴻蒙開發(fā)者社區(qū)

WOT技術(shù)大會(huì)

公眾號(hào)矩陣

移動(dòng)端

視頻課免費(fèi)課排行榜短視頻直播課軟考學(xué)堂

全部課程軟考華為認(rèn)證廠商認(rèn)證 IT技術(shù)PMP項(xiàng)目管理免費(fèi)題庫(kù)

在線學(xué)習(xí)

文章資源問答課堂專欄直播

51CTO

鴻蒙開發(fā)者社區(qū)

51CTO技術(shù)棧

51CTO官微

51CTO學(xué)堂

51CTO博客

CTO訓(xùn)練營(yíng)

鴻蒙開發(fā)者社區(qū)訂閱號(hào)

51CTO軟考

51CTO學(xué)堂APP

51CTO學(xué)堂企業(yè)版APP

鴻蒙開發(fā)者社區(qū)視頻號(hào)

51CTO軟考題庫(kù)

賬號(hào)設(shè)置退出

良心推薦！Python爬蟲高手必備的8大技巧！

2022-09-06 11:56:08

開發(fā) 后端

爬蟲在開發(fā)過程中也有很多復(fù)用的過程，今天就總結(jié)一下必備的8大技巧，以后也能省時(shí)省力，高效完成任務(wù)。

想要快速學(xué)習(xí)爬蟲，最值得學(xué)習(xí)的語(yǔ)言一定是Python，Python應(yīng)用場(chǎng)景比較多，比如：Web快速開發(fā)、爬蟲、自動(dòng)化運(yùn)維等等，可以做簡(jiǎn)單網(wǎng)站、自動(dòng)發(fā)帖腳本、收發(fā)郵件腳本、簡(jiǎn)單驗(yàn)證碼識(shí)別腳本。

爬蟲在開發(fā)過程中也有很多復(fù)用的過程，今天就總結(jié)一下必備的8大技巧，以后也能省時(shí)省力，高效完成任務(wù)。

1、基本抓取網(wǎng)頁(yè)

get方法

import urllib2
url = "http://www.baidu.com"
response = urllib2.urlopen(url)
print response.read()

post方法

import urllib
import urllib2
url = "http://abcde.com"
form = {'name':'abc','password':'1234'}
form_data = urllib.urlencode(form)
request = urllib2.Request(url,form_data)
response = urllib2.urlopen(request)
print response.read()

2、使用代理IP

在開發(fā)爬蟲過程中經(jīng)常會(huì)遇到IP被封掉的情況，這時(shí)就需要用到代理IP；在urllib2包中有ProxyHandler類，通過此類可以設(shè)置代理訪問網(wǎng)頁(yè)，如下代碼片段：

import urllib2
proxy = urllib2.ProxyHandler({'http': '127.0.0.1:8087'})
opener = urllib2.build_opener(proxy)
urllib2.install_opener(opener)
response = urllib2.urlopen('http://www.baidu.com')
print response.read()

3、Cookies處理

cookies是某些網(wǎng)站為了辨別用戶身份、進(jìn)行session跟蹤而儲(chǔ)存在用戶本地終端上的數(shù)據(jù)(通常經(jīng)過加密)，python提供了cookielib模塊用于處理cookies，cookielib模塊的主要作用是提供可存儲(chǔ)cookie的對(duì)象，以便于與urllib2模塊配合使用來訪問Internet資源。微信搜索公眾號(hào)：架構(gòu)師指南，回復(fù)：架構(gòu)師領(lǐng)取資料。

代碼片段：

import urllib2, cookielib
cookie_support= urllib2.HTTPCookieProcessor(cookielib.CookieJar())
opener = urllib2.build_opener(cookie_support)
urllib2.install_opener(opener)
content = urllib2.urlopen('http://XXXX').read()

關(guān)鍵在于CookieJar()，它用于管理HTTP cookie值、存儲(chǔ)HTTP請(qǐng)求生成的cookie、向傳出的HTTP請(qǐng)求添加cookie的對(duì)象。整個(gè)cookie都存儲(chǔ)在內(nèi)存中，對(duì)CookieJar實(shí)例進(jìn)行垃圾回收后cookie也將丟失，所有過程都不需要單獨(dú)去操作。

手動(dòng)添加cookie：

cookie = "PHPSESSID=91rurfqm2329bopnosfu4fvmu7; kmsign=55d2c12c9b1e3; KMUID=b6Ejc1XSwPq9o756AxnBAg="
request.add_header("Cookie", cookie)

4、偽裝成瀏覽器

某些網(wǎng)站反感爬蟲的到訪，于是對(duì)爬蟲一律拒絕請(qǐng)求。所以用urllib2直接訪問網(wǎng)站經(jīng)常會(huì)出現(xiàn)HTTP Error 403: Forbidden的情況。

對(duì)有些 header 要特別留意，Server 端會(huì)針對(duì)這些 header 做檢查：

User-Agent 有些 Server 或 Proxy 會(huì)檢查該值，用來判斷是否是瀏覽器發(fā)起的 Request
Content-Type 在使用 REST 接口時(shí)，Server 會(huì)檢查該值，用來確定 HTTP Body 中的內(nèi)容該怎樣解析

這時(shí)可以通過修改http包中的header來實(shí)現(xiàn)，代碼片段如下：

import urllib2
headers = {
   'User-Agent':'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US; rv:1.9.1.6) Gecko/20091201 Firefox/3.5.6'
}
request = urllib2.Request(
   url = 'http://my.oschina.net/jhao104/blog?catalog=3463517',
   headers = headers
)
print urllib2.urlopen(request).read()

5、頁(yè)面解析

對(duì)于頁(yè)面解析最強(qiáng)大的當(dāng)然是正則表達(dá)式，這個(gè)對(duì)于不同網(wǎng)站不同的使用者都不一樣，就不用過多的說明

其次就是解析庫(kù)了，常用的有兩個(gè)lxml和BeautifulSoup

對(duì)于這兩個(gè)庫(kù)，我的評(píng)價(jià)是，都是HTML/XML的處理庫(kù)，Beautifulsoup純python實(shí)現(xiàn)，效率低，但是功能實(shí)用，比如能用通過結(jié)果搜索獲得某個(gè)HTML節(jié)點(diǎn)的源碼；lxml C語(yǔ)言編碼，高效，支持Xpath。

6、驗(yàn)證碼的處理

對(duì)于一些簡(jiǎn)單的驗(yàn)證碼，可以進(jìn)行簡(jiǎn)單的識(shí)別。本人也只進(jìn)行過一些簡(jiǎn)單的驗(yàn)證碼識(shí)別。但是有些反人類的驗(yàn)證碼，比如12306，可以通過打碼平臺(tái)進(jìn)行人工打碼，當(dāng)然這是要付費(fèi)的。

7、gzip壓縮

有沒有遇到過某些網(wǎng)頁(yè)，不論怎么轉(zhuǎn)碼都是一團(tuán)亂碼。哈哈，那說明你還不知道許多web服務(wù)具有發(fā)送壓縮數(shù)據(jù)的能力，這可以將網(wǎng)絡(luò)線路上傳輸?shù)拇罅繑?shù)據(jù)消減 60%以上。這尤其適用于XML web 服務(wù)，因?yàn)?XML 數(shù)據(jù) 的壓縮率可以很高。

但是一般服務(wù)器不會(huì)為你發(fā)送壓縮數(shù)據(jù)，除非你告訴服務(wù)器你可以處理壓縮數(shù)據(jù)。

于是需要這樣修改代碼：

import urllib2, httplib
request = urllib2.Request('http://xxxx.com')
request.add_header('Accept-encoding', 'gzip')
opener = urllib2.build_opener()
f = opener.open(request)

這是關(guān)鍵：創(chuàng)建Request對(duì)象，添加一個(gè) Accept-encoding 頭信息告訴服務(wù)器你能接受 gzip 壓縮數(shù)據(jù)。

然后就是解壓縮數(shù)據(jù)：

import StringIO
import gzip
compresseddata = f.read()
compressedstream = StringIO.StringIO(compresseddata)
gzipper = gzip.GzipFile(fileobj=compressedstream)
print gzipper.read()

8、多線程并發(fā)抓取

單線程太慢的話，就需要多線程了，這里給個(gè)簡(jiǎn)單的線程池模板這個(gè)程序只是簡(jiǎn)單地打印了1-10，但是可以看出是并發(fā)的。

雖然說Python的多線程很雞肋，但是對(duì)于爬蟲這種網(wǎng)絡(luò)頻繁型，還是能一定程度提高效率的。

from threading import Thread
from Queue import Queue
from time import sleep
# q是任務(wù)隊(duì)列
#NUM是并發(fā)線程總數(shù)
#JOBS是有多少任務(wù)
q = Queue()
NUM = 2
JOBS = 10
#具體的處理函數(shù)，負(fù)責(zé)處理單個(gè)任務(wù)
def do_somthing_using(arguments):
   print arguments
#這個(gè)是工作進(jìn)程，負(fù)責(zé)不斷從隊(duì)列取數(shù)據(jù)并處理
def working():
   while True:
       arguments = q.get()
       do_somthing_using(arguments)
       sleep(1)
       q.task_done()
#fork NUM個(gè)線程等待隊(duì)列
for i in range(NUM):
   t = Thread(target=working)
   t.setDaemon(True)
   t.start()
#把JOBS排入隊(duì)列
for i in range(JOBS):
   q.put(i)
#等待所有JOBS完成
q.join()

責(zé)任編輯：龐桂玉來源： Python人工智能編程

Python 爬蟲技巧

點(diǎn)贊

51CTO技術(shù)棧公眾號(hào)

業(yè)務(wù)
速覽

媒體

51CTO CIOAge HC3i

社區(qū)

51CTO博客鴻蒙開發(fā)者社區(qū) AI.x社區(qū)

教育

51CTO學(xué)堂精培企業(yè)培訓(xùn) CTO訓(xùn)練營(yíng)

<legend id="v148c"><track id="v148c"></track></legend>