99999久久久久久亚洲,欧美人与禽猛交狂配,高清日韩av在线影院,一个人在线高清免费观看,啦啦啦在线视频免费观看www

熱線電話:13121318867

登錄
首頁精彩閱讀零基礎(chǔ)寫python爬蟲之HTTP異常處理
零基礎(chǔ)寫python爬蟲之HTTP異常處理
2017-11-29
收藏

零基礎(chǔ)寫python爬蟲之HTTP異常處理

我們在使用爬蟲來抓取網(wǎng)頁內(nèi)容的時候,HTTP異常是必須要注意的一項,所以本文,我們來詳細探尋一下HTTP異常處理的相關(guān)內(nèi)容,通過一些具體的實例來分析一下,非常的簡單,但是卻很實用。


先來說一說HTTP的異常處理問題。
當urlopen不能夠處理一個response時,產(chǎn)生urlError。
不過通常的Python APIs異常如ValueError,TypeError等也會同時產(chǎn)生。
HTTPError是urlError的子類,通常在特定HTTP URLs中產(chǎn)生。

1.URLError
通常,URLError在沒有網(wǎng)絡(luò)連接(沒有路由到特定服務(wù)器),或者服務(wù)器不存在的情況下產(chǎn)生。
這種情況下,異常同樣會帶有"reason"屬性,它是一個tuple(可以理解為不可變的數(shù)組),
包含了一個錯誤號和一個錯誤信息。
我們建一個urllib2_test06.py來感受一下異常的處理:

代碼如下:
import urllib2 
req = urllib2.Request('http://www.baibai.com') 
try: urllib2.urlopen(req) 
except urllib2.URLError, e:   
    print e.reason 

按下F5,可以看到打印出來的內(nèi)容是:
[Errno 11001] getaddrinfo failed
也就是說,錯誤號是11001,內(nèi)容是getaddrinfo failed

2.HTTPError

服務(wù)器上每一個HTTP 應(yīng)答對象response包含一個數(shù)字"狀態(tài)碼"。
有時狀態(tài)碼指出服務(wù)器無法完成請求。默認的處理器會為你處理一部分這種應(yīng)答。
例如:假如response是一個"重定向",需要客戶端從別的地址獲取文檔,urllib2將為你處理。
其他不能處理的,urlopen會產(chǎn)生一個HTTPError。
典型的錯誤包含"404"(頁面無法找到),"403"(請求禁止),和"401"(帶驗證請求)。
HTTP狀態(tài)碼表示HTTP協(xié)議所返回的響應(yīng)的狀態(tài)。
比如客戶端向服務(wù)器發(fā)送請求,如果成功地獲得請求的資源,則返回的狀態(tài)碼為200,表示響應(yīng)成功。
如果請求的資源不存在, 則通常返回404錯誤。

HTTP狀態(tài)碼通常分為5種類型,分別以1~5五個數(shù)字開頭,由3位整數(shù)組成:
------------------------------------------------------------------------------------------------
200:請求成功      處理方式:獲得響應(yīng)的內(nèi)容,進行處理
201:請求完成,結(jié)果是創(chuàng)建了新資源。新創(chuàng)建資源的URI可在響應(yīng)的實體中得到    處理方式:爬蟲中不會遇到
202:請求被接受,但處理尚未完成    處理方式:阻塞等待
204:服務(wù)器端已經(jīng)實現(xiàn)了請求,但是沒有返回新的信 息。如果客戶是用戶代理,則無須為此更新自身的文檔視圖。    處理方式:丟棄
300:該狀態(tài)碼不被HTTP/1.0的應(yīng)用程序直接使用, 只是作為3XX類型回應(yīng)的默認解釋。存在多個可用的被請求資源。    處理方式:若程序中能夠處理,則進行進一步處理,如果程序中不能處理,則丟棄
301:請求到的資源都會分配一個永久的URL,這樣就可以在將來通過該URL來訪問此資源    處理方式:重定向到分配的URL
302:請求到的資源在一個不同的URL處臨時保存     處理方式:重定向到臨時的URL
304 請求的資源未更新     處理方式:丟棄
400 非法請求     處理方式:丟棄
401 未授權(quán)     處理方式:丟棄
403 禁止     處理方式:丟棄
404 沒有找到     處理方式:丟棄
5XX 回應(yīng)代碼以“5”開頭的狀態(tài)碼表示服務(wù)器端發(fā)現(xiàn)自己出現(xiàn)錯誤,不能繼續(xù)執(zhí)行請求    處理方式:丟棄
------------------------------------------------------------------------------------------------

HTTPError實例產(chǎn)生后會有一個整型'code'屬性,是服務(wù)器發(fā)送的相關(guān)錯誤號。

Error Codes錯誤碼

因為默認的處理器處理了重定向(300以外號碼),并且100-299范圍的號碼指示成功,所以你只能看到400-599的錯誤號碼。
BaseHTTPServer.BaseHTTPRequestHandler.response是一個很有用的應(yīng)答號碼字典,顯示了HTTP協(xié)議使用的所有的應(yīng)答號。
當一個錯誤號產(chǎn)生后,服務(wù)器返回一個HTTP錯誤號,和一個錯誤頁面。
你可以使用HTTPError實例作為頁面返回的應(yīng)答對象response。
這表示和錯誤屬性一樣,它同樣包含了read,geturl,和info方法。
我們建一個urllib2_test07.py來感受一下:

代碼如下:
import urllib2 
req = urllib2.Request('http://www.jb51.net/callmewhy') 
try: 
    urllib2.urlopen(req) 
except urllib2.URLError, e: 
    print e.code 
    #print e.read() 

按下F5可以看見輸出了404的錯誤碼,也就說沒有找到這個頁面。

3.Wrapping

所以如果你想為HTTPError或URLError做準備,將有兩個基本的辦法。推薦使用第二種。
我們建一個urllib2_test08.py來示范一下第一種異常處理的方案:

代碼如下:
from urllib2 import Request, urlopen, URLError, HTTPError 
req = Request('http://www.jb51.net/callmewhy') 
try: 
    response = urlopen(req) 
except HTTPError, e: 
    print 'The server couldn\'t fulfill the request.' 
    print 'Error code: ', e.code 
except URLError, e: 
    print 'We failed to reach a server.' 
    print 'Reason: ', e.reason 
else: 
    print 'No exception was raised.' 
    # everything is fine 

和其他語言相似,try之后捕獲異常并且將其內(nèi)容打印出來。
這里要注意的一點,except HTTPError 必須在第一個,否則except URLError將同樣接受到HTTPError 。
因為HTTPError是URLError的子類,如果URLError在前面它會捕捉到所有的URLError(包括HTTPError )。

我們建一個urllib2_test09.py來示范一下第二種異常處理的方案:

代碼如下:

from urllib2 import Request, urlopen, URLError, HTTPError 
req = Request('http://www.jb51.net/callmewhy') 
try:   
    response = urlopen(req)   
except URLError, e:   
    if hasattr(e, 'code'):   
        print 'The server couldn\'t fulfill the request.'   
        print 'Error code: ', e.code   
    elif hasattr(e, 'reason'):   
        print 'We failed to reach a server.'   
        print 'Reason: ', e.reason   
else:   
    print 'No exception was raised.'   
    # everything is fine   



數(shù)據(jù)分析咨詢請掃描二維碼

若不方便掃碼,搜微信號:CDAshujufenxi

數(shù)據(jù)分析師資訊
更多

OK
客服在線
立即咨詢
客服在線
立即咨詢
') } function initGt() { var handler = function (captchaObj) { captchaObj.appendTo('#captcha'); captchaObj.onReady(function () { $("#wait").hide(); }).onSuccess(function(){ $('.getcheckcode').removeClass('dis'); $('.getcheckcode').trigger('click'); }); window.captchaObj = captchaObj; }; $('#captcha').show(); $.ajax({ url: "/login/gtstart?t=" + (new Date()).getTime(), // 加隨機數(shù)防止緩存 type: "get", dataType: "json", success: function (data) { $('#text').hide(); $('#wait').show(); // 調(diào)用 initGeetest 進行初始化 // 參數(shù)1:配置參數(shù) // 參數(shù)2:回調(diào),回調(diào)的第一個參數(shù)驗證碼對象,之后可以使用它調(diào)用相應(yīng)的接口 initGeetest({ // 以下 4 個配置參數(shù)為必須,不能缺少 gt: data.gt, challenge: data.challenge, offline: !data.success, // 表示用戶后臺檢測極驗服務(wù)器是否宕機 new_captcha: data.new_captcha, // 用于宕機時表示是新驗證碼的宕機 product: "float", // 產(chǎn)品形式,包括:float,popup width: "280px", https: true // 更多配置參數(shù)說明請參見:http://docs.geetest.com/install/client/web-front/ }, handler); } }); } function codeCutdown() { if(_wait == 0){ //倒計時完成 $(".getcheckcode").removeClass('dis').html("重新獲取"); }else{ $(".getcheckcode").addClass('dis').html("重新獲取("+_wait+"s)"); _wait--; setTimeout(function () { codeCutdown(); },1000); } } function inputValidate(ele,telInput) { var oInput = ele; var inputVal = oInput.val(); var oType = ele.attr('data-type'); var oEtag = $('#etag').val(); var oErr = oInput.closest('.form_box').next('.err_txt'); var empTxt = '請輸入'+oInput.attr('placeholder')+'!'; var errTxt = '請輸入正確的'+oInput.attr('placeholder')+'!'; var pattern; if(inputVal==""){ if(!telInput){ errFun(oErr,empTxt); } return false; }else { switch (oType){ case 'login_mobile': pattern = /^1[3456789]\d{9}$/; if(inputVal.length==11) { $.ajax({ url: '/login/checkmobile', type: "post", dataType: "json", data: { mobile: inputVal, etag: oEtag, page_ur: window.location.href, page_referer: document.referrer }, success: function (data) { } }); } break; case 'login_yzm': pattern = /^\d{6}$/; break; } if(oType=='login_mobile'){ } if(!!validateFun(pattern,inputVal)){ errFun(oErr,'') if(telInput){ $('.getcheckcode').removeClass('dis'); } }else { if(!telInput) { errFun(oErr, errTxt); }else { $('.getcheckcode').addClass('dis'); } return false; } } return true; } function errFun(obj,msg) { obj.html(msg); if(msg==''){ $('.login_submit').removeClass('dis'); }else { $('.login_submit').addClass('dis'); } } function validateFun(pat,val) { return pat.test(val); }