零基礎寫python爬蟲之HTTP異常處理

2020-02-23 06:08:44

字體：大中小

來源：轉載

供稿：網友

先來說一說HTTP的異常處理問題。
當urlopen不能夠處理一個response時，產生urlError。
不過通常的Python APIs異常如ValueError,TypeError等也會同時產生。
HTTPError是urlError的子類，通常在特定HTTP URLs中產生。

1.URLError
通常，URLError在沒有網絡連接(沒有路由到特定服務器)，或者服務器不存在的情況下產生。
這種情況下，異常同樣會帶有"reason"屬性，它是一個tuple（可以理解為不可變的數組），
包含了一個錯誤號和一個錯誤信息。
我們建一個urllib2_test06.py來感受一下異常的處理：

代碼如下:
import urllib2
req = urllib2.Request('http://www.baibai.com')
try: urllib2.urlopen(req)
except urllib2.URLError, e:
print e.reason

按下F5，可以看到打印出來的內容是：
[Errno 11001] getaddrinfo failed
也就是說，錯誤號是11001，內容是getaddrinfo failed

2.HTTPError

服務器上每一個HTTP 應答對象response包含一個數字"狀態碼"。
有時狀態碼指出服務器無法完成請求。默認的處理器會為你處理一部分這種應答。
例如:假如response是一個"重定向"，需要客戶端從別的地址獲取文檔，urllib2將為你處理。
其他不能處理的，urlopen會產生一個HTTPError。
典型的錯誤包含"404"(頁面無法找到)，"403"(請求禁止)，和"401"(帶驗證請求)。
HTTP狀態碼表示HTTP協議所返回的響應的狀態。
比如客戶端向服務器發送請求，如果成功地獲得請求的資源，則返回的狀態碼為200，表示響應成功。
如果請求的資源不存在，則通常返回404錯誤。

HTTP狀態碼通常分為5種類型，分別以1～5五個數字開頭，由3位整數組成：
------------------------------------------------------------------------------------------------
200：請求成功      處理方式：獲得響應的內容，進行處理
201：請求完成，結果是創建了新資源。新創建資源的URI可在響應的實體中得到    處理方式：爬蟲中不會遇到
202：請求被接受，但處理尚未完成    處理方式：阻塞等待
204：服務器端已經實現了請求，但是沒有返回新的信息。如果客戶是用戶代理，則無須為此更新自身的文檔視圖。    處理方式：丟棄
300：該狀態碼不被HTTP/1.0的應用程序直接使用，只是作為3XX類型回應的默認解釋。存在多個可用的被請求資源。    處理方式：若程序中能夠處理，則進行進一步處理，如果程序中不能處理，則丟棄
301：請求到的資源都會分配一個永久的URL，這樣就可以在將來通過該URL來訪問此資源    處理方式：重定向到分配的URL

上一篇：python多線程threading.Lock鎖用法實例

下一篇：Django1.7+python 2.78+pycharm配置mysql數據庫教程