华南俳烁实业有限公司

python

當(dāng)前位置:中華考試網(wǎng) >> python >> python爬蟲 >> 文章內(nèi)容

Python2爬蟲:URLError與HTTPError

來源:中華考試網(wǎng)  [2020年11月7日]  【

  1.URLError

  首先解釋下URLError可能產(chǎn)生的原因:

  ·網(wǎng)絡(luò)無連接,即本機(jī)無法上網(wǎng)

  ·連接不到特定的服務(wù)器

  ·服務(wù)器不存在

  在代碼中,我們需要用try-except語句來包圍并捕獲相應(yīng)的異常。下面是一個(gè)例子,先感受下它的風(fēng)騷

  import urllib2

  requset = urllib2.Request('http://www.xxxxx.com')

  try:

  urllib2.urlopen(request)

  except urllib2.URLError, e:

  print e.reason

  我們利用了 urlopen方法訪問了一個(gè)不存在的網(wǎng)址,運(yùn)行結(jié)果如下:

  [Errno 11004] getaddrinfo failed

  它說明了錯(cuò)誤代號(hào)是11004,錯(cuò)誤原因是 getaddrinfo failed

  2.HTTPError

  HTTPError是URLError的子類,在你利用urlopen方法發(fā)出一個(gè)請(qǐng)求時(shí),服務(wù)器上都會(huì)對(duì)應(yīng)一個(gè)應(yīng)答對(duì)象response,其中它包含一個(gè)數(shù)字”狀態(tài)碼”。舉個(gè)例子,假如response是一個(gè)”重定向”,需定位到別的地址獲取文檔,urllib2將對(duì)此進(jìn)行處理。

  其他不能處理的,urlopen會(huì)產(chǎn)生一個(gè)HTTPError,對(duì)應(yīng)相應(yīng)的狀態(tài)嗎,HTTP狀態(tài)碼表示HTTP協(xié)議所返回的響應(yīng)的狀態(tài)。下面將狀態(tài)碼歸結(jié)如下:

  100:繼續(xù) 客戶端應(yīng)當(dāng)繼續(xù)發(fā)送請(qǐng)求?蛻舳藨(yīng)當(dāng)繼續(xù)發(fā)送請(qǐng)求的剩余部分,或者如果請(qǐng)求已經(jīng)完成,忽略這個(gè)響應(yīng)。

  101: 轉(zhuǎn)換協(xié)議 在發(fā)送完這個(gè)響應(yīng)最后的空行后,服務(wù)器將會(huì)切換到在Upgrade 消息頭中定義的那些協(xié)議。只有在切換新的協(xié)議更有好處的時(shí)候才應(yīng)該采取類似措施。

  102:繼續(xù)處理 由WebDAV(RFC 2518)擴(kuò)展的狀態(tài)碼,代表處理將被繼續(xù)執(zhí)行。

  200:請(qǐng)求成功 處理方式:獲得響應(yīng)的內(nèi)容,進(jìn)行處理。

  201:請(qǐng)求完成,結(jié)果是創(chuàng)建了新資源。新創(chuàng)建資源的URI可在響應(yīng)的實(shí)體中得到 處理方式:爬蟲中不會(huì)遇到。

  202:請(qǐng)求被接受,但處理尚未完成 處理方式:阻塞等待。

  204:服務(wù)器端已經(jīng)實(shí)現(xiàn)了請(qǐng)求,但是沒有返回新的信 息。如果客戶是用戶代理,則無須為此更新自身的文檔視圖。處理方式:丟棄。

  300:該狀態(tài)碼不被HTTP/1.0的應(yīng)用程序直接使用,只是作為3XX類型回應(yīng)的默認(rèn)解釋。存在多個(gè)可用的被請(qǐng)求資源。處理方式:若程序中能夠處理,則進(jìn)行進(jìn)一步處理,如果程序中不能處理,則丟棄。

  301:請(qǐng)求到的資源都會(huì)分配一個(gè)永久的URL,這樣就可以在將來通過該URL來訪問此資源。處理方式:重定向到分配的URL。

  302:請(qǐng)求到的資源在一個(gè)不同的URL處臨時(shí)保存 處理方式:重定向到臨時(shí)的URL

  304:請(qǐng)求的資源未更新 處理方式:丟棄

  400:非法請(qǐng)求 處理方式:丟棄

  401:未授權(quán) 處理方式:丟棄

  403:禁止 處理方式:丟棄

  404:沒有找到 處理方式:丟棄

  500:服務(wù)器內(nèi)部錯(cuò)誤 服務(wù)器遇到了一個(gè)未曾預(yù)料的狀況,導(dǎo)致了它無法完成對(duì)請(qǐng)求的處理。一般來說,這個(gè)問題都會(huì)在服務(wù)器端的源代碼出現(xiàn)錯(cuò)誤時(shí)出現(xiàn)。

  501:服務(wù)器無法識(shí)別 服務(wù)器不支持當(dāng)前請(qǐng)求所需要的某個(gè)功能。當(dāng)服務(wù)器無法識(shí)別請(qǐng)求的方法,并且無法支持其對(duì)任何資源的請(qǐng)求。

  502:錯(cuò)誤網(wǎng)關(guān) 作為網(wǎng)關(guān)或者代理工作的服務(wù)器嘗試執(zhí)行請(qǐng)求時(shí),從上游服務(wù)器接收到無效的響應(yīng)。

  503:服務(wù)出錯(cuò) 由于臨時(shí)的服務(wù)器維護(hù)或者過載,服務(wù)器當(dāng)前無法處理請(qǐng)求。這個(gè)狀況是臨時(shí)的,并且將在一段時(shí)間以后恢復(fù)。

  HTTPError實(shí)例產(chǎn)生后會(huì)有一個(gè)code屬性,這就是是服務(wù)器發(fā)送的相關(guān)錯(cuò)誤號(hào)。

  因?yàn)閡rllib2可以為你處理重定向,也就是3開頭的代號(hào)可以被處理,并且100-299范圍的號(hào)碼指示成功,所以你只能看到400-599的錯(cuò)誤號(hào)碼。

  下面我們寫一個(gè)例子來感受一下,捕獲的異常是HTTPError,它會(huì)帶有一個(gè)code屬性,就是錯(cuò)誤代號(hào),另外我們又打印了reason屬性,這是它的父類URLError的屬性。

python課程免費(fèi)試聽預(yù)約

  • 地區(qū):
  • 姓名:
  • 手機(jī):

  import urllib2

  req = urllib2.Request('http://blog.csdn.net/cqcre')

  try:

  urllib2.urlopen(req)

  except urllib2.HTTPError, e:

  print e.code

  print e.reason

  運(yùn)行結(jié)果如下:

  403

  Forbidden

  錯(cuò)誤代號(hào)是403,錯(cuò)誤原因是Forbidden,說明服務(wù)器禁止訪問。

  我們知道,HTTPError的父類是URLError,根據(jù)編程經(jīng)驗(yàn),父類的異常應(yīng)當(dāng)寫到子類異常的后面,如果子類捕獲不到,那么可以捕獲父類的異常,所以上述的代碼可以這么改寫。

  import urllib2

  req = urllib2.Request('http://blog.csdn.net/cqcre')

  try:

  urllib2.urlopen(req)

  except urllib2.HTTPError, e:

  print e.code

  except urllib2.URLError, e:

  print e.reason

  else:

  print "OK"

  如果捕獲到了HTTPError,則輸出code,不會(huì)再處理URLError異常。如果發(fā)生的不是HTTPError,則會(huì)去捕獲URLError異常,輸出錯(cuò)誤原因。

  另外還可以加入 hasattr屬性提前對(duì)屬性進(jìn)行判斷,代碼改寫如下:

  import urllib2

  req = urllib2.Request('http://blog.csdn.net/cqcre')

  try:

  urllib2.urlopen(req)

  except urllib2.URLError, e:

  if hasattr(e,"reason"):

  print e.reason

  else:

  print "OK"

  首先對(duì)異常的屬性進(jìn)行判斷,以免出現(xiàn)屬性輸出報(bào)錯(cuò)的現(xiàn)象。

  以上,就是對(duì)URLError和HTTPError的相關(guān)介紹,以及相應(yīng)的錯(cuò)誤處理辦法,小伙伴們加油!

責(zé)編:fushihao

上一篇:python為什么叫爬蟲

下一篇: 沒有了

  • 會(huì)計(jì)考試
  • 建筑工程
  • 職業(yè)資格
  • 醫(yī)藥考試
  • 外語考試
  • 學(xué)歷考試
滦平县| 柳河县| 温宿县| 铅山县| 乐亭县| 清流县| 方山县| 堆龙德庆县| 富平县| 连平县| 太原市| 仪陇县| 大连市| 彭州市| 武宁县| 宜君县| 道真| 青浦区| 博爱县| 九龙县| 丰台区| 应用必备| 高尔夫| 保德县| 慈溪市| 阜南县| 阿荣旗| 固安县| 延长县| 咸阳市| 鱼台县| 东台市| 刚察县| 三原县| 松溪县| 温泉县| 镇平县| 格尔木市| 新疆| 资溪县| 雅安市|