Python urllib
Python urllib
Python urllib 庫用於操作網頁 URL,並對網頁的內容進行抓取處理。
本文主要介紹 Python3 的 urllib。
urllib 包 包含以下幾個模組:
- urllib.request - 開啟和讀取 URL。
- urllib.error - 包含 urllib.request 丟擲的異常。
- urllib.parse - 解析 URL。
- urllib.robotparser - 解析 robots.txt 檔案。
urllib.request
urllib.request 定義了一些開啟 URL 的函式和類,包含授權驗證、重定向、瀏覽器 cookies等。
urllib.request 可以模擬瀏覽器的一個請求發起過程。
我們可以使用 urllib.request 的 urlopen 方法來開啟一個 URL,語法格式如下:
urllib.request.urlopen(url, data=None, [timeout, ]*, cafile=None, capath=None, cadefault=False, context=None)
- url:url 地址。
- data:傳送到伺服器的其他資料物件,預設為 None。
- timeout:設定訪問超時時間。
- cafile 和 capath:cafile 為 CA 證書, capath 為 CA 證書的路徑,使用 HTTPS 需要用到。
- cadefault:已經被棄用。
- context:ssl.SSLContext型別,用來指定 SSL 設定。
例項如下:
例項
myURL = urlopen("https://www.itread01.com/")
print(myURL.read())
以上程式碼使用 urlopen 開啟一個 URL,然後使用 read() 函式獲取網頁的 HTML 實體程式碼。
read() 是讀取整個網頁內容,我們可以指定讀取的長度:
例項
myURL = urlopen("https://www.itread01.com/")
print(myURL.read(300))
除了 read() 函式外,還包含以下兩個讀取網頁內容的函式:
-
readline() - 讀取檔案的一行內容
from urllib.request import urlopen myURL = urlopen("https://www.itread01.com/") print(myURL.readline()) #讀取一行內容
-
readlines() - 讀取檔案的全部內容,它會把讀取的內容賦值給一個列表變數。
from urllib.request import urlopen myURL = urlopen("https://www.itread01.com/") lines = myURL.readlines() for line in lines: print(line)
我們在對網頁進行抓取時,經常需要判斷網頁是否可以正常訪問,這裡我們就可以使用 getcode() 函式獲取網頁狀態碼,返回 200 說明網頁正常,返回 404 說明網頁不存在:
例項
myURL1 = urllib.request.urlopen("https://www.itread01.com/")
print(myURL1.getcode()) # 200
try:
myURL2 = urllib.request.urlopen("https://www.itread01.com/no.html")
except urllib.error.HTTPError as e:
if e.code == 404:
print(404) # 404
更多網頁狀態碼可以查閱:https://www.itread01.com/http/http-status-codes.html。
如果要將抓取的網頁保持到本地,可以使用 Python3 File write() 方法 函式:
例項
myURL = urlopen("https://www.itread01.com/")
f = open("itread01_urllib_test.html", "wb")
content = myURL.read() # 讀取網頁內容
f.write(content)
f.close()
執行以上程式碼,在本地就會生成一個 itread01_urllib_test.html 檔案,裡面包含了 https://www.itread01.com/ 網頁的內容。
更多Python File 處理,可以參閱:https://www.itread01.com/python3/python3-file-methods.html
。URL 的編碼與解碼可以使用 urllib.request.quote() 與 urllib.request.unquote() 方法:
例項
encode_url = urllib.request.quote("https://www.itread01.com/") # 編碼
print(encode_url)
unencode_url = urllib.request.unquote(encode_url) # 解碼
print(unencode_url)
輸出結果為:
https%3A//www.itread01.com/ https://www.itread01.com/
模擬頭部資訊
我們抓取網頁一般需要對 headers(網頁頭資訊)進行模擬,這時候需要使用到 urllib.request.Request 類:
class urllib.request.Request(url, data=https://www.big2gb.com/cn2tw0.php?url=https://www.itread01.com/python3/None, headers={}, origin_req_host=None, unverifiable=False, method=None)
- url:url 地址。
- data:傳送到伺服器的其他資料物件,預設為 None。
- headers:HTTP 請求的頭部資訊,字典格式。
- origin_req_host:請求的主機地址,IP 或域名。
- unverifiable:很少用整個引數,用於設定網頁是否需要驗證,預設是False。。
- method:請求方法, 如 GET、POST、DELETE、PUT等。
例項 - py3_urllib_test.php 檔案程式碼
import urllib.parse
url = 'https://www.itread01.com/?s=' # 入門教學搜尋頁面
keyword = 'Python 教程'
key_code = urllib.request.quote(keyword) # 對請求進行編碼
url_all = url+key_code
header = {
'User-Agent':'Mozilla/5.0 (X11; Fedora; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36'
} #頭部資訊
request = urllib.request.Request(url_all,headers=header)
reponse = urllib.request.urlopen(request).read()
fh = open("./urllib_test_itread01_search.html","wb") # 將檔案寫入到當前目錄中
fh.write(reponse)
fh.close()
開啟 urllib_test_itread01_search.html 檔案(可以使用瀏覽器開啟),內容如下:
表單 POST 傳遞資料,我們先建立一個表單,程式碼如下,我這裡使用了 PHP 程式碼來獲取表單的資料:
例項
<html>
<head>
<meta charset="utf-8">
<title>入門教學(itread01.com) urllib POST 測試</title>
</head>
<body>
<form action="" method="post" name="myForm">
Name: <input type="text" name="name"><br>
Tag: <input type="text" name="tag"><br>
<input type="submit" value="提交">
</form>
<hr>
<?php
// 使用 PHP 來獲取表單提交的資料,你可以換成其他的
if(isset($_POST['name']) && $_POST['tag'] ) {
echo $_POST["name"] . ', ' . $_POST['tag'];
}
?>
</body>
</html>
例項
import urllib.parse
url = 'https://www.itread01.com/try/py3/py3_urllib_test.php' # 提交到表單頁面
data = {'name':'itread01', 'tag' : '入門教學'} # 提交資料
header = {
'User-Agent':'Mozilla/5.0 (X11; Fedora; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36'
} #頭部資訊
data = urllib.parse.urlencode(data).encode('utf8') # 對引數進行編碼,解碼使用 urllib.parse.urldecode
request=urllib.request.Request(url, data, header) # 請求處理
reponse=urllib.request.urlopen(request).read() # 讀取結果
fh = open("./urllib_test_post_itread01.html","wb") # 將檔案寫入到當前目錄中
fh.write(reponse)
fh.close()
開啟 urllib_test_post_itread01.html 檔案(可以使用瀏覽器開啟),顯示結果如下:
urllib.error
urllib.error 模組為 urllib.request 所引發的異常定義了異常類,基礎異常類是 URLError。
urllib.error 包含了兩個方法,URLError 和 HTTPError。
URLError 是 OSError 的一個子類,用於處理程式在遇到問題時會引發此異常(或其派生的異常),包含的屬性 reason 為引發異常的原因。
HTTPError 是 URLError 的一個子類,用於處理特殊 HTTP 錯誤例如作為認證請求的時候,包含的屬性 code 為 HTTP 的狀態碼, reason 為引發異常的原因,headers 為導致 HTTPError 的特定 HTTP 請求的 HTTP 響應頭。
對不存在的網頁抓取並處理異常:
例項
import urllib.error
myURL1 = urllib.request.urlopen("https://www.itread01.com/")
print(myURL1.getcode()) # 200
try:
myURL2 = urllib.request.urlopen("https://www.itread01.com/no.html")
except urllib.error.HTTPError as e:
if e.code == 404:
print(404) # 404
urllib.parse
urllib.parse 用於解析 URL,格式如下:
urllib.parse.urlparse(urlstring, scheme='', allow_fragments=True)
urlstring 為 字串的 url 地址,scheme 為協議型別,
allow_fragments 引數為 false,則無法識別片段識別符號。相反,它們被解析為路徑,引數或查詢元件的一部分,並 fragment 在返回值中設定為空字串。
例項
o = urlparse("https://www.itread01.com/?s=python+%E6%95%99%E7%A8%8B")
print(o)
以上例項輸出結果為:
ParseResult(scheme='https', netloc='www.itread01.com', path='/', params='', query='s=python+%E6%95%99%E7%A8%8B', fragment='')
從結果可以看出,內容是一個元組,包含 6 個字串:協議,位置,路徑,引數,查詢,判斷。
我們可以直接讀取協議內容:
例項
o = urlparse("https://www.itread01.com/?s=python+%E6%95%99%E7%A8%8B")
print(o.scheme)
以上例項輸出結果為:
https
完整內容如下:
屬性 |
索引 |
值 |
值(如果不存在) |
---|---|---|---|
scheme |
0 |
URL協議 |
scheme 引數 |
netloc |
1 |
網路位置部分 |
空字串 |
path |
2 |
分層路徑 |
空字串 |
params |
3 |
最後路徑元素的引數 |
空字串 |
query |
4 |
查詢元件 |
空字串 |
fragment |
5 |
片段識別 |
空字串 |
username |
使用者名稱 |
None |
|
password |
密碼 |
None |
|
hostname |
主機名(小寫) |
None |
|
port |
埠號為整數(如果存在) |
None |
urllib.robotparser
urllib.robotparser 用於解析 robots.txt 檔案。
robots.txt(統一小寫)是一種存放於網站根目錄下的 robots 協議,它通常用於告訴搜尋引擎對網站的抓取規則。
urllib.robotparser 提供了 RobotFileParser 類,語法如下:
class urllib.robotparser.RobotFileParser(url='')
這個類提供了一些可以讀取、解析 robots.txt 檔案的方法:
-
set_url(url) - 設定 robots.txt 檔案的 URL。
-
read() - 讀取 robots.txt URL 並將其輸入解析器。
-
parse(lines) - 解析行引數。
-
can_fetch(useragent, url) - 如果允許 useragent 按照被解析 robots.txt 檔案中的規則來獲取 url 則返回 True。
-
mtime() -返回最近一次獲取 robots.txt 檔案的時間。 這適用於需要定期檢查 robots.txt 檔案更新情況的長時間執行的網頁爬蟲。
-
modified() - 將最近一次獲取 robots.txt 檔案的時間設定為當前時間。
-
crawl_delay(useragent) -為指定的 useragent 從 robots.txt 返回 Crawl-delay 形參。 如果此形參不存在或不適用於指定的 useragent 或者此形參的 robots.txt 條目存在語法錯誤,則返回 None。
-
request_rate(useragent) -以 named tuple RequestRate(requests, seconds) 的形式從 robots.txt 返回 Request-rate 形參的內容。 如果此形參不存在或不適用於指定的 useragent 或者此形參的 robots.txt 條目存在語法錯誤,則返回 None。
-
site_maps() - 以 list() 的形式從 robots.txt 返回 Sitemap 形參的內容。 如果此形參不存在或者此形參的 robots.txt 條目存在語法錯誤,則返回 None。
例項
>>> rp = urllib.robotparser.RobotFileParser()
>>> rp.set_url("http://www.musi-cal.com/robots.txt")
>>> rp.read()
>>> rrate = rp.request_rate("*")
>>> rrate.requests
3
>>> rrate.seconds
20
>>> rp.crawl_delay("*")
6
>>> rp.can_fetch("*", "http://www.musi-cal.com/cgi-bin/search?city=San+Francisco")
False
>>> rp.can_fetch("*", "http://www.musi-cal.com/")
True