Python 爬蟲——爬取小說 | 探索白子畫和花千骨的愛恨情仇

阿新 • • 發佈：2019-01-16

知識就像碎布，記得“縫一縫”，你才能華麗麗地亮相。

1.Beautiful Soup

1.Beautifulsoup 簡介

此次實戰從網上爬取小說，需要使用到Beautiful Soup。
Beautiful Soup為python的第三方庫，可以幫助我們從網頁抓取資料。
它主要有如下特點：

1.Beautiful Soup可以從一個HTML或者XML提取資料，它包含了簡單的處理、遍歷、搜尋文件樹、修改網頁元素等功能。可以通過很簡短地程式碼完成我們地爬蟲程式。
2.Beautiful Soup幾乎不用考慮編碼問題。一般情況下，它可以將輸入文件轉換為unicode編碼，並且以utf-8編碼方式輸出，

2.Beautiful Soup安裝

win命令列下：

Python

pip install beautifusoup4

1	pip install beautifusoup4

3.Beautiful Soup基礎

大家可以參考文件來學習（中文版的哦）：

Python

[http://beautifulsoup.readthedocs.io/zh_CN/latest/#id8]

1	[http://beautifulsoup.readthedocs.io/zh_CN/latest/#id8]

對於本次爬蟲任務，只要瞭解以下幾點基礎內容就可以完成：
1.Beautiful Soup的物件種類：

Tag
Navigablestring
BeautifulSoup
Comment

2.遍歷文件樹：find、find_all、find_next和children
3.一點點HTML和CSS知識（沒有也將就，現學就可以）

2.爬取小說花千骨

1.爬蟲思路分析

本次爬取小說的網站為136書屋。

先開啟花千骨小說的目錄頁，是這樣的。

我們的目的是找到每個目錄對應的url，並且爬取其中地正文內容，然後放在本地檔案中。

2.網頁結構分析

首先，目錄頁左上角有幾個可以提高你此次爬蟲成功後成就感的字眼：暫不提供花千骨txt全集下載。

繼續往下看，發現是最新章節板塊，然後便是全書的所有目錄。我們分析的物件便是全書所有目錄。點開其中一個目錄，我們便可以都看到正文內容。

按F12開啟審查元素選單。可以看到網頁前端的內容都包含在這裡。

我們的目的是要找到所有目錄的對應連結地址，爬取每個地址中的文字內容。

有耐心的朋友可以在裡面找到對應的章節目錄內容。有一個簡便方法是點選審查元素中左上角箭頭標誌的按鈕，然後選中相應元素，對應的位置就會加深顯示。

這樣我們可以看到，每一章的連結地址都是有規則地存放在<li>中。而這些<li>又放在<div id=”book_detail” class=”box1″>中。

我不停地強調“我們的目的”是要告訴大家，思路很重要。爬蟲不是約pao，矇頭就上不可取。

3.單章節爬蟲

剛才已經分析過網頁結構。我們可以直接在瀏覽器中開啟對應章節的連結地址，然後將文字內容提取出來。

我們要爬取的內容全都包含在這個<div>裡面。

程式碼整理如下：

Python

from urllib import request
from bs4 import BeautifulSoup

if __name__ == '__main__':
    # 第8章的網址
    url = 'http://www.136book.com/huaqiangu/ebxeew/'
    head = {}
    # 使用代理
    head['User-Agent'] = 'Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19'
    req = request.Request(url, headers = head)
    response = request.urlopen(req)
    html = response.read()
    # 建立request物件
    soup = BeautifulSoup(html, 'lxml')
    # 找出div中的內容
    soup_text = soup.find('div', id = 'content')
    # 輸出其中的文字
    print(soup_text.text)

123456789101112131415161718

fromurllibimportrequestfrombs4 importBeautifulSoupif__name__=='__main__':# 第8章的網址url='http://www.136book.com/huaqiangu/ebxeew/'head={}# 使用代理head['User-Agent']='Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166 Safari/535.19'req=request.Request(url,headers=head)response=request.urlopen(req)html=response.read()# 建立request物件soup=BeautifulSoup(html,'lxml')# 找出div中的內容soup_text=soup.find('div',id='content')# 輸出其中的文字print(soup_text.text)

執行結果如下：

這樣，單章節內容爬取就大功告成了。

4.小說全集爬蟲

單章節爬蟲我們可以直接開啟對應的章節地址解析其中的文字，全集爬蟲我們不可能讓爬蟲程式在每章節網頁內中跑一遍，如此還不如複製、貼上來的快。

我們的思路是先在目錄頁中爬取所有章節的連結地址，然後再爬取每個連結對應的網頁中的文字內容。說來，就是比單章節爬蟲多一次解析過程，需要用到Beautiful Soup遍歷文件樹的內容。

1.解析目錄頁

在思路分析中，我們已經瞭解了目錄頁的結構。所有的內容都放在一個所有的內容都放在一個<div id=”book_detail” class=”box1″>中。

這兒有兩個一模一樣的<div id=”book_detail” class=”box1″>。

第一個<div>包含著最近更新的章節，第二個<div>包含著全集內容。

請注意，我們要爬取的是第二個<div>中的內容。

程式碼整理如下：

Python

from urllib import request
from bs4 import BeautifulSoup

if __name__ == '__main__':
    # 目錄頁
    url = 'http://www.136book.com/huaqiangu/'
    head = {}
    head['User-Agent'] = 'Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19'
    req = request.Request(url, headers = head)
    response = request.urlopen(req)
    html = response.read()
    # 解析目錄頁
    soup = BeautifulSoup(html, 'lxml')
    # find_next找到第二個<div>
    soup_texts = soup.find('div', id = 'book_detail', class_= 'box1').find_next('div')
    # 遍歷ol的子節點，打印出章節標題和對應的連結地址
    for link in soup_texts.ol.children:
        if link != '\n':
            print(link.text + ':  ', link.a.get('href'))

12345678910111213141516171819

fromurllibimportrequestfrombs4 importBeautifulSoupif__name__=='__main__':# 目錄頁url='http://www.136book.com/huaqiangu/'head={}head['User-Agent']='Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166 Safari/535.19'req=request.Request(url,headers=head)response=request.urlopen(req)html=response.read()# 解析目錄頁soup=BeautifulSoup(html,'lxml')# find_next找到第二個<div>soup_texts=soup.find('div',id='book_detail',class_='box1').find_next('div')# 遍歷ol的子節點，打印出章節標題和對應的連結地址forlink insoup_texts.ol.children:iflink!='\n':print(link.text+': ',link.a.get('href'))

執行結果如圖：

2.爬取全集內容

將每個解析出來的連結迴圈代入到url中解析出來，並將其中的文字爬取出來，並且寫到本地F：/huaqiangu.txt中。
程式碼整理如下：

Python

from urllib import request
from bs4 import BeautifulSoup

if __name__ == '__main__':
    url = 'http://www.136book.com/huaqiangu/'
    head = {}
    head['User-Agent'] = 'Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19'
    req = request.Request(url, headers = head)
    response = request.urlopen(req)
    html = response.read()
    soup = BeautifulSoup(html, 'lxml')
    soup_texts = soup.find('div', id = 'book_detail', class_= 'box1').find_next('div')
    # 開啟檔案
    f = open('F:/huaqiangu.txt','w')
    # 迴圈解析連結地址
    for link in soup_texts.ol.children:
        if link != '\n':
            download_url = link.a.get('href')
            download_req = request.Request(download_url, headers = head)
            download_response = request.urlopen(download_req)
            download_html = download_response.read()
            download_soup = BeautifulSoup(download_html, 'lxml')
            download_soup_texts = download_soup.find('div', id = 'content')
            # 抓取其中文字
            download_soup_texts = download_soup_texts.text
            # 寫入章節標題
            f.write(link.text + '\n\n')
            # 寫入章節內容
            f.write(download_soup_texts)
            f.write('\n\n')
    f.close()

12345678910111213141516171819202122232425262728293031

fromurllibimportrequestfrombs4 importBeautifulSoupif__name__=='__main__':url='http://www.136book.com/huaqiangu/'head={}head['User-Agent']='Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166 Safari/535.19'req=request.Request(url,headers=head)response=request.urlopen(req)html=response.read()soup=BeautifulSoup(html,'lxml')soup_texts=soup.find('div',id='book_detail',class_='box1').find_next('div')# 開啟檔案f=open('F:/huaqiangu.txt','w')# 迴圈解析連結地址forlink insoup_texts.ol.children:iflink!='\n':download_url=link.a.get('href')download_req=request.Request(download_url,headers=head)download_response=request.urlopen(download_req)download_html=download_response.read()download_soup=BeautifulSoup(download_html,'lxml')download_soup_texts=download_soup.find('div',id='content')# 抓取其中文字download_soup_texts=download_soup_texts.text# 寫入章節標題f.write(link.text+'\n\n')# 寫入章節內容f.write(download_soup_texts)f.write('\n\n')f.close()

執行結果顯示 [Finished in 32.3s] 。

開啟F盤檢視花千骨檔案。

爬蟲成功。備好紙巾，快快去感受尊上和小骨的虐戀吧。

5.總結

程式碼還有很多改進的地方。例如文字中包含廣告的js程式碼可以去除，還可以加上爬蟲進度顯示等等。實現這些功能需要包含正則表示式和os模組知識，就不多說了，大家可以繼續完善。

碼字辛苦，碼程式碼費神，文字和程式碼同碼更是艱辛無比。如果您覺得文章有那麼一丟丟價值，請不要吝嗇您的讚賞。

Python 爬蟲——爬取小說 | 探索白子畫和花千骨的愛恨情仇

1.Beautiful Soup

1.Beautifulsoup 簡介

2.Beautiful Soup安裝

3.Beautiful Soup基礎

2.爬取小說花千骨

1.爬蟲思路分析

2.網頁結構分析

3.單章節爬蟲

4.小說全集爬蟲

1.解析目錄頁

2.爬取全集內容

5.總結

Python 爬蟲——爬取小說 | 探索白子畫和花千骨的愛恨情仇

python爬蟲爬取全站url，完美小demo（可防止連結到外網等各種強大篩選）

Python爬蟲-爬取糗事百科段子

python爬蟲爬取頁面源碼在本頁面展示

python 爬蟲爬取證券之星網站

python爬蟲爬取海量病毒文件

用Python爬蟲爬取廣州大學教務系統的成績（內網訪問）

python爬蟲——爬取古詩詞

利用Python爬蟲爬取淘寶商品做數據挖掘分析實戰篇，超詳細教程

Python爬蟲 - 爬取百度html代碼前200行

簡易python爬蟲爬取boss直聘職位，並寫入excel

Python 爬蟲爬取微信文章

python爬蟲爬取QQ說說並且生成詞雲圖，回憶滿滿！

Python爬蟲爬取OA幸運飛艇平臺獲取數據

利用python爬蟲爬取圖片並且制作馬賽克拼圖

Python - 爬蟲爬取和登陸github

用Python爬蟲爬取豆瓣電影、讀書Top250並排序

Python爬蟲—爬取小說名著

★ Python爬蟲 - 爬取網頁文字資訊並儲存（美文的爬取與儲存）

python爬蟲爬取代理ip

Python 爬蟲——爬取小說 | 探索白子畫和花千骨的愛恨情仇

1.Beautiful Soup

1.Beautifulsoup 簡介

2.Beautiful Soup安裝

3.Beautiful Soup基礎

2.爬取小說花千骨

1.爬蟲思路分析

2.網頁結構分析

3.單章節爬蟲

4.小說全集爬蟲

1.解析目錄頁

2.爬取全集內容

5.總結

相關推薦