1. 程式人生 > >python3爬蟲-爬取新浪新聞首頁所有新聞標題

python3爬蟲-爬取新浪新聞首頁所有新聞標題

準備工作:安裝requests和BeautifulSoup4。開啟cmd,輸入如下命令

pip install requests
pip install BeautifulSoup4

按F12開啟開發人員工具,點選左上角的圖片,然後再頁面中點選你想檢視的元素:

image_1b9cn3qf33l8r6s1skf1duh1ann9.png-104.2kB

我點選了新聞標題處的元素,檢視到該元素為class=news-item的元素:

image_1b9cn61ap1qc62f57l5isu60m.png-288.5kB

在這裡,我們要獲取新聞的時間,標題和連結,檢視到分別在如下位置:

image_1b9cnc13h1es5tc31iif1a261adr13.png-98.6kB

現在,就可以根據元素的結構編寫爬蟲程式碼了:

import requests
from bs4 import BeautifulSoup

url = 'http://news.sina.com.cn/china/'
res = requests.get(url) # 使用UTF-8編碼 res.encoding = 'UTF-8' # 使用剖析器為html.parser soup = BeautifulSoup(res.text, 'html.parser') #遍歷每一個class=news-item的節點 for news in soup.select('.news-item'): h2 = news.select('h2') #只選擇長度大於0的結果 if len(h2) > 0: #新聞時間 time = news.select('.time'
)[0].text #新聞標題 title = h2[0].text #新聞連結 href = h2[0].select('a')[0]['href'] #列印 print(time, title, href)

執行程式,結果如下圖所示:

image_1b9cndiud9cs1oleisart8hb61g.png-201.9kB