python3爬蟲-爬取新浪新聞首頁所有新聞標題
阿新 • • 發佈:2019-02-08
準備工作:安裝requests和BeautifulSoup4。開啟cmd,輸入如下命令
pip install requests
pip install BeautifulSoup4
按F12開啟開發人員工具,點選左上角的圖片,然後再頁面中點選你想檢視的元素:
我點選了新聞標題處的元素,檢視到該元素為class=news-item的元素:
在這裡,我們要獲取新聞的時間,標題和連結,檢視到分別在如下位置:
現在,就可以根據元素的結構編寫爬蟲程式碼了:
import requests
from bs4 import BeautifulSoup
url = 'http://news.sina.com.cn/china/'
res = requests.get(url)
# 使用UTF-8編碼
res.encoding = 'UTF-8'
# 使用剖析器為html.parser
soup = BeautifulSoup(res.text, 'html.parser')
#遍歷每一個class=news-item的節點
for news in soup.select('.news-item'):
h2 = news.select('h2')
#只選擇長度大於0的結果
if len(h2) > 0:
#新聞時間
time = news.select('.time' )[0].text
#新聞標題
title = h2[0].text
#新聞連結
href = h2[0].select('a')[0]['href']
#列印
print(time, title, href)
執行程式,結果如下圖所示: