1. 程式人生 > >Python3爬蟲爬取淘寶商品數據

Python3爬蟲爬取淘寶商品數據

表格 name 錯誤處理 from [0 https iat turn 感覺

這次的主要的目的是從淘寶的搜索頁面獲取商品的信息。其實分析頁面找到信息很容易,頁面信息的存放都是以靜態的方式直接嵌套的頁面上的,很容易找到。主要困難是將信息從HTML源碼中剝離出來,數據和網頁源碼結合的很緊密,剝離數據有一定的難度。

然後將獲取的信息寫入excel表格保存起來,這次只爬取了前面10頁 的內容。在運行代碼的過程中發現,30頁後面的數據有問題,出現了手機價格為0的情況,這是不符合實際的,碼也沒有寫錯誤處理的代碼。

這次先寫個粗略的,有點淩亂的感覺,下次有時間再系統的整理整理吧。

import requests
import re
from xlwt import Workbook
import
xlrd import time def key_name( number ): #獲取頁面的內容並返回 name = 手機 URL_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q=" URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s=
" URL = ( URL_1 + name + URL_2 + str(number)) #print(URL) res = requests.get( URL ) return res.text def find_date( text): #根據整個頁面的信息,獲取商品的數據所在的HTML源碼並放回 reg = r,"data":{"spus":\[({.+?)\]}},"header": reg = re.compile(reg) info = re.findall(reg, text) return info[0]
def manipulation_data( info, N, sheet ): #解析獲取的HTML源碼,獲取數據 Date = eval(info) for d in Date: T = " ".join([t[tag] for t in d[tag_info]]) #print(d[‘title‘] + ‘\t‘ + d[‘price‘] + ‘\t‘ + d[‘importantKey‘][0:len(d[‘importantKey‘])-1] + ‘\t‘ + T) sheet.write(N,0,d[title]) sheet.write(N,1,d[price]) sheet.write(N,2,T) N = N + 1 return N def main(): book = Workbook() sheet = book.add_sheet(淘寶手機數據) sheet.write(0,0,品牌) sheet.write(0,1,價格) sheet.write(0,2,配置) book.save(淘寶手機數據.xls) #k用於生成鏈接,每個鏈接的最後面的數字相差48. #N用於記錄表格的數據行數,便於寫入數據 k = 0 N = 1 for i in range(10+1): text = key_name( k + i * 48 ) info = find_date(text) N = manipulation_data( info ,N, sheet ) book.save(淘寶手機數據.xls) print(下載第 + str(i) + 頁完成) if __name__ == __main__: main()

Python3爬蟲爬取淘寶商品數據