python使用sessions模擬登入淘寶

阿新 • • 發佈：2018-11-09

之前想爬取一些淘寶的資料，後來發現需要登入，找了很多的資料，有個使用request的sessions加上cookie來登入的，cookie的獲取在登入後使用開發者工具可以找到。不過這個登入後獲得的網頁的程式碼是靜態的，獲取動態網頁還得另尋他法，一般需要的資料可以在網頁的原始碼中得到，但是你知道的，有些動態載入的就不是那麼簡單了，而且我發現這樣獲得的原始碼中，有些想要獲取的資料的格式是經過改動的，比如我要某個商品的具體連結，發現並不能直接使用。總體而言，這是一次失敗的嘗試，不過倒是瞭解到使用sessions和cookies可以進到需要登入的網頁，也算是一種方式吧。

記錄一下失敗的一次

import 
 requests
import os
import json
from pyquery import PyQuery as pq
import re
import time

sessions = requests.session()
url = 'https://s.taobao.com/search?q=ipad'

sessions.headers['User-Agent'] = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_9_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.131 Safari/537.36 
'
sessions.headers['cookie']='miid=8428352431475518963; hng=CN***********; cna=IzulExo***************; thw=cn; __guid=15467**********; enc=Ubrfp%2******************************************************; t=5********************1e0; tracknick=%5*********3; lgc=40***3; tg=0; x=e%3D1%26p%3D*%26s%3D0%26c%3D0%26f%3D0%26g%3D0%26t%3D0%26__ll%3D-1%26_ato%3D0; cookie2=393e1f359e39e184059e8c87422bb5ce; v=0; _tb_token_=e7e035bee1ae8; _m_h5_tk=ebb49583b4434c3ff9f4bb277236a5d2_1541089384718; _m_h5_tk_enc=b0dd87431f8ade45b56bccb4982c0bf4; alitrackid=world.taobao.com; swfstore=29789; unb=3159140427; sg=374; _l_g_=Ug%3D%3D; skt=c9446f78d9091af3; cookie1=AHt5ehB%2FBw25k99NwMwTM4z3CWVA2J%2FVUVn4V3D2TMk%3D; csg=7b6476e0; uc3=vt3=F8dByRjNVxN9vRJQjTQ%3D&id2=UNGToApZ%2B2dYHA%3D%3D&nk2=sECE1uX4Wg%3D%3D&lg2=VFC%2FuZ9ayeYq2g%3D%3D; existShop=MTU0MTA4NzI2Ng%3D%3D; _cc_=Vq8l%2BKCLiw%3D%3D; dnk=%5Cu6C38%5Cu65E0%5Cu540D3; _nk_=%5Cu6C38%5Cu65E0%5Cu540D3; cookie17=UNGToApZ%2B2dYHA% 
'

for i in range(1):
    strs=str(i*44)
    urls=url+'&s='+strs
    
    html=sessions.get(urls).text
    doc=pq(html)
    
    doc=str(doc)
    os.chdir(r'G:\PS\PY')
    contentss=[]

    htmls=re.compile(r'p4pTags(.*?)"risk"')     
    garbage=re.compile(r'itemlist(.*?)"risk"')
    gb=garbage.findall(doc,re.S|re.M)
    finhtml=htmls.findall(doc,re.S|re.M)
    finhtml=finhtml+gb

    print(len(finhtml))
    #提取資訊的正則表示式
    raw_title=r'"raw_title":"(.*?)"'
    view_price= r'"view_price":"(.*?)"' #價格
    view_fee=r'"view_fee":"(.*?)"'      #折扣
    item_loc = r'"item_loc":"(.*?)"' #地區
    view_sales = r'"view_sales":"(.*?)"' #付款人數
    comment_count = r'"comment_count":"(.*?)"' #評論數
    detail_url=r'"detail_url":"(.*?)"'     #url       

    for html in finhtml:
        rtitle=re.findall(raw_title,html)
        price=re.findall(view_price,html)
        fee=re.findall(view_fee,html)
        loc=re.findall(item_loc,html)
        sales= re.findall(view_sales,html)
        comment=re.findall(comment_count,html)
        deurl=re.findall(detail_url,html)
        for rt,p,f,l,s,c,u in zip(rtitle,price,fee,loc,sales,comment,deurl):
            contentss.append({"raw_title":rt,"view_price":p,"view_fee":f,"item_loc":l,"view_sales":s,"comment_count":c,"detail_url":u})    
    with open('ipad.json','a',encoding='utf-8') as file:
        file.write(json.dumps(contentss,indent=2,ensure_ascii=False))
    time.sleep(2)#訪問間隔

python使用sessions模擬登入淘寶

python使用sessions模擬登入淘寶

Python模擬登入淘寶

day 14 作業模擬手機淘寶-----（登入註冊--購買商品---結算）

selenium+python自動化84-chrome手機wap模式（登入淘寶頁面）

selenium模擬登陸淘寶網並且將‘衣服’相關資訊下載儲存在mysql資料庫

淘寶試用模擬點擊程序

使用Selenium模擬瀏覽器抓取淘寶商品美食信息

Selenium Firefox淘寶自動登入試驗

16-使用Selenium模擬瀏覽器抓取淘寶商品美食資訊

模擬淘寶的產品SKU資訊新增組合

淘寶 OAuth2.0 的登入驗證與授權

selenium + Chrome 模擬瀏覽器爬淘寶資訊

Python2.7 淘寶爬蟲selenium 模擬瀏覽器

模擬用戶登錄爬取淘寶數據

Chrome瀏覽器外掛開發－淘寶自動登入

Python 淘寶系列(三)：模擬登陸成功後獲取購物車資訊

淘寶自動登入2.0，新增Cookies序列化

Python模擬登入豆瓣網，並爬取小組信息

聊聊淘寶天貓個性化推薦技術演進史

淘寶數據庫OceanBase SQL編譯器部分源代碼閱讀--解析SQL語法樹

python使用sessions模擬登入淘寶

相關推薦