python爬虫（五）：实战【4. 爬亚马逊】

最新推荐文章于 2024-07-24 11:41:15 发布

ant_yi

最新推荐文章于 2024-07-24 11:41:15 发布

阅读量3.2w

点赞数 10

分类专栏： python学习文章标签： python 爬虫

本文链接：https://blog.csdn.net/weixin_42490528/article/details/84926574

版权

目标：在亚马逊网站搜索商品，爬取前10页的商品（名字和价格）

第一步：访问网站，隐藏爬虫

亚马逊对爬虫限制比较严格，修改headers、cookies、代理ip

获取cookie：f12在console输入document.cookie()

注意：cookies格式为字典，{'a':'1','b':'2','c':'3'}

最好自己手动替换，我用记事本替换=为:就出错了，因为cookies内部也有=

import requests

url = 'https://www.amazon.cn/s/field-keywords=spark'

head = {'user-agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

proxy_id = { "http": "http://61.135.155.82:443"}

cookie = {'session-id':'459-4568418-5692641','ubid-acbcn':'459-5049899-3055220','x-wl-uid':'1AK7YMFc9IzusayDn2fT6Topjz3iAOpR3EeA2UQSqco8fo5PbK2aCpyBA/fdPMfKFqZRHc4IeyuU=','session-token':'OH1wPvfOj6Tylq2nnJcdn5wyxycR/lqyGsGU3+lUtU4mbC0ZD9s8/4Oihd1BlskUQG8zRbLVs9vfWXuiJmnRlDT4x35ircp2uLxOLNYQ4j5pzdFJIqqoZUnhHSJUq2yK80P3LqH8An7faXRCPW9BIqX1wu0WmHlSS9vYAPKA/2SGdV9b//EljYjIVCBjOuR/dKRiYEeGK3li0RJOVz7+vMWg7Rnzbx89QxlbCp0WyquZyVxG6f2mNw=="','session-id-time':'2082787201l'}

r = requests.get(url,headers=head,proxies=proxy_id,cookies=cookie)

r.encoding = r.apparent_encoding

r.text