一个简单的ajax爬虫(今日头条)

这里只是简单的把image_list里面的image_url提取出来,具体的结构化编程请自行编写。

import requests
from urllib.parse import urlencode

params = {
    'aid': 24,
    'app_name': 'web_search',
    'offset': 0,
    'format': 'json',
    'keyword': '街拍',
    'autoload': 'true',
    'count': 20,
    'en_qc': 1,
    'cur_tab': 1,
    'from': 'search_tab',
    'pd': 'synthesis',
    'timestamp': 1583996635550,
    '_signature': 'OeQwkAAgEBD.s4kdPmRnbTnlcYAAGeU8wq5tsZ-LY-cgKJxWpkh1SR0knLZinWhBvThA9ExwTlkT5e53XdDTaQ.J7sF6IObokwGfv5IFtDIp8xg5ZxvhRdt424k7BL.1trF',
}

headers = {
    'cookie': 'tt_webid=6788065855508612621; WEATHER_CITY=%E5%8C%97%E4%BA%AC; tt_webid=6788065855508612621; csrftoken=495ae3a5659fcdbdb78e255464317789; s_v_web_id=k66hcay0_qsRG7emW_x2Qj_4R3o_AeAG_iT4JWmz83jzr; __tasessionId=23dn3qk0f1580738708512',
    'referer': 'https://www.toutiao.com/search/?keyword=%E8%A1%97%E6%8B%8D',
    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36',
    'x-requested-with': 'XMLHttpRequest'
}

url = 'https://www.toutiao.com/api/search/content/?' + urlencode(params)

print(url)

response = requests.get(url, headers=headers).json()

x = response['data']

for i in x:
    try:
        image_list = i['image_list']
        for i in image_list:
            print(i['url'])
    except KeyError as e:
        print('pass')
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值