python爬虫爬取某宝化妆品信息

  • 进入淘宝网站,登录账户,搜索化妆品,去掉url里的无关参数,然后找到url如下
https://s.taobao.com/search?q=%E5%8C%96%E5%A6%86%E5%93%81
  • 右击检查,点击Network,Response刷新,得到以下界面
    在这里插入图片描述
    在这里插入图片描述
  • 按Ctrl+F搜索某一个商品的信息,比如第一个,搜索198.00,如下图
    在这里插入图片描述
  • 然后就看见了商品的信息也在这一行,也是以json字典的格式存储的
    在这里插入图片描述
  • 大概思路了解了,现在开始写代码了,要复制cookie和useragent,淘宝还是有一定反爬措施的。
    在这里插入图片描述
    在这里插入图片描述
  • 代码
import re
import requests
import time

url = "https://s.taobao.com/search?q=%E5%8C%96%E5%A6%86%E5%93%81&imgfile=&commend=all&ssid=s5-e&search_type=item&sourceId=tb.index&spm=a21bo.21814703.201856-taobao-item.1&ie=utf8&initiative_id=tbindexz_20170306"

data = list()


# 请求首页函数
def get_data(url):
    headers = {
        'User-Agent': '自己从网页复制的',
        'Cookie': '自己从网页复制的'
    }

    res = requests.get(url=url, headers=headers)
    if res.status_code == 200:
        print("请求成功")
    response = res.content.decode('utf8')
    return response

def parse_data(response):
    #商品名,价格,成交额,店铺名称
    shangpinming = re.findall(r'"raw_title":"(.*?)"', response)
    print(shangpinming)
    danjia = re.findall(r'"view_price":"(.*?)"', response)
    print(danjia)
    chengjiaoe = re.findall(r'"view_sales":"(.*?)人付款"', response)
    print(chengjiaoe)
    dianpumingcheng = re.findall(r'"nick":"(.*?)"',response)
    print(dianpumingcheng)
    
# 执行函数 主程序
def main(num):
    url = "https://s.taobao.com/search?q=%E5%8C%96%E5%A6%86%E5%93%81&imgfile=&commend=all&ssid=s5-e&search_type=item&sourceId=tb.index&spm=a21bo.21814703.201856-taobao-item.1&ie=utf8&initiative_id=tbindexz_20170306"
    html = get_data(url)
    if html:
        response = get_data(url)
        df = parse_data(response)
        print(df)


if __name__ == '__main__':
    for i in range(1, 10):
        main(i)
        time.sleep(2)

  • 运行结果
    在这里插入图片描述

  • 随后将数据存入表中即可,这里数据提取用的是正则,我简单列举一部分用法
    在这里插入图片描述
    在这里插入图片描述

  • 4
    点赞
  • 23
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 4
    评论
Python爬虫是一种利用Python编程语言编写的网络数据抓取工具。它可以自动化地获取、解析和存储互联网上的各种信息。而考试宝是一个提供在线考试服务的平台,它提供了丰富的考试题库和在线考试系统。 首先,爬虫可以帮助我们从考试宝的网站上获取考试题目和答案等相关信息。通过向目标网站发送请求,爬虫可以获取网页源代码,并且可以使用Python的相关库对网页进行解析,提取我们所需要的数据。比如,我们可以使用BeautifulSoup库来提取网页中的题目、选项和答案等内容,然后将其保存到本地文件或数据库中,以供后续分析和使用。 此外,爬虫还可以帮助我们实现自动化的考试刷题。我们可以编写Python脚本来模拟用户的行为,自动登录考试宝平台,选择相应的考试科目和难度等级,并自动点击进入考试模式。然后,我们可以使用爬虫网页源代码中提取题目信息,并根据我们的策略自动选择答案并提交。这样,我们就可以通过编写脚本来实现考试题目的自动化答题功能。 总之,Python爬虫可以帮助我们有效地获取和利用考试宝平台上的考试信息。通过编写相应的脚本,我们可以实现题目信息的自动下载和答题功能,提高刷题的效率和准确性。当然,在使用爬虫的过程中,我们需要遵守相关网站的规定和法律法规,尊重知识产权,避免对考试宝平台造成不良影响。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 4
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

铃音.

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值