scrapy+redis+mongo 爬取万表网

  • 爬取目标:

万表网上商品的每个商品的商品名称,商品价格,店铺名称,商品编号,商品型号,商品品牌,商品销量,商品参数

  • 环境说明:
    scrapy + redis(对请求过滤去重) + mongo(存储数据)

  • 爬取页面分析

列表页获取数据
    构造分页
        获取手表名xpath: //script[@type="text/javascript"][2]/text()
            正则匹配出手表名称 "brandEnName":"(.*?)"


    获取商品总数:
        xpath: //input[@id="total_goods"]/@value
        计算分页:(math.celling(total / 48))

    列表页商品详情页链接  
        xpath://div[@id="s_goods_list"]/ul/li//a[contains(@class,"s_goods_name")]/@href
        对匹配到的数据取商品ID 需要在详情页构造url请求使用

详情页信息(数据动态加载):
    模拟ajax请求:
        url: https://www.wbiao.cn/goods/goodsData?goodsCode=4654
        获取:title, modelnumber, pid, sales, brand, price

商品描述xpath://div[@class="format_content"]/div[contains(@class,"format_content_container")]/div[contains(@class,"right")]/div[contains(@class,"right_a")]//text()
店铺名称://div[@class="Bread_content"]/div[contains(@class,"Bread_content_right")]/span[@class="right_b"]/a/text()

详见代码:
https://github.com/alicewut/wanbiaomarket

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值