Scrapy爬京东

最新推荐文章于 2024-05-06 21:21:57 发布

202danding

最新推荐文章于 2024-05-06 21:21:57 发布

阅读量447

点赞数

分类专栏：爬虫文章标签： python

总体概述
从京东搜索框搜索进入手机进入页面，爬取内容分成两类，一类是手机的基本信息（标题、价格、链接），另一类是评论信息（用户名、评论内容、评论总数等），将信息爬取下来之后，进行数据处理，以方便显示和查看的格式保存下来。

（1）爬虫
爬虫又称网络蜘蛛、网络蚂蚁、网络机器人等，是一种按照一定的规则自动地抓取万维网信息的程序或者脚本，它的原理简单来讲就是通过选定入口URL，模拟HTTP请求，找到页面上想要获取的数据，然后保存下来。
（2）Scrapy框架
Scrapy是Python开发的一个快速、高层次的屏幕抓取和WEB抓取框架，用于抓取web站点并从页面中提取结构化数据。用途比较广泛，可用于数据挖掘、监测和自动化测试。
Scrapy是一个自定义程度很高的框架，任何人都可以根据自己的需求很方便填写或者重写里边的函数。它页提供了多种类型的爬虫基类。
（3）XPath
XPath即为XML路径语言，是一种用来确定文档中某部分位置的语言，XPath基于XML的树状结构，提供在数据结构中寻找节点的能力，也可用于HTML页面。
通过浏览器查看页面源码，找到我们想要的信息的节点位置，然后通过XPath的路径表达式，对节点进行遍历，从而获得数据。

工程文件结构
通过命令行创建一个Scrapy工程文件，文件结构如下图，在这个项目中，主要编写items.py、pipelines.py、setting.py以及sogou.py（爬虫文件）这四个文件。并将手机基本信息储存在mydata.json文件中，评论信息储存在mydata1.json文件中，product_url.txt储存每个商品的链接，这个文件的主要作用是抓取评论时方便读取每个商品额url。

①items.py
因为写了两个爬虫，一个爬取手机信息，一个爬取评论信息，所以我们定义了两个类JdphoneItem和CommentItem

import scrapy

class JdPhoneItem(scrapy.Item):
url = scrapy.Field() #商品链接
title = scrapy.Field() #商品标题
price = scrapy.Field() # 商品价格

class CommentItem(scrapy.Item):
user_name = scrapy.Field() # 用户名
comment_num = scrapy.Field #评论总数
content = scrapy.Fie

最低0.47元/天解锁文章

202danding

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
Scrapy爬京东

总体概述从京东搜索框搜索进入手机进入页面，爬取内容分成两类，一类是手机的基本信息（标题、价格、链接），另一类是评论信息（用户名、评论内容、评论总数等），将信息爬取下来之后，进行数据处理，以方便显示和查看的格式保存下来。（1）爬虫爬虫又称网络蜘蛛、网络蚂蚁、网络机器人等，是一种按照一定的规则自动地抓取万维网信息的程序或者脚本，它的原理简单来讲就是通过选定入口URL，模拟HTTP请求，找到页面上想要获取的数据，然后保存下来。（2）Scrapy框架Scrapy是Python开发的一个快速、高层次的屏幕抓
复制链接

扫一扫