Python大神利用正则表达式教你搞定京东商品信息

最新推荐文章于 2023-12-27 17:57:56 发布

Python_xiaobang

最新推荐文章于 2023-12-27 17:57:56 发布

阅读量339

点赞数 1

分类专栏： python编程程序员 python 文章标签：字符串人工智能 python 正则表达式数据挖掘

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/Python_xiaobang/article/details/112564084

版权

京东（JD.com）是中国最大的自营式电商企业，2015年第一季度在中国自营式B2C电商市场的占有率为56.3%。如此庞大的一个电商网站，上面的商品信息是海量的，小编今天就带小伙伴利用正则表达式，并且基于输入的关键词来实现主题爬虫。

首先进去京东网，输入自己想要查询的商品，小编在这里以关键词“狗粮”作为搜索对象，之后得到后面这一串网址：https://search.jd.com/Search?keyword=%E7%8B%97%E7%B2%AE&enc=utf-8，其实参数%E7%8B%97%E7%B2%AE解码之后就是“狗粮”的意思。那么非常明显，只要输入keyword这个参数之后，将其进行编码，就可以获取到我们的目标网址了，请求网页，得到响应，尔后利用选择器便可以进行下一步的精准采集了。

在京东网上，狗粮信息在京东官网上的网页源码如下图所示：

狗粮信息在京东官网上的网页源码

话不多说，直接撸代码，如下图所示。小编用的是py3，也建议大家以后多用py3版本。通常URL编码的方式是把需要编码的字符转化为%xx的形式，一般来说URL的编码是基于UTF-8的，当然也有的于浏览器平台有关。在Python的urllib库中提供了quote方法，可以实现对URL的字符串进行编码，从而可以进入到对应的网页中去。

正则表达式，又称正规表示式、正规表示法、正规表达式、规则表达式、常规表示法（英语：Regular Expression，在代码中常简写为regex、regexp或RE&#x

最低0.47元/天解锁文章

Python_xiaobang

关注

1
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
Python大神利用正则表达式教你搞定京东商品信息

京东（JD.com）是中国最大的自营式电商企业，2015年第一季度在中国自营式B2C电商市场的占有率为56.3%。如此庞大的一个电商网站，上面的商品信息是海量的，小编今天就带小伙伴利用正则表达式，并且基于输入的关键词来实现主题爬虫。首先进去京东网，输入自己想要查询的商品，小编在这里以关键词“狗粮”作为搜索对象，之后得到后面这一串网址：https://search.jd.com/Search?keyword=%E7%8B%97%E7%B2%AE&enc=utf-8，其实参数%E7%8B%97%E7%
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。