python xpath爬取电影top100_进击的爬虫-002-xpath实现猫眼电影前100爬取

最新推荐文章于 2024-03-17 19:55:50 发布

酥牧奇

最新推荐文章于 2024-03-17 19:55:50 发布

阅读量686

点赞数

文章标签： python xpath爬取电影top100

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_30673759/article/details/114913203

版权

nodename : 选取此节点的所有子节点

/ : 从当前节点选取直接子节点

// : 从当前节点选取子孙节点

. : 选取当前节点

.. : 选取当前节点的父节点

@ : 选取属性

3. 使用

3.1安装lxml库

3.2 基本用法:

from lxml import etree #从lxml 导入etree模块 text = '''html 文档 ''' #声明 HTML文本 html = etree.HTML(text) #调用HTML类, 进行初始化, 构造了一个XPath解析队形, 可以自动修正HTML文本 result = etree.tostring(html) # 调用tostring() 方法即可输出修正后的HTML代码, 结果是bytes类型的, print(result.decode('utf-8')) #利用decode() 方法将其转化成str类型

还可以直接读取文本文件进行解析

html = etree.parse('猫眼.html',etree.HTMLParser()) ret = etree.tostring(html) print(ret.decode('utf-8'))

3.3 找到所有节点

我们一般都会用 // 开头的XPath来选取所有符合要求的节点

from lxml import etree html = etree.parse('猫眼.html', etree.HTMLParser()) ret = html.xpath('//*') #我们使用*代表匹配所有 for i in ret: print(i) #获取的是一个列表,包含了所有的节点 # #每个节点都是一个 Element 类型, 后面跟着节点名称

最低0.47元/天解锁文章

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python xpath爬取电影top100_进击的爬虫-002-xpath实现猫眼电影前100爬取

nodename : 选取此节点的所有子节点/ : 从当前节点选取直接子节点// : 从当前节点选取子孙节点. : 选取当前节点.. : 选取当前节点的父节点@ : 选取属性3. 使用3.1安装lxml库3.2 基本用法:from lxml import etree #从lxml 导入etree模块 text = '''html 文档 ''' #声明 HTML文本 html = etree.HTM...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。