就业实训#day2

最新推荐文章于 2023-09-15 13:46:01 发布

weixin_48173015

最新推荐文章于 2023-09-15 13:46:01 发布

阅读量286

点赞数

文章标签： python 开发语言

本文链接：https://blog.csdn.net/weixin_48173015/article/details/125068314

版权

本文介绍了XPath在Python中使用lxml库解析HTML文档的方法，包括安装、基本用法以及XPath方法的返回结果类型。同时，通过实例展示了如何提取特定类名的li标签内的a标签内容和链接。此外，还讲解了文件操作的基本步骤，包括写入和读取文件的内容。通过这些知识，读者可以更好地理解和应用XML和HTML解析以及文件操作。

摘要由CSDN通过智能技术生成

1.Xpath

1.安装 pip/pip3 install lxml
2.使用
导入lxml 的 etree 库
from lxml import etree
利用etree.HTML，将html字符串（bytes类型或str类型）转化为Element对象，Element对象具有
xpath的方法，返回结果的列表
html = etree.HTML(text)
ret_list = html.xpath(“xpath语法规则字符串”)
3. xpath方法返回列表的三种情况
返回空列表：根据xpath语法规则字符串，没有定位到任何元素
返回由字符串构成的列表：xpath字符串规则匹配的一定是文本内容或某属性的值
返回由Element对象构成的列表：xpath规则字符串匹配的是标签，列表中的Element对象可
以继续进行xpath

4.练习将下面的html文档字符串中，将每个class为item-1的li标签作为1条新闻数据。提取a标签的文本
内容以及链接，组装成一个字典。
注意：：先分组，再提取数据，可以避免数据的错乱，对于空值要进行判断

在这里插入图片描述

2. 文件操作

1.写
1打开文件
f = open(‘test.txt’, ‘w’)
2文件写入
f.write(‘hello world’)
3关闭文件
f.close()

2.读
f = open(‘test.txt’)
content = f.readlines()
[‘hello world\n’, ‘abcdefg\n’, ‘aaa\n’, ‘bbb\n’, ‘ccc’]
print(content)
关闭文件
f.close()

在这里插入图片描述

weixin_48173015

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
就业实训#day2

1.Xpath1.安装 pip/pip3 install lxml2.使用导入lxml 的 etree 库from lxml import etree利用etree.HTML，将html字符串（bytes类型或str类型）转化为Element对象，Element对象具有xpath的方法，返回结果的列表html = etree.HTML(text)ret_list = html.xpath(“xpath语法规则字符串”)3. xpath方法返回列表的三种情况返回空列表：根据xpath语法规
复制链接

扫一扫