使用 lxml 中的 xpath 高效提取文本与标签属性值

最新推荐文章于 2024-07-25 17:43:53 发布

寸草心2130

最新推荐文章于 2024-07-25 17:43:53 发布

阅读量6.4k

点赞数 2

分类专栏：爬虫 python 文章标签：爬虫lxml

本文链接：https://blog.csdn.net/qq_35531549/article/details/87983243

版权

本文介绍了如何使用 lxml 库中的 xpath 语法高效地从 HTML 文档中定位并提取文本和标签属性值。通过示例展示了如何选取特定的 div、h1 等元素，获取文本内容，以及提取 a 和 img 元素的 href 和 src 属性。此外，还探讨了元素查找的进阶技巧，如 find 和 findall 方法。

摘要由CSDN通过智能技术生成

# 我们爬取网页的目的，无非是先定位到DOM树的节点，然后取其文本或属性值

myPage = '''<html>
        <title>TITLE</title>
        <body>
        <h1>我的博客</h1>
        <div>我的文章</div>
        <div id="photos">
         <img src="pic1.jpeg"/><span id="pic1">PIC1 is beautiful!</span>
         <img src="pic2.jpeg"/><span id="pic2">PIC2 is beautiful!</span>
         <p><a href="http://www.example.com/more_pic.html">更多美图</a></p>
         <a href="http://www.baidu.com">去往百度</a>
         <a href="http://www.163.com">去往网易</a>
         <a href="http://www.sohu.com">去往搜狐</a>
        </div>
        <p class="myclassname">Hello,\nworld!<