Python中利用xpath解析HTML

最新推荐文章于 2024-06-08 11:12:05 发布

jaray

最新推荐文章于 2024-06-08 11:12:05 发布

阅读量2.7k

点赞数

本文链接：https://blog.csdn.net/jaray/article/details/104524721

版权

本文介绍了在Python中使用lxml库解析HTML并利用xpath进行节点定位的方法。通过对比jQuery和正则表达式，强调了xpath在处理复杂页面结构时的优势。文章提供了一个示例，演示如何通过xpath找到特定内容，并解释了基本的xpath语法，包括节点定位、属性过滤、文本获取等。

摘要由CSDN通过智能技术生成

在进行网页抓取的时候，分析定位html节点是获取抓取信息的关键，目前我用的是lxml模块(用来分析XML文档结构的，当然也能分析html结构)，利用其lxml.html的xpath对html进行分析，获取抓取信息。

　　首先，我们需要安装一个支持xpath的python库。目前在libxml2的网站上被推荐的python binding是lxml，也有beautifulsoup，不嫌麻烦的话还可以自己用正则表达式去构建，本文以lxml为例讲解。

假设有如下的HTML文档:

 1 <html>
 2   <body>
 3     <form>
 4       <div id='leftmenu'>
 5         <h3>text</h3>
 6         <ul id=’china’><!-- first location -->
 7           <li>...</li>
 8           <li>...</li>
 9              ......
10         </ul>
11         <ul id=’england’><!-- second location-->
12           <li>...</li>
13           <li>...</li>
14              ......
15         </ul>
16       </div>
17     </form>
18   </body>
19 </html>