python中的Xpath方法总结

最新推荐文章于 2024-05-30 15:53:12 发布

埃菲尔没有塔尖

最新推荐文章于 2024-05-30 15:53:12 发布

阅读量9.8k

点赞数 18

分类专栏：【Python爬虫】

本文链接：https://blog.csdn.net/weixin_38819889/article/details/103233148

版权

【Python爬虫】专栏收录该内容

38 篇文章 30 订阅

订阅专栏

说在前面：

由于目前一直在做爬虫，之前常使用requests模块，现在改用scrapy框架。在解析页面元素的时候，本人常常喜欢使用xpath，所以为了以后忘记语法，做一个总结，便于查看。

1.xpath介绍

XPath，全称 XML Path Language，即 XML 路径语言，它是一门在 XML 文档中查找信息的语言。XPath 可用来在 XML 文档中对元素和属性进行遍历。

XPath 使用路径表达式在 XML 文档中进行导航
XPath 包含一个标准函数库
XPath 是 XSLT 中的主要元素
XPath 是一个 W3C 标准

2.节点（Node）

2.1 在 XPath 中，有七种类型的节点：元素、属性、文本、命名空间、处理指令、注释以及文档（根）节点。XML 文档是被作为节点树来对待的。树的根被称为文档节点或者根节点。

看懂可能更加清楚。
在这里插入图片描述
2.2 xpath中节点的关系

2.3 xpath中节点选择的工具
Chrome插件 XPath Helper，下载地址：https://pan.baidu.com/s/1UM94dcwgus4SgECuoJ-Jcg 密码:337b

3.xpath语法

下面列出了最常用的表达式

表达式	描述
nodename	选取此节点的所有子节点
/	从根节点选取
//	从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置
.	选取当前节点
…	选取当前节点的父节点
@	选取属性
text()	选取文本

实例

<?xml version="1.0" encoding="ISO-8859-1"?>
<bookstore>
<book>
  <title lang="eng">Harry Potter</title>
  <price>29.99</price>
</book>

<book>
  <title lang="eng">Learning XML</title>
  <price>39.95</price>
</book>
</bookstore>

路径表达式	解释
bookstore	选择bookstore元素。
/bookstore	选取根元素 bookstore。注释：假如路径起始于正斜杠( / )，则此路径始终代表到某元素的绝对路径！
bookstore/book	选取属于 bookstore 的子元素的所有 book 元素。
//book	选取所有 book 子元素，而不管它们在文档中的位置。
bookstore//book	选择属于 bookstore 元素的后代的所有 book 元素，而不管它们位于 bookstore 之下的什么位置。
//book/title/@lang	选择所有的book下面的title中的lang属性的值。
//book/title/text()	选择所有的book下面的title的文本。

4.谓语 & 查找特定的节点

路径表达式	解释
/bookstore/book[1]	选取属于 bookstore 子元素的第一个 book 元素。
/bookstore/book[last()]	选取属于 bookstore 子元素的最后一个 book 元素。
/bookstore/book[last()-1]	选取属于 bookstore 子元素的倒数第二个 book 元素。
/bookstore/book[position()< 3]	选取最前面的两个属于 bookstore 元素的子元素的 book 元素。
//title[@lang]	选取所有拥有名为 lang 的属性的 title 元素。
/bookstore/book[price>35.00]	选取 bookstore 元素的所有 book 元素，且其中的 price 元素的值须大于 35.00。
/bookstore/book[price>35.00]/title	选取 bookstore 元素中的 book 元素的所有 title 元素，且其中的 price 元素的值须大于 35.00。

注意点: 在xpath中，第一个元素的位置是1，最后一个元素的位置是last(),倒数第二个是last()-1

5.选取未知节点

通配符	描述
*	匹配任何元素节点。
@*	匹配任何属性节点。
node()	匹配任何类型的节点。

举例：

路径表达式	结果
/bookstore/*	选取 bookstore 元素的所有子元素。
//*	选取文档中的所有元素。
//title[@*]	选取所有带有属性的 title 元素。

6.选取若干路径

通过在路径表达式中使用“|”运算符，可以选取若干个路径。

路径表达式	结果
//book/title \| //book/price	选取 book 元素的所有 title 和 price 元素。
//title \| //price	选取文档中的所有 title 和 price 元素。
/bookstore/book/title \| //price	选取属于 bookstore 元素的 book 元素的所有 title 元素，以及文档中所有的 price 元素。

7.常用函数

7.1 starts-with() 获取以xxx开头的元素

xpath(‘//div[stars-with(@class,”test”)]’)

7.2 ends_with() 以xxx结尾

xpath("//input[ends-with(@id,'fuck')]")

7.3 contains() 获取包含xxx的元素

xpath(‘//div[contains(@id,”test”)]’)

7.4 and 并且同时

xpath("//input[@type='submit' and @name='fuck']")

7.5 or 或者

xpath("//input[@type='submit' or @name='fuck']")

7.6 not 非

xpath("//input[@type='submit' and not(contains(@name,'fuck'))]")

7.7 text()

xpath(‘//div[contains(text(),”test”)]’)
xpath(‘//div[@id=”“test]/text()’)

8.嗯呃呃讷讷

以上资料，都是来源网上，都是总结！以后，有知识，还会继续补充！！

埃菲尔没有塔尖

关注

18
点赞
踩
86

收藏

觉得还不错? 一键收藏
1
评论
python中的Xpath方法总结

说在前面：由于目前一直在做爬虫，之前常使用requests模块，现在改用scrapy框架。在解析页面元素的时候，本人常常喜欢使用xpath，所以为了以后忘记语法，做一个总结，便于查看。1.xpath介绍XPath，全称 XML Path Language，即 XML 路径语言，它是一门在 XML 文档中查找信息的语言。XPath 可用来在 XML 文档中对元素和属性进行遍历。XPath ...
复制链接

扫一扫