XPath Selector详解，scrapy框架下xpath选择器介绍

最新推荐文章于 2024-06-22 11:24:57 发布

楊建业

最新推荐文章于 2024-06-22 11:24:57 发布

阅读量2.1k

点赞数 5

分类专栏： Python基础-爬虫-web开发-数据分析-全栈-AI 文章标签： python xpath

本文链接：https://blog.csdn.net/qq_38132105/article/details/104383128

版权

Python基础-爬虫-web开发-数据分析-全栈-AI 专栏收录该内容

35 篇文章 10 订阅

订阅专栏

XPath Selector详解

Scrapy爬虫参考博客
XPath 是一门在 XML、HTML、XHTML 文档中查找信息的语言。（以下能在XML中的操作都能在HTML中执行）

什么是 XPath?

1：XPath 使用路径表达式在 XML 文档中进行导航
2：XPath 包含一个标准函数库
3：XPath 是 XSLT 中的主要元素
4：XPath 是一个 W3C 标准

XPath 路径表达式

XPath 使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和我们在常规的电脑文件系统中看到的表达式非常相似。

XPath 标准函数

XPath 含有超过 100 个内建的函数。这些函数用于字符串值、数值、日期和时间比较、节点和 QName 处理、序列处理、逻辑值等等。

节点

在 XPath 中，有七种类型的节点：元素、属性、文本、命名空间、处理指令、注释以及文档（根）节点。XML 文档是被作为节点树来对待的。树的根被称为文档节点或者根节点。

<body>
   <title lang="en">liming</title>
   <author>zhaosi</author>
   <year>25</year>
   <price>25</price>
</body>

<body> (文档节点)
<author>zhaosi</author> (元素节点)
lang="en" (属性节点)

基本值或称原子值

基本值是无父或无子的节点。例如zhaosi，“en”

项目（Item）

项目是基本值或者节点。

节点关系

每个元素以及属性都有一个父，在上面的例子中，body 元素是 title、author、year 以及 price 元素的父。元素节点可有零个、一个或多个子。在上面的例子中，title、author、year 以及 price 元素都是 body 元素的子。拥有相同的父的节点，title、author、year 以及 price 元素都是同胞。父亲及父亲的父亲叫先辈，儿子及儿子的儿子叫后代。

XPath 语法

XPath 使用路径表达式来选取 XML 文档中的节点或节点集。节点是通过沿着路径 (path) 或者步 (steps) 来选取的。

实例

<?xml version="1.0" encoding="UTF-8"?>
 
<bookstore>
 
<book>
  <title lang="eng">Harry Potter</title>
  <price>29.99</price>
</book>
 
<book>
  <title lang="eng">Learning XML</title>
  <price>39.95</price>
</book>
 
</bookstore>

选取节点

XPath 使用路径表达式在 XML 文档中选取节点。节点是通过沿着路径或者 step 来选取的。下面列出了最有用的路径表达式：

表达式	描述
nodename	选取此节点的所有子节点
/	从根节点选取
//	从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置
.	选取当前节点
…	选取当前节点的父节点
@	选取属性

在下面的表格中，列出了一些路径表达式以及表达式的结果：

路径表达式	描述
bookstore	选取 bookstore 元素的所有子节点
/bookstore	选取根元素 bookstore。注释：假如路径起始于正斜杠( / )，则此路径始终代表到某元素的绝对路径！
bookstore/book	选取属于 bookstore 的子元素的所有 book 元素
//book	选取所有 book 子元素，而不管它们在文档中的位置
bookstore//book	选择属于 bookstore 元素的后代的所有 book 元素，而不管它们位于 bookstore 之下的什么位置
//@lang	选取名为 lang 的所有属性

谓语

谓语用来查找某个特定的节点或者包含某个指定的值的节点。谓语被嵌在方括号中。在下面的表格中，列出了带有谓语的一些路径表达式，以及表达式的结果：

路径表达式	描述
/bookstore/book[1]	选取属于 bookstore 子元素的第一个 book 元素
/bookstore/book[last()]	选取属于 bookstore 子元素的最后一个 book 元素
/bookstore/book[last()-1]	选取属于 bookstore 子元素的倒数第二个 book 元素
/bookstore/book[position()＜3]	选取最前面的两个属于 bookstore 元素的子元素的 book 元素
//title[@lang]	选取所有拥有名为 lang 的属性的 title 元素
//title[@lang=‘eng’]	选取所有 title 元素，且这些元素拥有值为 eng 的 lang 属性
/bookstore/book[price>35.00]	选取 bookstore 元素的所有 book 元素，且其中的 price 元素的值须大于 35.00
/bookstore/book[price>35.00]//title	选取 bookstore 元素中的 book 元素的所有 title 元素，且其中的 price 元素的值须大于 35.00

选取未知节点

XPath 通配符可用来选取未知的 XML 元素：

通配符	描述
*	匹配任何元素节点
@*	匹配任何属性节点
node()	匹配任何类型的节点

在下面的表格中，列出了一些路径表达式，以及这些表达式的结果：

路径表达式	结果
/bookstore/*	选取 bookstore 元素的所有子元素
//*	选取文档中的所有元素
//title[@*]	选取所有带有属性的 title 元素

选取若干路径

通过在路径表达式中使用"|"运算符，您可以选取若干个路径。在下面的表格中，列出了一些路径表达式，以及这些表达式的结果：

路径表达式	结果
//book/title \| //book/price	选取 book 元素的所有 title 和 price 元素
//title \| //price	选取文档中的所有 title 和 price 元素
/bookstore/book/title \| //price	选取属于 bookstore 元素的 book 元素的所有 title 元素，以及文档中所有的 price 元素

XPath 运算符

下面列出了可用在 XPath 表达式中的运算符：

运算符	描述	实例	返回值
\|	计算两个节点集	//book \| //cd	返回所有拥有 book 和 cd 元素的节点集
+	加法	6 + 4	10
-	减法	6 - 4	2
*	乘法	6 * 4	24
div	除法	8 div 4	2
=	等于	price=9.80	如果 price 是 9.80，则返回 true。如果 price 是 9.90，则返回 false。
!=	不等于	price!=9.80	如果 price 是 9.90，则返回 true。如果 price 是 9.80，则返回 false
<	小于	price<9.80	如果 price 是 9.00，则返回 true。如果 price 是 9.90，则返回 false。
<=	小于或等于	price<=9.80	如果 price 是 9.00，则返回 true。如果 price 是 9.90，则返回 false。
>	大于	price>9.80	如果 price 是 9.90，则返回 true。如果 price 是 9.80，则返回 false。
>=	大于或等于	price>=9.80	如果 price 是 9.90，则返回 true。如果 price 是 9.70，则返回 false。
or	或	price=9.80 or price=9.70	如果 price 是 9.80，则返回 true。如果 price 是 9.50，则返回 false。
and	与	price>9.00 and price<9.90	如果 price 是 9.80，则返回 true。如果 price 是 8.50，则返回 false。
mod	计算除法的余数	5 mod 2	1

本文参考文档菜鸟教程

楊建业

关注

5
点赞
踩
14

收藏

觉得还不错? 一键收藏
0
评论
XPath Selector详解，scrapy框架下xpath选择器介绍

XPath Selector详解Scrapy爬虫参考博客XPath 是一门在 XML、HTML、XHTML 文档中查找信息的语言。（以下能在XML中的操作都能在HTML中执行）什么是 XPath?1：XPath 使用路径表达式在 XML 文档中进行导航2：XPath 包含一个标准函数库3：XPath 是 XSLT 中的主要元素4：XPath 是一个 W3C 标准XPath 路径表达...
复制链接

扫一扫

专栏目录