from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = etree.tostring(html)print(result.decode('utf-8'))
<!DOCTYPE html PUBLIC "-//W3C//DTD HTML 4.0 Transitional//EN""http://www.w3.org/TR/REC-html40/loose.dtd"><html><body><div> <ul> <li class="item-0"><a href="link1.html">first item</a></li> <li class="item-1"><a href="link2.html">second item</a></li> <li class="item-inactive"><a href="link3.html">third item</a></li> <li class="item-1"><a href="link4.html">fourth item</a></li> <li class="item-0"><a href="link5.html">fifth item</a> </li></ul> </div></body></html>
5. 所有节点
我们一般会用 // 开头的 XPath 规则来选取所有符合要求的节点。这里以前面的 HTML 文本为例,如果要选取所有节点,可以这样实现:
这里使用 * 代表匹配所有节点,也就是整个 HTML 文本中的所有节点都会被获取。可以看到,返回形式是一个列表,每个元素是 Element 类型,其后跟了节点的名称,如 html、body、div、ul、li、a 等,所有节点都包含在列表中了。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//*')print(result)
[<Element html at 0x1ebaff48908>,<Element body at 0x1ebaff48948>,<Element div at 0x1ebaff48988>,<Element ul at 0x1ebaff489c8>,<Element li at 0x1ebaff48a08>,<Element a at 0x1ebaff48a88>,<Element li at 0x1ebaff48ac8>,<Element a at 0x1ebaff48b08>,<Element li at 0x1ebaff48b48>,<Element a at 0x1ebaff48a48>,<Element li at 0x1ebaff48b88>,<Element a at 0x1ebaff48bc8>,<Element li at 0x1ebaff48c08>,<Element a at 0x1ebaff48c48>]
当然,此处匹配也可以指定节点名称。如果想获取所有 li 节点,示例如下:
这里可以看到提取结果是一个列表形式,其中每个元素都是一个 Element 对象。如果要取出其中一个对象,可以直接用中括号加索引,如 [0]。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//li')print(result)print(result[0])
[<Element li at 0x11ff8871948>,<Element li at 0x11ff8871988>,<Element li at 0x11ff88719c8>,<Element li at 0x11ff8871a08>,<Element li at 0x11ff8871a48>]<Element li at 0x11ff8871948>
6. 子节点
我们通过 / 或 // 即可查找元素的子节点或子孙节点。假如现在想选择 li 节点的所有直接 a 子节点,可以这样实现:
这里通过追加 /a 即选择了所有 li 节点的所有直接 a 子节点。因为 //li 用于选中所有 li 节点,/a 用于选中 li 节点的所有直接子节点 a,二者组合在一起即获取所有 li 节点的所有直接 a 子节点。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//li/a')print(result)
[<Element a at 0x23bf3991948>,<Element a at 0x23bf3991988>,<Element a at 0x23bf39919c8>,<Element a at 0x23bf3991a08>,<Element a at 0x23bf3991a48>]
此处的 / 用于选取直接子节点,如果要获取所有子孙节点,就可以使用 //。例如,要获取 ul 节点下的所有子孙 a 节点,可以这样实现:
运行结果是相同的。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//ul//a')print(result)
[<Element a at 0x1c32af78948>,<Element a at 0x1c32af78988>,<Element a at 0x1c32af789c8>,<Element a at 0x1c32af78a08>,<Element a at 0x1c32af78a48>]
但是如果这里用 //ul/a,就无法获取任何结果了。因为 / 用于获取直接子节点,而在 ul 节点下没有直接的 a 子节点,只有 li 节点,所以无法获取任何匹配结果,代码如下:
因此,这里我们要注意 / 和 // 的区别,其中 / 用于获取直接子节点,// 用于获取子孙节点。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//ul/a')print(result)
[]
7. 父节点
那么假如我们知道了子节点,怎样来查找父节点呢?这可以用… 来实现。
比如,现在首先选中 href 属性为 link4.html 的 a 节点,然后再获取其父节点,然后再获取其 class 属性
我们也可以通过 parent:: 来获取父节点
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//a[@href="link4.html"]/../@class')print(result)
['item-1']
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//a[@href="link4.html"]/parent::*/@class')print(result)
8. 属性匹配
在选取的时候,我们还可以用 @符号进行属性过滤。比如,这里如果要选取 class 为 item- 0 的 li 节点,可以这样实现:
这里我们通过加入 [@class=“item-0”],限制了节点的 class 属性为 item-0,而 HTML 文本中符合条件的 li 节点有两个,所以结果应该返回两个匹配到的元素。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//li[@class="item-0"]')print(result)
[<Element li at 0x197baa08a48>,<Element li at 0x197baa08a88>]
9. 文本获取
我们用 XPath 中的 text() 方法获取节点中的文本,接下来尝试获取前面 li 节点中的文本,相关代码如下:
奇怪的是,我们并没有获取到任何文本,只获取到了一个换行符,这是为什么呢?因为 XPath 中 text() 前面是 /,而此处 / 的含义是选取直接子节点,很明显 li 的直接子节点都是 a 节点,文本都是在 a 节点内部的,所以这里匹配到的结果就是被修正的 li 节点内部的换行符,因为自动修正的 li 节点的尾标签换行了。
其中一个节点因为自动修正,li 节点的尾标签添加的时候换行了,所以提取文本得到的唯一结果就是 li 节点的尾标签和 a 节点的尾标签之间的换行符。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//li[@class="item-0"]/text()')print(result)
['\r\n']
如果想获取 li 节点内部的文本,就有两种方式,一种是先选取 a 节点再获取文本,另一种就是使用 //。接下来,我们来看下二者的区别。
首先,选取到 a 节点再获取文本,代码如下:
可以看到,这里的返回值是两个,内容都是属性为 item-0 的 li 节点的文本,这也印证了前面属性匹配的结果是正确的。
这里我们是逐层选取的,先选取了 li 节点,又利用 / 选取了其直接子节点 a,然后再选取其文本,得到的结果恰好是符合我们预期的两个结果。
from lxml import etree
html = etree.parse('./test.html', etree.HTMLParser())
result = html.xpath('//li[@class="item-0"]/a/text()')print(result)
['first item','fifth item']
再来看下用另一种方式(即使用 //)选取的结果
不出所料,这里的返回结果是 3 个。可想而知,这里是选取所有子孙节点的文本,其中前两个就是 li 的子节点 a 节点内部的文本,另外一个就是最后一个 li 节点内部的文本,即换行符。
这里 HTML 文本中 li 节点的 class 属性有两个值 li 和 li-first,此时如果还想用之前的属性匹配获取,就无法匹配了,此时的运行结果如下:
from lxml import etree
text ='''
<li class="li li-first"><a href="link.html">first item</a></li>
'''
html = etree.HTML(text)
result = html.xpath('//li[@class="li"]/a/text()')print(result)
from lxml import etree
text ='''
<li class="li li-first"><a href="link.html">first item</a></li>
'''
html = etree.HTML(text)
result = html.xpath('//li[contains(@class, "li")]/a/text()')print(result)
['first item']
12. 多属性匹配
另外,我们可能还遇到一种情况,那就是根据多个属性确定一个节点,这时就需要同时匹配多个属性。此时可以使用运算符 and 来连接,示例如下:
这里的 li 节点又增加了一个属性 name。要确定这个节点,需要同时根据 class 和 name 属性来选择,一个条件是 class 属性里面包含 li 字符串,另一个条件是 name 属性为 item 字符串,二者需要同时满足,需要用 and 操作符相连,相连之后置于中括号内进行条件筛选。运行结果如下:
from lxml import etree
text ='''
<li class="li li-first" name="item"><a href="link.html">first item</a></li>
'''
html = etree.HTML(text)
result = html.xpath('//li[contains(@class, "li") and @name="item"]/a/text()')print(result)
from lxml import etree
text ='''
<div>
<ul>
<li class="item-0"><a href="link1.html"><span>first item</span></a></li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-inactive"><a href="link3.html">third item</a></li>
<li class="item-1"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a>
</ul>
</div>
'''
html = etree.HTML(text)
result = html.xpath('//li[1]/ancestor::*')print(result)
result = html.xpath('//li[1]/ancestor::div')print(result)
result = html.xpath('//li[1]/attribute::*')print(result)
result = html.xpath('//li[1]/child::a[@href="link1.html"]')print(result)
result = html.xpath('//li[1]/descendant::span')print(result)
result = html.xpath('//li[1]/following::*[2]')print(result)
result = html.xpath('//li[1]/following-sibling::*')print(result)
[<Element html at 0x284f4d328c8>,<Element body at 0x284f4d32988>,<Element div at 0x284f4d329c8>,<Element ul at 0x284f4d32a08>][<Element div at 0x284f4d329c8>]['item-0'][<Element a at 0x284f4d32a08>][<Element span at 0x284f4d329c8>][<Element a at 0x284f4d32a08>][<Element li at 0x284f4d32988>,<Element li at 0x284f4d32a48>,<Element li at 0x284f4d32a88>,<Element li at 0x284f4d32ac8>]