Xpath string()提取多个子节点中的文本

最新推荐文章于 2024-05-02 10:55:42 发布

linhai1028

最新推荐文章于 2024-05-02 10:55:42 发布

阅读量5.6k

点赞数

分类专栏： --Python代码文章标签： python xpath lxml 爬虫

--Python代码专栏收录该内容

7 篇文章 1 订阅

订阅专栏

<div>
    <ul class="show">
        <li>275万购昌平邻铁三居 总价20万买一居</li>
        <li>00万内购五环三居 140万安家东三环</li>
        <li>北京首现零首付楼盘 53万购东5环50平</li>
        <li>京楼盘直降5000 中信府 公园楼王现房</li>
    </ul>
</div>

我想要把所有li标签中的文本提取出来,并且放到一个字符串中.
在网上查了下发现使用xpath的string()函数可以实现(string()和text()的区别请自行google)
先看下常见的方法:

>>> from lxml import etree
...
>>> result = html.xpath("//div/ul[@class='show']")[0]
>>> result.xpath('string(.)')
 '                 275万购昌平邻铁三居 总价20万买一居                 00万内购五
环三居 140万安家东三环                 北京首现零首付楼盘 53万购东5环50平
  京楼盘直降5000 中信府 公园楼王现房

这是我查到的多数人使用的方法,还有人使用了concat()函数,更麻烦就不提了.
但是上面的匹配明显感觉可以写到一条xpath里面的,为什么非要分开写!忍不住吐槽一下

xpath string()函数的调用写法:

>>> html.xpath("string(//div/ul[@class='show'])")
'                 275万购昌平邻铁三居 总价20万买一居                 00万内购五
环三居 140万安家东三环                 北京首现零首付楼盘 53万购东5环50平
  京楼盘直降5000 中信府 公园楼王现房             '

再吐槽下上面那种写法.在xpath语法里面,点(.)表示当前节点,当前节点不就是html.xpath(“//div/ul[@class=’show’]”)[0]取到的节点元素吗!!!

转自

https://www.cnblogs.com/thunderLL/p/8038927.html

linhai1028

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
2
评论
Xpath string()提取多个子节点中的文本

&amp;lt;div&amp;gt; &amp;lt;ul class=&quot;show&quot;&amp;gt; &amp;lt;li&amp;gt;275万购昌平邻铁三居总价20万买一居&amp;lt;/li&amp;gt; &amp;lt;li&amp;gt;00万内购五环三居 140万安家东三环&amp;lt;/li&amp;gt;
复制链接

扫一扫

专栏目录