Scrapy提取多个标签的text

最新推荐文章于 2021-06-07 16:57:06 发布

feifly329

最新推荐文章于 2021-06-07 16:57:06 发布

阅读量548

点赞数 1

分类专栏： python 文章标签： scrapy 爬虫

python 专栏收录该内容

5 篇文章 0 订阅

订阅专栏

对于要提取嵌套标签所有内容的情况, 使用string或//text(), 注意两者区别

>>> from scrapy import Selector
>>> 
>>> doc = "<p id='test'>hello<b>world!</b></p>"
>>> 
>>> sel = Selector(text=doc, type='html')
>>> 
>>> sel.xpath("/p[@id='test']/text()").extract()
[]

使用text()

>>>#使用两个反斜杠
>>> sel.xpath("//p[@id='test']/text()").extract()
[u'hello']
>>> #这样提取出来是一个列表, 
>>> sel.xpath("//p[@id='test']//text()").extract()
[u'hello', u'world!']
>>>

使用string

>>> sel.xpath("//p[@id='test']").xpath('string(.)').extract()
[u'helloworld!']
>>> 
>>> sel.xpath("string(//p[@id='test'])").extract()
[u'helloworld!']
>>>

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

feifly329

关注关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Scrapy提取多个标签的text

对于要提取嵌套标签所有内容的情况, 使用string或//text(), 注意两者区别&gt;&gt;&gt; from scrapy import Selector&gt;&gt;&gt; &gt;&gt;&gt; doc = "&lt;p id='test'&gt;hello&lt;b&gt;world!&lt;/b&gt;&lt;/p&gt;&qu
复制链接

扫一扫