Python---cssselector选择器

# cssselector:和xpath是使用比较多的两种数据提取方式。

# scrapy爬虫框架:支持xpath/css
# pyspider爬虫框架:支持PyQuery,也是通过css样式选择器实现的

# pip install cssselector

import cssselect
from lxml.html import etree

html = """
<div id='content'>
<ul class='list'>
<li class='one'>哈哈</li>
<li class='two'>Two</li>
<li class='three'>Three</li>
<li class='four four1 four2 four3'>Four</li>
<div id='inner'>
<a href='http://www.baidu.com'>百度一下</a>
<p>第一段</p>
<p>第2段</p>
<p>第3段</p>
<p>
第4段
<span id="first">法大师傅大师傅</span>
</p>
<p>第5段</p>
<p>第6段</p>
</div>
</ul>
</div>
"""

html_obj = etree.HTML(html)
span = html_obj.cssselect( '.list > .four')[ 0]
print(span.text) # 获取文本内容
# print(help(span))
# print(span.attrib['id']) # 获取属性:是一个字典

# csv:

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值