lxml与xpath使用demo

点击进入文章
点击进入文章

from lxml import etree
if __name__ == '__main__':
    text = '''
    <div>
        <ul>
             <li class="item-0"><a href="link1.html">first item</a></li>
             <li class="item-1"><a href="link2.html">second item</a></li>
             <li class="item-inactive"><a href="link3.html">third item</a></li>
             <li class="item-1"><a href="link4.html">fourth item</a></li>
             <li class="item-0"><a href="link5.html">fifth item</a> 
         </ul>
    </div>
    '''

    # 将文本转成html对象
    html = etree.HTML(text)
    # 将对象转成html文本
    result = etree.tostring(html)
    # 打印输出
    print(result.decode('utf-8'))
  • xpath
from lxml import etree


if __name__ == '__main__':

    html = etree.parse('text.html')
    result = html.xpath('//li[@class="item-1"]')
    for item in result:
        print(etree.tostring(item).decode('utf-8'))
  • 选取若干路径
    通过在路径表达式中使用“|”运算符,您可以选取若干个路径。
  • demo
r = requests.get(url, headers=headers)
# print(r.text)
html = etree.HTML(r.text)
r_1 = html.xpath("//div[@class='main-content clearfix']/div[@class='product-list']")[0]
 # 兼容 首页推荐
r_2 = r_1.xpath("//div[@class='product-recommend']/div | // div[@class='product-item clearfix']")
  • xpath的 contains 使用

# 注册时间    (..为上一级节点,在本例中em的上一级节点)
reg_time = response.xpath('//em[contains(text(), "注册时间")]/../text()').extract_first()
  • xpath提取当前节点的所有父节点
# ancestor::*[@id="flightCardContent"]
//*[@id="flightCardsContainer"]/div//span[contains(text(), 'aaa')]/ancestor::*[@id="flightCardContent"]
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值