pycharm中获取元素文本内容

(一)获取标签的文本内容

1.创建python文件。

2.导入lxml库的etree包。

执行代码

1  from lxml import etree

3.截取html文本内容。

执行代码

html=''''
    <div>
        <ul id="column_1">
            <li class="message"><a href="https://yige.baidu.com/"data-title="文心一格">a标签1列1行内容</a>li标签1列1行内容</li>
            <li class="line-2"><a href="link2.html">1列2行内容</a>li标签1列2行内容</li>
            <li type="text"><a href="link3.html">1列3行内容</a>li标签1列3行内容</li>
            <li class="line-4"><a src="https://hao123-static.cdn.bcebos.com/fe-res/her/static/indexnew/lib/main.cf91835.js">1列4行内容</a></li>
            <li id="line-5"><a href="link5.html">1列5行内容</a>li标签1列5行内容</li>
            <li id="code-1"<a type="text/javascript"src="//static.360buyimg.com/mtd/pc/base/1.0.0/base.js"charset="UTF-8">></a>第6行内容</li>
            <script src="//gias.jd.com/js/td.js"></script>
        </ul>
        <ul id="column_2">
            <li class="line-1"></li>
            <li id="line-2"><a data-title=""data-icon="https://dgss0.bdstatic.com/5eR1dDebRNRTm2_p8IuM_a/res/r/image/2016-11-11/331a6bbc2154a554b62b5bfce2d5cbd6.png">2列2行内容</a>li标签2列2行内容</li>
            <li class="line-message"><a href="link3.html">2列3行内容</a>li标签2列3行内容</li>
            第二列文本内容
       </ul>
    </div>
'''

4.使用etree解析html内容。

执行代码

1  #使用etree解析html网页内容
2  selector=etree.HTML(html)

5.查找class=''line=4''行中a标签中src内容。

执行代码

1  #查找class="line-4"行中a标签中src内容
2   text_line4=selector.xpath('')

6.添加xpath路径。

执行代码

1  #查找class="line-4"行中a标签中src内容
2  text_line4=selector.xpath('//div/ul/li/a/@src')[0]
3  print(text_line4)

7.执行结果。

8.方法2-查找class=''line=4''行中a标签中src内容

执行代码

1 #方法2-查找class="line-4"行中a标签中src内容
2 text_line4=selector.xpath('//*[@class="line-4"]/a/@src')[0]
3 print(text_line4)

9.控制台打印结果展示。

10.使用id=''code-1'',查找src下内的文本内容。

执行代码

1  text_id=selector.xpath('')


 

11.添加xpath路径。

12.执行结果。

13.选择class="line-4"开头的a下的src中文本内容。
执行代码

1 #选择class="line-4"开头的a下的src中文本内容
2 text_line2=selector.xpath('')

14.添加路径。

执行代码

1  #选择class="line-4"开头的a下的src中文本内容
2  text_line2=selector.xpath("//*[starts-with(@class,'line-4')]/a/@src")[0]
3  print(text_line2)

15.控制台打印结果展示。

16.使用contains选择class="message"中a标签下href文本内容。
执行代码

1  #使用contains选择class="message"中a标签下href文本内容
2  text_message=selector.xpath()


 

17.添加路径。

18.执行结果。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值