(一)获取标签的文本内容
1.创建python文件。
2.导入lxml库的etree包。
执行代码
1 from lxml import etree
3.截取html文本内容。
执行代码
html='''' <div> <ul id="column_1"> <li class="message"><a href="https://yige.baidu.com/"data-title="文心一格">a标签1列1行内容</a>li标签1列1行内容</li> <li class="line-2"><a href="link2.html">1列2行内容</a>li标签1列2行内容</li> <li type="text"><a href="link3.html">1列3行内容</a>li标签1列3行内容</li> <li class="line-4"><a src="https://hao123-static.cdn.bcebos.com/fe-res/her/static/indexnew/lib/main.cf91835.js">1列4行内容</a></li> <li id="line-5"><a href="link5.html">1列5行内容</a>li标签1列5行内容</li> <li id="code-1"<a type="text/javascript"src="//static.360buyimg.com/mtd/pc/base/1.0.0/base.js"charset="UTF-8">></a>第6行内容</li> <script src="//gias.jd.com/js/td.js"></script> </ul> <ul id="column_2"> <li class="line-1"></li> <li id="line-2"><a data-title=""data-icon="https://dgss0.bdstatic.com/5eR1dDebRNRTm2_p8IuM_a/res/r/image/2016-11-11/331a6bbc2154a554b62b5bfce2d5cbd6.png">2列2行内容</a>li标签2列2行内容</li> <li class="line-message"><a href="link3.html">2列3行内容</a>li标签2列3行内容</li> 第二列文本内容 </ul> </div> '''
4.使用etree解析html内容。
执行代码
1 #使用etree解析html网页内容
2 selector=etree.HTML(html)
5.查找class=''line=4''行中a标签中src内容。
执行代码
1 #查找class="line-4"行中a标签中src内容
2 text_line4=selector.xpath('')
6.添加xpath路径。
执行代码
1 #查找class="line-4"行中a标签中src内容
2 text_line4=selector.xpath('//div/ul/li/a/@src')[0]
3 print(text_line4)
7.执行结果。
8.方法2-查找class=''line=4''行中a标签中src内容
执行代码
1 #方法2-查找class="line-4"行中a标签中src内容
2 text_line4=selector.xpath('//*[@class="line-4"]/a/@src')[0]
3 print(text_line4)
9.控制台打印结果展示。
10.使用id=''code-1'',查找src下内的文本内容。
执行代码
1 text_id=selector.xpath('')
11.添加xpath路径。
12.执行结果。
13.选择class="line-4"开头的a下的src中文本内容。
执行代码
1 #选择class="line-4"开头的a下的src中文本内容
2 text_line2=selector.xpath('')
14.添加路径。
执行代码
1 #选择class="line-4"开头的a下的src中文本内容
2 text_line2=selector.xpath("//*[starts-with(@class,'line-4')]/a/@src")[0]
3 print(text_line2)
15.控制台打印结果展示。
16.使用contains选择class="message"中a标签下href文本内容。
执行代码
1 #使用contains选择class="message"中a标签下href文本内容
2 text_message=selector.xpath()
17.添加路径。
18.执行结果。