pycharm中获取元素文本内容

最新推荐文章于 2024-08-10 21:08:50 发布

qaanlova

最新推荐文章于 2024-08-10 21:08:50 发布

阅读量166

点赞数

文章标签： pycharm python

本文链接：https://blog.csdn.net/qaanlova/article/details/133841236

版权

（一）获取标签的文本内容

1.创建python文件。

2.导入lxml库的etree包。

执行代码

1 from lxml import etree

3.截取html文本内容。

执行代码

html=''''
    <div>
        <ul id="column_1">
            <li class="message"><a href="https://yige.baidu.com/"data-title="文心一格">a标签1列1行内容</a>li标签1列1行内容</li>
            <li class="line-2"><a href="link2.html">1列2行内容</a>li标签1列2行内容</li>
            <li type="text"><a href="link3.html">1列3行内容</a>li标签1列3行内容</li>
            <li class="line-4"><a src="https://hao123-static.cdn.bcebos.com/fe-res/her/static/indexnew/lib/main.cf91835.js">1列4行内容</a></li>
            <li id="line-5"><a href="link5.html">1列5行内容</a>li标签1列5行内容</li>
            <li id="code-1"<a type="text/javascript"src="//static.360buyimg.com/mtd/pc/base/1.0.0/base.js"charset="UTF-8">></a>第6行内容</li>
            <script src="//gias.jd.com/js/td.js"></script>
        </ul>
        <ul id="column_2">
            <li class="line-1"></li>
            <li id="line-2"><a data-title=""data-icon="https://dgss0.bdstatic.com/5eR1dDebRNRTm2_p8IuM_a/res/r/image/2016-11-11/331a6bbc2154a554b62b5bfce2d5cbd6.png">2列2行内容</a>li标签2列2行内容</li>
            <li class="line-message"><a href="link3.html">2列3行内容</a>li标签2列3行内容</li>
            第二列文本内容
       </ul>
    </div>
'''