python提取网页源码中所有的文字_python怎么爬取无标签的文字-CSDN博客

原文写的非常详细，我选择性复制了我目前需要的部分，大家可以看原文
————————————————
本文为CSDN博主「小缘喵~」的原创文章，原文链接：https://blog.csdn.net/qq_44159028/article/details/120575621

如下，将其中的所有文字提取出来，去掉标签。思路就是运用sub方法，将标签替换为空

s = """<div>
<p>岗位职责:</p>
<p>完成推荐算法、数据统计、接口、后台等服务器端相关工作</p>
<p><br></p>
<P>必备要求:</p>
<p>良好的自我驱动力和职业素养，工作积极主动、结果导向</p>
<p>&nbsp;<br></p>
<p>技术要求:</p>
<p>1、一年以上 Python开发经验，掌握面向对象分析和设计，了解设计模式</p>
<p>2、掌握HTTP协议，熟悉NVC、MVVM等概念以及相关wEB开发框架</p>
<p>3、掌握关系数据库开发设计，掌握SQL，熟练使用 MySQL/PostgresQL中的一种<br></p>
<p>4、掌握NoSQL、MQ，熟练使用对应技术解决方案</p>
<p>5、熟悉 Javascript/cSS/HTML5，JQuery,React.Vue.js</p>
<p>&nbsp;<br></p>
<p>加分项:</p>
<p>大数据，数理统计，机器学习，sklearn，高性能，大并发。</p>
</div>"""

要提取出来最重要的就是关闭贪婪模式，

result = re.sub(r'<.*?>|&nbsp','',s)  #
print(result)

python提取网页源码中所有的文字

原文写的非常详细，我选择性复制了我目前需要的部分，大家可以看原文 ———————————————— 本文为CSDN博主「小缘喵~」的原创文章，原文链接：https://blog.csdn.net/qq_44159028/article/details/120575621

原文写的非常详细，我选择性复制了我目前需要的部分，大家可以看原文
————————————————
本文为CSDN博主「小缘喵~」的原创文章，原文链接：https://blog.csdn.net/qq_44159028/article/details/120575621