python3 去除html标签,Python3正则去掉HTML标签(示例代码)

Python3正则去掉HTML标签

1.引用一段代码

import re

html = ‘

目的是通过第一次soup.find按class粗略筛选并通过soup.find_all筛选出列表中的a标签并读入href和title属性
但是由于目标链接可能有图片链接,而这是我不想要的.请问如何去除?

reg = re.compile(‘]*>‘)

print(reg.sub(‘‘,html))

2.重点

reg = re.compile(‘]*>‘)

print(reg.sub(‘‘,html))

3.实例

开始

import requests

import re

from bs4 import BeautifulSoup

retxt=open(‘test.log‘,‘r‘)

for x in range(250,999):

#rurl=rurl.strip(‘

‘)

url=‘http://ananas.mooc1.mti100.com/tologin?fid={0}‘.format(x)

#print(url)

try:

response=requests.get(url,timeout=1).text

#print(response)

soup=BeautifulSoup(response,features="lxml")

result=soup.find_all(‘span‘,attrs={‘class‘:‘l_schoolName2‘})

print(‘学校:{0}‘.format(result))

except requests.exceptions.InvalidURL:

pass

except requests.exceptions.ConnectionError:

pass

except requests.exceptions.ReadTimeout:

pass

输出

学校:[

杭州师范大学

]

学校:[

去除标签之后

import requests

import re

from bs4 import BeautifulSoup

#retxt=open(‘test.log‘,‘r‘)

for x in range(250,999):

#rurl=rurl.strip(‘

‘)

url=‘http://ananas.mooc1.mti100.com/tologin?fid={0}‘.format(x)

#print(url)

try:

response=requests.get(url,timeout=1).text

#print(response)

soup=BeautifulSoup(response,features="lxml")

result=soup.find_all(‘span‘,attrs={‘class‘:‘l_schoolName2‘})

reg=re.compile(‘]*>‘,re.S)

print(‘学校:{0}‘.format(reg.sub(‘‘,str(result))))

except requests.exceptions.InvalidURL:

pass

except requests.exceptions.ConnectionError:

pass

except requests.exceptions.ReadTimeout:

pass

输出

学校:[]

学校:[]

学校:[

上海电子信息职业技术学院

]

学校:[]

学校:[

超星大学

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值