Beautiful Soup库的简单使用

最新推荐文章于 2024-06-15 20:42:58 发布

LY_624

最新推荐文章于 2024-06-15 20:42:58 发布

阅读量291

点赞数

分类专栏： python爬虫学习笔记

本文链接：https://blog.csdn.net/LY_624/article/details/105149023

版权

python爬虫学习笔记专栏收录该内容

11 篇文章 0 订阅

订阅专栏

一、BeautifulSoup库的简单使用

import requests
r=requests.get("http://python123.io/ws/demo.html")
demo=r.text
from bs4 import BeautifulSoup  #导入BeautifulSoup库
soup=BeautifulSoup(demo,"html.parser")  #使用html.parser进行解析
print(soup.prettify())  #打印解析结果

BeautifulSoup对应一个HTML/XML文档的全部内容

BeautifulSoup===标签树===BeautifulSoup类

二、BeautifulSoup标签的简单使用

使用下述.name，.attrs等访问名称，属性等：

基于bs4库的HTML内容遍历方法：

简单代码：

import requests
r=requests.get("http://python123.io/ws/demo.html")
demo=r.text
from bs4 import BeautifulSoup  #导入BeautifulSoup库
soup=BeautifulSoup(demo,"html.parser")  #使用html.parser进行解析
print(soup.title)  #若有多个类似标签，仅返回第一个
print(soup.a)
print(soup.a.name)   #返回名字
print(soup.a.parent.name)

tag=soup.a
print(tag.attrs)   #属性
print(tag.attrs['class'])
print(tag.string)   #两个尖括号之间的内容
print(type(tag.string))

print(soup.head)
print(soup.head.contents)   #contents返回其儿子

print(soup.title.parent)  #返回父节点

三、基于bs4库的HTML内容查找方法

如：

soup.find_all(string='Basic Python')
soup.find_all(id=re.compile('link'))   #正则表达式的模糊查询

扩展方法：

LY_624

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Beautiful Soup库的简单使用

BeautifulSoup库的简单使用import requestsr=requests.get("http://python123.io/ws/demo.html")demo=r.textfrom bs4 import BeautifulSoup #导入BeautifulSoup库soup=BeautifulSoup(demo,"html.parser") #使用html.pa...
复制链接

扫一扫