BeautifulSoup库的基本元素

BeautifulSoup库的基本元素

BeautifulSoup库的理解
html是由<>储存信息的,不同标签之间存在上下游关系形成标签树(一组类)
BeautifulSoup库是解析、遍历、维护“标签树”的功能库

<html>
<body>
<p class='title">...</p>
</body>
</html>

BeautifulSoup的基本元素
BeautifulSoup库
BeautifulSoup库,也叫beautifulsou4或bs4,引用方法:

from bs4 import BeautifulSoup
import bs4

BeautifulSoup对应一个HTML/XML文档的全部内容
在这里插入图片描述

from bs4 import BeautifulSoup
soup = BeautifulSoup("<html>data</html>","html.parser")#html.parser:指定解析器
soup2 = BeautifulSoup(open("D://demo.html"),"html.parser")

beautifulsoup的四种解析器

解析器使用方法条件
bs4的HTML解析器BeautifulSoup(mk,‘html.parser’)安装bs4
Ixml的HTML解析器BeautifulSoup(mk,‘Ixml’)pip installer Ixml
Ixml的XML解析器BeautifulSoup(mk,‘xml’)pip installer Ixml
html5lib的解析器BeautifulSoup(mk,‘html5lib’pip installer html5lib

以上的解析器都能有效解析html

BeautifulSoup类的基本元素

基本元素说明
Tag标签,最基本的信息组织单元,分别用<>和</>标明开头和结尾
Name标签的名字,< p>…</ p >的名字是’p’,格式:< tag>.name
Attributes标签的属性,字典形式组织,格式:< tag >.attrs
NavigableString标签非属性字符串,<>…</>中字符串,格式:< tag >.string
Comment标签内字符串的注释部分,一种特殊的Comment类型

在这里插入图片描述

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值