python爬虫---bs4解析方式

最新推荐文章于 2023-10-31 10:27:55 发布

IT～子民

最新推荐文章于 2023-10-31 10:27:55 发布

阅读量273

点赞数

分类专栏：网络爬虫文章标签： bs4 soup对象常见操作

本文链接：https://blog.csdn.net/qq_42633222/article/details/103490427

版权

网络爬虫专栏收录该内容

9 篇文章 1 订阅

订阅专栏

一.环境安装：

需要安装：

lxml pip install lxml
bs4 pip install bs4

二.基础用法 :

from bs4 import BeautifulSoup

使用方式：可以将一个html文档，转化为BeautifulSoup对象，然后通过对象的方法或者属性去查找指定的内容
（1）转化本地文件：
- soup = BeautifulSoup(open('本地文件'), 'lxml')
（2）转化网络文件：
- soup = BeautifulSoup('字符串类型或者字节类型', 'lxml')
（3）打印soup对象显示内容为html文件中的内容

三.soup对象的常见操作：

ps:select选择器返回永远是列表，需要通过下标提取指定的对象;

（1）根据标签名查找
        - soup.a   只能找到第一个符合要求的标签
（2）获取属性
        - soup.a.attrs  获取a所有的属性和属性值，返回一个字典
        - soup.a.attrs['href']   获取href属性
        - soup.a['href']   也可简写为这种形式
（3）获取内容
        - soup.a.string
        - soup.a.text
        - soup.a.get_text()
       【注意】如果标签还有标签，那么string获取到的结果为None，而其它两个，可以获取文本内容（4）find：找到第一个符合要求的标签
        - soup.find('a')  找到第一个符合要求的
        - soup.find('a', title="xxx")
        - soup.find('a', alt="xxx")
        - soup.find('a', class_="xxx")
        - soup.find('a', id="xxx")
（5）find_all：找到所有符合要求的标签
        - soup.find_all('a')
        - soup.find_all(['a','b']) 找到所有的a和b标签
        - soup.find_all('a', limit=2)  限制前两个
（6）select:soup.select('#feng')
        - 根据选择器选择指定的内容
        - 常见的选择器：标签选择器(a)、类选择器(.)、id选择器(#)、层级选择器
            - 层级选择器：
                div .dudu #lala .meme .xixi  下面好多级
                div > p > a > .lala          只能是下面一级