爬虫学习整理（2）数据解析——BeautifulSoup4库

最新推荐文章于 2023-02-24 22:33:19 发布

那年丶春暖花开

最新推荐文章于 2023-02-24 22:33:19 发布

阅读量294

点赞数 1

分类专栏：爬虫学习文章标签： python html xml

本文链接：https://blog.csdn.net/weixin_44309838/article/details/108707799

版权

爬虫学习专栏收录该内容

5 篇文章 0 订阅

订阅专栏

和 lxml 一样，Beautiful Soup 也是一个HTML/XML的解析器，主要的功能也是如何解析和提取 HTML/XML 数据。

安装和文档：

安装：
pip install bs4
中文文档

简单使用：

from bs4 import BeautifulSoup

html = """
<html><head><title>The Dormouse's story</title></head>
<body>
<p class="title" name="dromouse"><b>The Dormouse's story</b></p>
<p class="story">Once upon a time there were three little sisters; and their names were
<a href="http://example.com/elsie" class="sister" id="link1"><!-- Elsie --></a>,
<a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and
<a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>;
and they lived at the bottom of a well.</p>
<p class="story">...</p>
"""

soup = BeautifulSoup(html,'lxml')
print(soup.prettify())

常见的四种对象：

Tag：通俗点讲就是 HTML 中的一个个标签。我们可以利用 soup 加标签名轻松地获取这些标签的内容，这些对象的类型是bs4.element.Tag。但是注意，它查找的是在所有内容中的第一个符合要求的标签。
NavigableString：继承自python中的str，用起来就跟使用python的str是一样的。如果拿到标签后，还想获取标签中的内容。那么可以通过tag.string获取标签中的文字。
BeautifulSoup：BeautifulSoup 对象表示的是一个文档的全部内容。大部分时候,可以把它当作 Tag 对象，它支持遍历文档树和搜索文档树中描述的大部分的方法。继承自Tag。用来生成BeaufifulSoup树的。对于一些查找方法，比如find、select这些，其实还是Tag的。
Comment：Tag , NavigableString , BeautifulSoup 几乎覆盖了html和xml中的所有内容,但是还有一些特殊对象.容易让人担心的内容是文档的注释部分。
Comment 对象是一个特殊类型的 NavigableString 对象。

contents和children：

返回某个标签下的直接子元素，其中也包括字符串。他们两的区别是：contents返回来的是一个列表，children返回的是一个迭代器。

string和strings、stripped_strings属性以及get_text方法

string：获取某个标签下的非标签字符串。返回来的是个字符串。如果这个标签下有多行字符，那么就不能获取到了。
strings：获取某个标签下的子孙非标签字符串。返回来的是个生成器。
stripped_strings：获取某个标签下的子孙非标签字符串，会去掉空白字符。返回来的是个生成器。
get_text：获取某个标签下的子孙非标签字符串，以普通字符串形式返回

find_all的使用：

在提取标签的时候，第一个参数是标签的名字。然后如果在提取标签的时候想要使用标签属性进行过滤，那么可以在这个方法中通过关键字参数的形式，将属性的名字以及对应的值传进去。或者是使用attrs属性，将所有的属性以及对应的值放在一个字典中传给attrs属性。
有些时候，在提取标签的时候，不想提取那么多，那么可以使用limit参数。限制提取多少个。

find与find_all的区别：

find：找到第一个满足条件的标签就返回。说白了，就是只会返回一个元素。
find_all:将所有满足条件的标签都返回。说白了，会返回很多标签（以列表的形式）。

使用find和find_all的过滤条件：

关键字参数：将属性的名字作为关键字参数的名字，以及属性的值作为关键字参数的值进行过滤。
attrs参数：将属性条件放到一个字典中，传给attrs参数。

获取标签的属性：

通过下标获取：通过标签的下标的方式。

href = a['href']

通过attrs属性获取：示例代码：

href = a.attrs['href']

CSS选择器：

select方法：

使用以上方法可以方便的找出元素。但有时候使用css选择器的方式可以更加的方便。使用css选择器的语法，应该使用select方法。以下列出几种常用的css选择器方法：

（1）通过标签名查找：

print(soup.select('a'))

（2）通过类名查找：

通过类名，则应该在类的前面加一个.。比如要查找class=sister的标签。示例代码如下：

print(soup.select('.sister'))

（3）通过id查找：

通过id查找，应该在id的名字前面加一个＃号。示例代码如下：

print(soup.select("#link1"))

（4）组合查找：

组合查找即和写 class 文件时，标签名与类名、id名进行的组合原理是一样的，例如查找 p 标签中，id 等于 link1的内容，二者需要用空格分开：

print(soup.select("p #link1"))

直接子标签查找，则使用 > 分隔：

print(soup.select("head > title"))

（5）通过属性查找：

查找时还可以加入属性元素，属性需要用中括号括起来，注意属性和标签属于同一节点，所以中间不能加空格，否则会无法匹配到。示例代码如下：

print(soup.select('a[href="http://example.com/elsie"]'))

（6）获取内容

以上的 select 方法返回的结果都是列表形式，可以遍历形式输出，然后用 get_text() 方法来获取它的内容。

soup = BeautifulSoup(html, 'lxml')
print(type(soup.select('title')))
print(soup.select('title')[0].get_text())

for title in soup.select('title'):
    print(title.get_text())

附使用BeautifulSoup4库解析案例（爬取快代理ip）

import requests
from bs4 import BeautifulSoup
import time


headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/83.0.4103.61 Safari/537.36'

}


def get_ip(url, f):
    resp = requests.get(url=url, headers=headers)
    html = resp.text
    soup = BeautifulSoup(html, 'lxml')
    trs = soup.find('tbody').find_all('tr')
    for tr in trs:
        ip = tr.find_all('td')[0].string
        port = tr.find_all('td')[1].string
        degrees = tr.find_all('td')[2].string
        type_h = tr.find_all('td')[3].string
        address = tr.find_all('td')[4].string
        speed = tr.find_all('td')[5].string
        last_time = tr.find_all('td')[6].string
        f.write('{}, {}, {}, {}, {}, {}, {}\n'.format(ip, port, degrees, type_h, address, speed, last_time))


def main():
    base_url = "https://www.kuaidaili.com/free/inha/{}/"
    with open('快代理ip', 'a', encoding='UTF-8') as f:
        for x in range(101, 201, 1):
            url = base_url.format(x)
            get_ip(url=url, f=f)
            time.sleep(1)


if __name__ == '__main__':
    main()

那年丶春暖花开

关注

1
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
爬虫学习整理（2）数据解析——BeautifulSoup4库

和 lxml 一样，Beautiful Soup 也是一个HTML/XML的解析器，主要的功能也是如何解析和提取 HTML/XML 数据。安装和文档：安装：pip install bs4中文文档简单使用：from bs4 import BeautifulSouphtml = """<html><head><title>The Dormouse's story</title></head><body><p
复制链接

扫一扫