BeautifulSoup的基本使用方法

本文介绍了BeautifulSoup库中find()与find_all()的区别,详细讲解了提取信息的流程,并提供了四个爬虫练习,包括爬取博客评论、书籍分类、书籍详情以及博客文章信息。
摘要由CSDN通过智能技术生成

find()与find_all()的区别

在这里插入图片描述

首先,请看举例中括号里的class_,这里有一个下划线,是为了和python语法中的类 class区分,避免程序冲突。当然,除了用class属性去匹配,还可以使用其它属性,比如style属性等。
其次,括号中的参数:标签和属性可以任选其一,也可以两个一起使用,这取决于我们要在网页中提取的内容。
如果只用其中一个参数就可以准确定位的话,就只用一个参数检索。如果需要标签和属性同时满足的情况下才能准确定位到我们想找的内容,那就两个参数一起使用。

Tag对象的三种常用属性与方法
在这里插入图片描述

BeautifulSoup提取信息的流程

在这里插入图片描述

练习1 博客爬虫

你需要爬取的是博客【人人都是蜘蛛侠】中,《未来已来(四)——Python学习进阶图谱》的所有文章评论,并且打印。
文章URL:
https://wordpress-edu-3autumn.localprod.oc.forchange.cn/all-about-the-future_04/

from bs4 import BeautifulSoup
url='wordpress-edu-3autumn.localprod.oc.forchange.cn/all-about-the-future_04/'
for i in range(300):#抓取前300页的所有评论
    r=requests.get(url+str(i))
    r.raise_for_status()
    r.encoding=r.apparent_encoding
    soup=BeautifulSoup(r.text,'html.parser')
    items=soup.find_all('div',class_=
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值