BeautifulSoup
是Python
里最受欢迎的HTML解析库之一。它可以提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。
find()和findAll()
在BeautifulSoup中的定义为:
findAll(tag, attributes, recursive, text, limit, keywords)
find(tag, attributes, recursive, text, keywords)
注意事项一
两者看起来定义大部分相似,唯一不同时findAll()
中多了一个参数limit
。
在实际使用中,find()就相当于findAll()中limit = 1
时的特殊情况。
注意事项二
有一个关键字参数keyword
,可以用让我们选择具体的指定属性的标签。如:
from urllib.request import urlopen
from bs4 import