Python 爬虫笔记

海胆Sur

已于 2023-04-21 19:55:57 修改

阅读量87

点赞数

文章标签： python 爬虫正则表达式

于 2021-10-12 15:07:22 首次发布

本文链接：https://blog.csdn.net/I_fole_you/article/details/120723301

版权

python 专栏收录该内容

9 篇文章 1 订阅

订阅专栏

组成：

调度器：调度URL管理器、下载器、解析器之间的协调工作
URL管理器：包括待爬取的URL地址和已爬取的URL地址，防止重复爬取
网页下载器：下载网页，网页下载器有urllib 包括需要登录、代理、和cookie，requests(第三方包)
网页解析器：解析 DOM 树，通过正则表达式、html.parser、beautifulsoup、lxml
应用程序：从网页中提取的有用数据组成的一个应用

urllib


urllib.request	用来打开和读取URLs的；
urllib.request.urlopen(url)	可以打开一个网站，读取并打印信息。
urllib.error	包含一些有urllib.request产生的错误，可以使用try进行捕捉处理；
urllib.parse	包含了一些解析URLs的方法；
urllib.robotparser	用来解析 robots.txt 提供了一个单独的RobotFileParser类，通过该类提供的can_fetch()方法测试爬虫是否可以下载一个页面。

.quote / .unquote(url)

url编码解码

request.Request

request.Request(url, data, headers, origin_req_host, unverifiable, method)
其返回作为 urlopen 的参数可进行请求

request.urlopen(url)

request.urlopen(url, data, [timeout, ], cafile, capath, sslContext)


.geturl()	返回一个 url 的字符串
.info()	返回 meta 标记的元信息，包括一些服务器的信息；
.getcode()	获取状态码
下列方式亦可获得状态码：

try:
    myURL2 = urllib.request.urlopen("https://www.runoob.com/no.html")
except urllib.error.HTTPError as e:
    if e.code == 404:
        print(404)   # 404

beautifulsoup


BeautifulSoup(html, ‘lxml’).prettify()	返回格式化的解析结果
.tag	返回第一个对应标签
.tag.string	返回第一个对应标签的innerHTML
.find_all((tag, attrs, hasChild, string, **kwargs))	查找结果返回一个列表

海胆Sur

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Python 爬虫笔记

fill:#333;color:#333;color:#333;fill:none;查询待爬url返回待爬取url命令下载网页返回下载内容交给解析器返回有用数据有用数据调度器URL管理器网页下载器网页解析器应用程序。
复制链接

扫一扫