Python 爬虫之request+beautifulsoup+mysql

最新推荐文章于 2024-05-06 19:32:23 发布

Wu_Candy

最新推荐文章于 2024-05-06 19:32:23 发布

阅读量803

点赞数

分类专栏：探索类

本文链接：https://blog.csdn.net/weixin_41754309/article/details/106548171

版权

欢迎关注【无量测试之道】公众号，回复【领取资源】,
Python编程学习资源干货、
Python+Appium框架APP的UI自动化、
Python+Selenium框架Web的UI自动化、
Python+Unittest框架API自动化、

资源和代码免费送啦~
文章下方有公众号二维码，可直接微信扫一扫关注即可。

一、什么是爬虫？
它是指向网站发起请求，获取资源后分析并提取有用数据的程序；
爬虫的步骤：

1、发起请求
使用http库向目标站点发起请求，即发送一个Request
Request包含：请求头、请求体等

2、获取响应内容
如果服务器能正常响应，则会得到一个Response
Response包含：html，json，图片，视频等

3、解析内容
解析html数据：正则表达式（RE模块），第三方解析库如Beautifulsoup，pyquery等
解析json数据：json模块
解析二进制数据：以wb的方式写入文件

4、保存数据
数据库（MySQL，Mongdb、Redis）文件

二、本次选择爬虫的数据来源于链家，因为本人打算搬家，想观察一下近期的链家租房数据情况，所以就直接爬取了链家数据，相关的代码如下：

from bs4 import BeautifulSoup as bsfrom requests.exceptions import RequestExceptionimport requestsimport refrom DBUtils import DBUtils
def main(response): #web页面数据提取与入库操作    html = bs(response.text, 'lxml')    for data in html.find_all(name='div',attrs={"class":"content__list--item--main"}):

最低0.47元/天解锁文章

Wu_Candy

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
2
评论
Python 爬虫之request+beautifulsoup+mysql

一、什么是爬虫？它是指向网站发起请求，获取资源后分析并提取有用数据的程序；爬虫的步骤：1、发起请求使用http库向目标站点发起请求，即发送一个RequestRequest包含：请求头、请求体等2、获取响应内容如果服务器能正常响应，则会得到一个ResponseResponse包含：html，json，图片，视频等3、解析内容解析html数据：正则表达式（RE模块），第三方解析库如Beautifulsoup，pyquery等解析json数据：json模块解析二进制数据：以wb的方
复制链接

扫一扫