这是今天的重点
1、爬虫的基本流程
2、re正则表达式模块的简单使用
3、requests模块的使用
4、保存csv
使用的软件
python 3.8
pycharm 2021专业版
pycharm 社区版 (免费) 没有主题
专业版 (需要激活码)
使用的模块
requests >>> pip install requests (数据请求模块) 第三方模块
re
json
csv
time
爬虫最基本的思路
一. 数据来源分析
1. 确定我们要的爬取的内容是什么?
招聘基本数据信息
2. 通过开发者工具进行抓包分析, 分析这些数据是从哪里可以获得
开发者工具怎么打开 : F12 或者 鼠标右键点击检查
二. 代码实现步骤: 发送请求 >>> 获取数据 >>> 解析数据 >>> 保存数据
1. 发送请求, 对于url地址发送请求
https://search.51job.com/list/010000%252C020000%252C030200%252C040000%252C090200,000000,0000,00,9,99,python,2,1.html
2. 获取数据, 获取服务器发给我们返回的数据响应数据
3. 解析数据, 提取我们想要的数据内容 (比如 招聘标题, 招聘薪资…)
4. 保存数据, 保存到csv文件
OK,思路都清楚的话,咱们来康康代码。
首先导入模块
不会安装模块以及安装失败看这篇教程: