爬虫简介
这是一个在未登录的情况下,根据企业名称搜索,爬取企业页面数据的采集程序
注意:这是一个比较简单的爬虫,基本上只用到了代理,没有用到其他的反反爬技术,不过由于爬取的数据比较多, 适合刷解析技能的熟练度 ,所以高手勿进
代码已经上传到 GitHub 上,有用还请给个星
python版本:python2.7
编码工具:pycharm
数据存储:mysql
爬虫结构:广度爬虫
爬虫思路:
-
先获取需要采集信息的公司:
- 从数据库中获取
- 获取字段:etid,etname
- 将获取的数据存储的状态表中
- 从状态表中获取数据,并更新状态表
-
拼接初始URL:
- 将etname和初始url进行拼接,获得初始网址
- 将初始url放到一个列表中,获取HTML的时候如何出错,将出错的url放到另一个列表中,进行循环获取
-
请求解析初始一级页面: