5分钟掌握智联招聘网站爬取并保存到MongoDB数据库

最新推荐文章于 2019-08-20 20:37:11 发布

Python数据之道

最新推荐文章于 2019-08-20 20:37:11 发布

阅读量1.8k

点赞数 1

分类专栏： python python项目实战文章标签： python 招聘 python爬虫 python数据分析 mongodb

本文链接：https://blog.csdn.net/lemonbit/article/details/72840807

版权

本文主要介绍了如何使用Python爬虫抓取智联招聘网站的数据，并将其存储到MongoDB数据库中。内容包括运行环境（Python3.5，Windows 7），涉及的库（requests, BeautifulSoup, multiprocessing, pymongo, itertools），爬取步骤（生成网址，解析内容，存储数据到MongoDB，多进程加速），以及爬虫项目的文件结构。" 106842302,9769880,服务器配置DHCP中继代理教程,"['网络', '服务器管理', 'DHCP', '网络配置']

摘要由CSDN通过智能技术生成

前言

本次主题分两篇文章来介绍：

一、数据采集
二、数据分析

第一篇先来介绍数据采集，即用python爬取网站数据。

1 运行环境和python库

先说下运行环境：

python3.5
windows 7， 64位系统

python库

本次智联招聘的网站爬取，主要涉及以下一些python库：

requests
BeautifulSoup
multiprocessing
pymongo
itertools

2 爬取的主要步骤

根据关键字、城市、以及页面编号生成需要爬取的网页链接
用requests获取相应的网页内容
用BeautifulSoup解析，获取需要的关键信息
将爬取的信息存入MongoDB数据库中，插入新记录或更新已有记录
用multiprocessing启动多进程进行爬取，提高运行效率

3 文件组成

信息配置文件“zhilian_kw_config.py”
爬虫主运行文件“zhilian_kw_spider.py”

在配置文件中设置需要爬取的信息，然后运行主程序进行内容抓取。

配置文件“zhilian_kw_config.py”的内容如下：

# Code based on Python 3.x
# _*_ coding: utf-8 _*_
# __Author: "LEMON"

TOTAL_PAGE_NUMBER = 90  # PAGE_NUMBER: total number of pages，可进行修改

KEYWORDS = ['大数据', 'python', '投资经理'] # 需爬取的关键字可以自己添加或修改

# 爬取主要城市的记录
ADDRESS = ['全国', '北京', '上海', '广州', '深圳',
           '天津', '武汉', '西安', '成都', '大连',
           '长春',