python爬取拉勾网给定关键词职位信息存入数据库_python爬取拉勾网职位数据的方法...

最新推荐文章于 2024-04-01 15:59:06 发布

死月絲卡蕾特

最新推荐文章于 2024-04-01 15:59:06 发布

阅读量95

点赞数

文章标签： python爬取拉勾网给定关键词职位信息存入数据库

本文链接：https://blog.csdn.net/weixin_33272631/article/details/112965522

版权

本文介绍了如何使用Python爬虫抓取拉勾网的职位信息，并将其存储到MySQL数据库中。通过分析网络请求，找到了正确的API接口，处理JSON响应并建立数据库连接，实现了数据的持久化。文章提供了完整代码的GitHub链接。

摘要由CSDN通过智能技术生成

今天写的这篇文章是关于python爬虫简单的一个使用，选取的爬取对象是著名的招聘网站——拉钩网，由于和大家的职业息息相关，所以爬取拉钩的数据进行分析，对于职业规划和求职时的信息提供有很大的帮助。

完成的效果

爬取数据只是第一步，怎样使用和分析数据也是一大重点，当然这不是本次博客的目的，由于本次只是一个上手的爬虫程序，所以我们的最终目的只是爬取到拉钩网的职位信息，然后保存到Mysql数据库中。最后中的效果示意图如下：

控制台输入

数据库显示

准备工作

首先需要安装python，这个网上已经有很多的教程了，这里就默认已经安装python，博主使用的是python3.6,然后安装了requests、pymysql(连接数据库使用)和Mysql数据库。

首先我们打开拉勾网，打开控制台，搜索java关键词搜索职位，选取北京地区，然后查看network一栏中的数据分析，查看第一个，是不是感觉它很像我们要拿到的请求地址，事实上不是的，这个打开之后是一个html，如果我们访问这个接口，拉钩会返回给我们一个结果，提示我们操作太频繁，也就是被拦截了。不过从这个页面可以看到，拉钩的网页用到了模板，这种加载数据的方式更加快速(大幅度提升)，建议大家可以尝试使用一下(个人拙见)

不要气馁，我们接着往下找，可以看到一个“positionAjax”开头的请求，没错就它“ https://www.lagou.com/jobs/positionAjax.jsonpx=default&city=%E5%8C%97%E4%BA%AC&needAddtionalResult=false&isSchoolJob=0 ”，还是看图说话吧

找到请求地址之后，我们就开始写代码了。

先是导入requests和pymysql，然后requests的post方法访问上面找到的url，但是直接访问这个地址是会被拦截的，因为我们缺少所要传输的数据，和设置请求头，会被认为是非自然人请求的，加入请求头和数据，

加入请求头之后就可以请求了，控制台输出数据，可以看出是一个json数据，使用json方法处理之后，一步步找到我们想要的数据，可以看出全在“result”里面，那么我们就只拿到他就行了，

这个时候可以看到数据非常多，有30个左右，不过不用担心，都是英文单词，基本上可以才出意思。接下来我们就要怕这些数据存储到数据库中，以备日后分析使用。

连接mysql我使用的是pymysql，先建好数据库和数据表，然后在代码中加入配置信息

加载配置文件，连接数据库

大功告成，这个时候拉钩的职位信息已经静静地躺在了你的数据库中，静待你的宠幸，拿到这些数据，你就可以进行一些分析了，比如平均工资水平、职位技能要求等。

因为篇幅有限，有些代码并没有粘贴出来，比如sql语句(这个sql写的挺长的)，但是别担心，楼主已经把这个程序放入到github上面了，大家可以自行下载，github地址：https://github.com/wudb1993/pythonDemo如果觉得不错的话请在github上面点一下star，手打不易谢谢啦，欢迎大神拍砖。

总结

以上所述是小编给大家介绍的python爬取拉勾网职位数据的方法，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对服务器之家网站的支持！

原文链接：http://www.cnblogs.com/wudb/p/8341036.html

死月絲卡蕾特

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python爬取拉勾网给定关键词职位信息存入数据库_python爬取拉勾网职位数据的方法...

今天写的这篇文章是关于python爬虫简单的一个使用，选取的爬取对象是著名的招聘网站——拉钩网，由于和大家的职业息息相关，所以爬取拉钩的数据进行分析，对于职业规划和求职时的信息提供有很大的帮助。完成的效果爬取数据只是第一步，怎样使用和分析数据也是一大重点，当然这不是本次博客的目的，由于本次只是一个上手的爬虫程序，所以我们的最终目的只是爬取到拉钩网的职位信息，然后保存到Mysql数据库中。最后中的效...
复制链接

扫一扫