23个Python爬虫开源项目代码:爬取微信、淘宝、豆瓣、知乎、微博等_python爬取淘宝网站代码

一、Python所有方向的学习路线

Python所有方向路线就是把Python常用的技术点做整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。

二、学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了,给大家节省了很多时间。

三、入门学习视频

我们在看视频学习的时候,不能光动眼动脑不动手,比较科学的学习方法是在理解之后运用它们,这时候练手项目就很适合了。

网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友,可以戳这里获取

一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!


## 3、zhihu\_spider – 知乎爬虫


此项目的功能是爬取知乎用户信息以及人际拓扑关系,爬虫框架使用scrapy,数据存储使用mongo



github地址:

https://github.com/LiuRoy/zhihu_spider


## 4、bilibili-user – Bilibili用户爬虫


总数据数:20119918,抓取字段:用户id,昵称,性别,头像,等级,经验值,粉丝数,生日,地址,注册时间,签名,等级与经验值等。抓取之后生成B站用户数据报告。



github地址:

https://github.com/airingursb/bilibili-user


## 5、SinaSpider – 新浪微博爬虫


主要爬取新浪微博用户的个人信息、微博信息、粉丝和关注。代码获取新浪微博Cookie进行登录,可通过多账号登录来防止新浪的反扒。主要使用 scrapy 爬虫框架。



github地址:

https://github.com/LiuXingMing/SinaSpider


## 6、distribute\_crawler – 小说下载分布式爬虫


使用scrapy,Redis, MongoDB,graphite实现的一个分布式网络爬虫,底层存储MongoDB集群,分布式使用Redis实现,爬虫状态显示使用graphite实现,主要针对一个小说站点。



github地址:

https://github.com/gnemoug/distribute_crawler


## 7、CnkiSpider – 中国知网爬虫


设置检索条件后,执行src/CnkiSpider.py抓取数据,抓取数据存储在/data目录下,每个数据文件的第一行为字段名称。



github地址:

https://github.com/yanzhou/CnkiSpider


## 8、LianJiaSpider – 链家网爬虫


爬取北京地区链家历年二手房成交记录。涵盖链家爬虫一文的全部代码,包括链家模拟登录代码。



github地址:

https://github.com/lanbing510/LianJiaSpider


## 9、scrapy\_jingdong – 京东爬虫


基于scrapy的京东网站爬虫,保存格式为csv。



github地址:

https://github.com/taizilongxu/scrapy_jingdong


## 10、QQ-Groups-Spider – QQ 群爬虫


批量抓取 QQ 群信息,包括群名称、群号、群人数、群主、群简介等内容,最终生成 XLS(X) / CSV 结果文件。



github地址:

https://github.com/caspartse/QQ-Groups-Spider


## 11、wooyun\_public *–* 乌云爬虫


乌云公开漏洞、知识库爬虫和搜索。全部公开漏洞的列表和每个漏洞的文本内容存在MongoDB中,大概约2G内容;如果整站爬全部文本和图片作为离线查询,大概需要10G空间、2小时(10M电信带宽);爬取全部知识库,总共约500M空间。漏洞搜索使用了Flask作为web server,bootstrap作为前端。



https://github.com/hanc00l/wooyun_public


## 12、spider – hao123网站爬虫


以hao123为入口页面,滚动爬取外链,收集网址,并记录网址上的内链和外链数目,记录title等信息,windows7 32位上测试,目前每24个小时,可收集数据为10万左右



https://github.com/simapple/spider


## 13、findtrip – 机票爬虫(去哪儿和携程网)


Findtrip是一个基于Scrapy的机票爬虫,目前整合了国内两大机票网站(去哪儿 + 携程)。



https://github.com/fankcoder/findtrip


## 14、163spider – 基于requests、MySQLdb、torndb的网易客户端内容爬虫



https://github.com/leyle/163spider


## 15、doubanspiders – 豆瓣电影、书籍、小组、相册、东西等爬虫集



https://github.com/fanpei91/doubanspiders


## 16、QQSpider – QQ空间爬虫


包括日志、说说、个人信息等,一天可抓取 400 万条数据



https://github.com/LiuXingMing/QQSpider


## 17、baidu-music-spider – 百度mp3全站爬虫


使用redis支持断点续传



https://github.com/Shu-Ji/baidu-music-spider


## 18、tbcrawler – 淘宝和天猫的爬虫


可以根据搜索关键词,物品id来抓去页面的信息,数据存储在mongodb。



https://github.com/pakoo/tbcrawler


## 19、stockholm – 一个股票数据(沪深)爬虫和选股策略


根据选定的日期范围抓取所有沪深两市股票的行情数据。支持使用表达式定义选股策略。支持多线程处理。保存数据到JSON文件、CSV文件。



**(1)Python所有方向的学习路线(新版)**  

这是我花了几天的时间去把Python所有方向的技术点做的整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。

最近我才对这些路线做了一下新的更新,知识体系更全面了。



![在这里插入图片描述](https://img-blog.csdnimg.cn/1f807758e039481fa866130abf71d796.png#pic_center)



**(2)Python学习视频**



包含了Python入门、爬虫、数据分析和web开发的学习视频,总共100多个,虽然没有那么全面,但是对于入门来说是没问题的,学完这些之后,你可以按照我上面的学习路线去网上找其他的知识资源进行进阶。

![在这里插入图片描述](https://img-blog.csdnimg.cn/d66e3ad5592f4cdcb197de0dc0438ec5.png#pic_center)



**(3)100多个练手项目**

我们在看视频学习的时候,不能光动眼动脑不动手,比较科学的学习方法是在理解之后运用它们,这时候练手项目就很适合了,只是里面的项目比较多,水平也是参差不齐,大家可以挑自己能做的项目去练练。

![在这里插入图片描述](https://img-blog.csdnimg.cn/f5aeb4050ab547cf90b1a028d1aacb1d.png#pic_center)




**网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。**

**[需要这份系统化学习资料的朋友,可以戳这里获取](https://bbs.csdn.net/topics/618317507)**

**一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!**

  • 17
    点赞
  • 9
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
很好的问题!以下是一些 Python 爬虫开源项目,可以用来多种网站,包括微信豆瓣乎、微博等。 1. Scrapy:一个高效的Python爬虫框架,可用于从多个网站数据。 2. Beautiful Soup:一个用于解析HTML和XML文档的Python库,可用于网站。 3. Selenium:一个自动化测试工具,也可用于模拟用户行为进行网站。 4. Requests:一个Python HTTP库,可用于向网站发送请求并获响应。 5. PyQuery:一个用于解析HTML文档的Python库,类似于jQuery。 6. Pyspider:一个强大的爬虫框架,可用于多个网站。 7. Crawlera:一个智能代理池,可用于绕过网站的反爬虫机制。 8. Frontera:一个高效的分布式爬虫框架,可用于大规模数据。 9. Newspaper:一个Python库,可用于从新闻网站中提文章和元数据。 10. Feedparser:一个Python库,可用于解析RSS和Atom新闻源。 11. Grab:一个Python爬虫框架,可用于多个网站。 12. ParseHub:一个基于云端的数据提工具,可用于从网站中提结构化数据。 13. Webbot:一个用于模拟用户行为的Python库,可用于网站。 14. PySpider:一个基于分布式架构的Python爬虫框架,可用于多个网站。 15. Grablib:一个Python爬虫框架,可用于多个网站。 16. Python-Goose:一个Python库,可用于从新闻网站中提文章和元数据。 17. Scrapy-redis:一个基于Redis的分布式爬虫框架,可用于多个网站。 18. Scrapy-splash:一个基于Splash的JavaScript渲染爬虫框架,可用于JavaScript动态生成的网页。 19. Scrapy-UserAgents:一个Scrapy中的中间件,可用于随机更换用户代理。 20. Scrapy-Proxies:一个Scrapy中的中间件,可用于随机更换代理IP。 21. Scrapy-rotating-proxies:一个Scrapy中的中间件,可用于随机更换代理IP。 22. Scrapy-selenium:一个Scrapy中的中间件,可用于使用Selenium进行网站。 23. Scrapy-fake-useragent:一个Scrapy中的中间件,可用于随机更换用户代理。 希望这些开源项目能够帮助你进行网站

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值