C++实现爬虫,深入理解爬虫原理(最详细,最简单的教程)

最新推荐文章于 2024-05-04 18:04:52 发布

m0_54883970

最新推荐文章于 2024-05-04 18:04:52 发布

阅读量9.1k

点赞数 30

分类专栏：面试学习路线阿里巴巴文章标签： android 前端后端

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/m0_54883970/article/details/126056021

版权

前言:

我目前主要学习方向是c++,看到网上基本上都是用python写的爬虫,我也试过,确实非常方便,几行代码就能解决,但却就是因为python封装的太好,过于简单,使得很多人包括我最开始的时候,都很难理解爬虫原理.所以就想着能不能用c++实现一个简单的爬虫.

最后我成功实现C++版爬虫从某图片网站爬取了将近两万多张图片,便记录一下,供大家学习

有兴趣的同学可直接下载源码对比学习,下载源码点这里

5月17日更新：

也可进入我的公众号，查看升级优化版爬虫代码文章，以及完整的代码，还有持续更新的资源！

在这里插入图片描述

文章目录

- 前言:
一、先手动爬虫,理解爬虫原理
二、尝试手动爬取图片
四、寻找网页的规律
四、从手动爬虫中总结一下爬虫的过程
五、写代码前的知识储备
六、开始写代码
总结

一、先手动爬虫,理解爬虫原理

首先我们得清楚网页的原理,如一页展示图片的网页,右键可查看网页源代码
(考虑到该程序的特殊性,避免不必要的麻烦,不方便展示该网站名称,大家可自行找图片网站替代,尽量与本文的网站格式相近)
(当然也可以下载我的源代码,里面有详细的注释,VS2019环境下亲测可用)
在这里插入图片描述
网页源代码如图:

为方便演示爬虫原理,可在源代码页Ctrl+A 全选 ,再Ctrl+C复制,然后在桌面新建一个txt文本,Ctrl+V复制结果如图:

然后保存退出,修改文件后缀名为.html
修改前:

修改后:

然后直接点击该文件,可以发现显示出与先前网站一样内容的网页,只是显示样式发生了变化.
在这里插入图片描述

至此,我们就完成了一次手动爬取一张网页

而此次我们想爬取的不是网页,而是网页上展示的图片,所以这还不够

二、尝试手动爬取图片

正如上所诉,图片是在网页上展示的,所以我们就要尝试在网页上找到图片的地址
在网页源代码中,可以很容易找到以<img src="…"形式展示的标签
如图:
在这里插入图片描述
当尝试点击img 后紧跟的链接时,发现展示出一张图片,就是先前网页上看到的某张图片

最低0.47元/天解锁文章

关注

30
点赞
踩
192

收藏

觉得还不错? 一键收藏
5
评论
C++实现爬虫,深入理解爬虫原理(最详细,最简单的教程)

1.将要爬取的网页源代码下载到本地2.从网页源代码中解析出图片的地址,然后下载到本地.3.若不再使用网页源代码,可删除,避免占用大量磁盘空间.然后回到第一步循环,直到爬取完成对比之下,python写爬虫确实非常方便,也推荐大家用python写爬虫.但在此之前,应该要理解爬虫的原理,C++虽然繁琐,但却是理解原理的好助手.当大家慢慢积累出属于自己的C++类库时,也许比python更好用也说不一定呢源码下载httpshttpshttpshttpshttpshttpshttps。...
复制链接

扫一扫

专栏目录

评论 5

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。