大佬带你详解Python反爬虫措施以及爬虫编写注意事项

最新推荐文章于 2024-07-26 16:52:12 发布

编程简单学

最新推荐文章于 2024-07-26 16:52:12 发布

阅读量190

点赞数

文章标签： html5 node.js java python golang

本文链接：https://blog.csdn.net/weixin_54556126/article/details/116463895

版权

本文详细介绍了Python爬虫开发中的反爬虫措施，包括IP限制、User-Agent检查、验证码机制、Ajax异步加载、Noscript标签应用和Cookie控制。同时，也列举了编写爬虫时应注意的事项，如遵守robots协议、防止死循环、设置响应超时、高效判重、异步编程避免死锁和精准定位网页元素。

摘要由CSDN通过智能技术生成

反爬虫的几重措施

1.IP限制

如果是个人编写的爬虫，IP可能是固定的，那么发现某个IP请求过于频繁并且短时间内访问大量的页面，有爬虫的嫌疑，作为网站的管理或者运维人员，你可能就得想办法禁止这个IP地址访问你的网页了。那么也就是说这个IP发出的请求在短时间内不能再访问你的网页了，也就暂时挡住了爬虫。

2.User-Agent

User-Agent是用户访问网站时候的浏览器的标识

下面我列出了常见的几种正常的系统的User-Agent大家可以参考一下，

并且在实际发生的时候，根据浏览器的不同，还有各种其他的User-Agent，我举几个例子方便大家理解：

safari 5.1 – MAC

User-Agent:Mozilla/5.0 (Macintosh; U; IntelMac OS X 10_6_8; en-us) AppleWebKit/534.50 (KHTML, like Gecko) Version/5.1Safari/534.50

Firefox 4.0.1 – MAC

User-Agent: Mozilla/5.0 (Macintosh; IntelMac OS X 10.6; rv:2.0.1) Gecko/20100101 Firefox/4.0.1

Firefox 4.0.1 – Windows

User-Agent:Mozilla/5.0 (Windows NT 6.1;rv:

关注