爬虫Robots协议

最新推荐文章于 2024-04-13 16:47:18 发布

最光阴.

最新推荐文章于 2024-04-13 16:47:18 发布

阅读量8.8k

点赞数 1

分类专栏： python爬虫学习 python3 文章标签： Robots协议爬虫

本文链接：https://blog.csdn.net/qq_36346262/article/details/79344109

版权

python3 同时被 2 个专栏收录

12 篇文章 0 订阅

订阅专栏

python爬虫学习

4 篇文章 0 订阅

订阅专栏

Robots协议就是每个网站对于来到的爬虫所提出的要求。(并非强制要求遵守的协议，只是一种建议，但是如果不遵守有可能会承担法律责任。）
每个网站的Robots协议都在该网站的根目录下，例如百度的Robots协议的位置就是’https://www.baidu.com/robots.txt’ 或者京东的Robots协议就在’https://www.jd.com/robots.txt’
下面给出一段京东的Robots的内容：

User-agent: * 
Disallow: /?* 
Disallow: /pop/*.html 
Disallow: /pinpai/*.html?* 
User-agent: EtaoSpider 
Disallow: / 
User-agent: HuihuiSpider 
Disallow: / 
User-agent: GwdangSpider 
Disallow: / 
User-agent: WochachaSpider 
Disallow: /

第一个的意思就是说对于所有的爬虫，不能爬取在/？开头的路径，也不能访问和/pop/*.html 匹配的路径。
后面四个用户代理的爬虫不允许访问任何资源。

所以Robots协议的基本语法如下：

User-agent: 这里是爬虫的名字
Disallow: /该爬虫不允许访问的内容

最光阴.

关注

1
点赞
踩
14

收藏

觉得还不错? 一键收藏
0
评论
爬虫Robots协议

Robots协议就是每个网站对于来到的爬虫所提出的要求。(并非强制要求遵守的协议，只是一种建议，但是如果不遵守有可能会承担法律责任。）每个网站的Robots协议都在该网站的根目录下，例如百度的Robots协议的位置就是’https://www.baidu.com/robots.txt’ 或者京东的Robots协议就在’https://www.jd.com/robots.txt’ 下面给出...
复制链接

扫一扫