关于php爬虫协议robots介绍

最新推荐文章于 2022-12-12 13:15:13 发布

韩毓航

最新推荐文章于 2022-12-12 13:15:13 发布

阅读量914

点赞数

文章标签：爬虫 php 搜索引擎

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/Smileal/article/details/124911098

版权

Robots协议(也称为爬虫协议、机器人协议等)全称是“网络爬虫排除标准”(Robots Exclusion Protocol)，网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取。本文将详细介绍爬虫协议robots

Robots协议的全称是“网络爬虫排除标准”(Robots Exclusion Protocol)，它的功能是通过Robots文件告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取，抓取的标准等。它以一个文本文件的形式放在网站的根目录中，用任何一个常见的文本编辑器都可以对其进行修改和编辑。对于站长来说，合理的书写robots.txt文件可以更合理的利用搜索引擎，屏蔽掉一些低质量的页面，提高网站质量和对搜索引擎的友好度。

具体写法如下：

(*为通配符)

User-agent: * 代表的所有的搜索引擎种类，

Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录

Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录

Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录

Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以”.htm”为后缀的URL(包含子目录)。

Disallow: /? 禁止访问网站中所有包含问号 (?) 的网址

Disallow: /.jpg$ 禁止抓取网页所有的.jpg格式的图片

Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。

Allow: /cgi-bin/　这里定义是允许爬寻cgi-bin目录下面的目录

Allow: /tmp 这里定义是允许爬寻tmp的整个目录

Allow: .htm$ 仅允许访问以”.htm”为后缀的URL。

Allow: .gif$ 允许抓取网页和gif格式图片

Sitemap: 网站地图告诉爬虫这个页面是网站地图

概述

robots.txt文件是一个文本文件，是搜索引擎中访问网站的时候要查看的第一个文件。robots.txt文件告诉蜘蛛程序在服务器上什么文件是可以被查看的

当一个搜索蜘蛛访问一个站点时，它会首先检查该站点根目录下是否存在robots.txt，如果存在，搜索机器人就会按照该文件中的内容来确定访问的范围；如果该文件不存在，所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面

【原则】

Robots协议是国际互联网界通行的道德规范，基于以下原则建立：

1、搜索技术应服务于人类，同时尊重信息提供者的意愿，并维护其隐私权；

2、网站有义务保护其使用者的个人信息和隐私不被侵犯

[注意]robots.txt必须放置在一个站点的根目录下，而且文件名必须全部小写

写法

【User-agent】

下面代码中*代表的所有的搜索引擎种类，*是一个通配符，表示所有的搜索机器人

User-agent: *

下面代码表示百度的搜索机器人

User-agent: Baiduspider

【Disallow】

下面代码表示禁止爬寻admin目录下面的目录

Disallow: /admin/

下面代码表示禁止抓取网页所有的.jpg格式的图片

Disallow: /.jpg$

下面代码表示禁止爬取ab文件夹下面的adc.html文件

Disallow:/ab/adc.html

下面代码表示禁止访问网站中所有包含问号 (?) 的网址

Disallow: /?

下面代码表示禁止访问网站中所有页面

Disallow: /

【Allow】

下面代码表示允许访问以".html"为后缀的URL

Allow: .html$

下面代码表示允许爬寻tmp的整个目录

Allow: /tmp

用法

下面代码表示允许所有的robot访问网站所有的页面

User-agent: *Allow:　/

下面代码表示禁止所有搜索引擎访问网站的任何部分

User-agent: *Disallow: /

下面代码表示禁止百度的机器人访问其网站下其所有的目录

User-agent: Baiduspider

Disallow: /

下面代码表示禁止所有搜索引擎访问网站的cgi-bin、tmp、~joe这三个目录下的文件

User-agent: *Disallow: /cgi-bin/Disallow: /tmp/Disallow: /~joe/

误区

【误区一】：网站上的所有文件都需要蜘蛛抓取，那就没必要在添加robots.txt文件了。反正如果该文件不存在，所有的搜索蜘蛛将默认能够访问网站上所有没有被口令保护的页面

每当用户试图访问某个不存在的URL时，服务器都会在日志中记录404错误(无法找到文件)。每当搜索蜘蛛来寻找并不存在的robots.txt文件时，服务器也将在日志中记录一条404错误，所以应该在网站中添加一个robots.txt

【误区二】：在robots.txt文件中设置所有的文件都可以被搜索蜘蛛抓取，这样可以增加网站的收录率

网站中的程序脚本、样式表等文件即使被蜘蛛收录，也不会增加网站的收录率，还只会浪费服务器资源。因此必须在robots.txt文件里设置不要让搜索蜘蛛索引这些文件

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
关于php爬虫协议robots介绍

Robots协议(也称为爬虫协议、机器人协议等)全称是“网络爬虫排除标准”(Robots Exclusion Protocol)，网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取。本文将详细介绍爬虫协议robotsRobots协议的全称是“网络爬虫排除标准”(Robots Exclusion Protocol)，它的功能是通过Robots文件告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取，抓取的标准等。它以一个文本文件的形式放在网站的根目录中，用任何一个常见的文本编辑器都可以对其进行
复制链接

扫一扫

韩毓航 CSDN认证博客专家 CSDN认证企业博客

码龄5年

10: 原创

38万+: 周排名

42万+: 总排名

1万+: 访问

: 等级

178: 积分

0: 粉丝

2: 获赞

2: 评论

10: 收藏

私信

关注

热门文章

最新评论

Windows系统中配置开启MySQL数据库日志方法
CSDN-Ada助手: 恭喜您写了第15篇博客！标题看起来非常有实用性，我相信读者们会对在Windows系统中配置开启MySQL数据库日志的方法感兴趣。您的博客内容一直都非常有深度和专业性，我很期待能够阅读您的新文章。在下一步的创作中，我建议您可以考虑分享一些MySQL数据库日志的实际应用案例，或者是进一步探讨如何通过分析日志来优化数据库性能。当然，这只是我个人的建议，期待您能够继续保持创作的热情，以您独特的方式继续分享有价值的技术内容。
thinkcmf项目部署到阿里云服务器保姆级教程（宝塔面板/thinkphp/试用ECS）
CSDN-Ada助手: 恭喜您撰写第16篇博客！标题中提到的“thinkcmf项目部署到阿里云服务器保姆级教程”听起来非常有趣和实用。感谢您分享这样的教程，对于像我这样对技术不太熟悉的人来说，这真的是如同一位贴心的保姆指导一样。您的博客一直给予读者们很多帮助和启发，希望您能继续保持创作的热情。对于下一步的创作建议，或许您可以考虑分享关于如何优化thinkcmf项目性能的经验，或者分享一些与阿里云服务器相关的其他实用技巧。期待您的下一篇博客，谢谢您不断分享知识！

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。