seo中搜索限制robots写法以及作用

最新推荐文章于 2020-12-25 09:14:03 发布

_南天北落

最新推荐文章于 2020-12-25 09:14:03 发布

阅读量899

点赞数

文章标签： seo robots

本文链接：https://blog.csdn.net/my_god_sky/article/details/48290373

版权

seo 专栏收录该内容

1 篇文章 0 订阅

订阅专栏

Robots协议（也称为爬虫协议、机器人协议等）的全称是“网络爬虫排除标准”（Robots Exclusion Protocol），网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取。

Robots协议用来告知搜索引擎哪些页面能被抓取，哪些页面不能被抓取；可以屏蔽一些网站中比较大的文件，如：图片，音乐，视频等，节省服务器带宽；可以屏蔽站点的一些死链接。方便搜索引擎抓取网站内容；设置网站地图连接，方便引导蜘蛛爬取页面。

User-agent: * 这里的*代表的所有的搜索引擎种类，*是一个通配符

Disallow: /admin/ 这里定义是禁止爬寻 admin目录下面的目录

Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录

Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录

Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以".htm"为后缀的URL(包含子目录)。

Disallow: /*?* 禁止访问网站中所有包含问号 (?) 的网址

Disallow: /.jpg$ 禁止抓取网页所有的.jpg格式的图片

Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。

Allow: /cgi-bin/　这里定义是允许爬寻cgi-bin目录下面的目录

Allow: /tmp 这里定义是允许爬寻tmp的整个目录

Allow: .htm$ 仅允许访问以".htm"为后缀的URL。

Allow: .gif$ 允许抓取网页和gif格式图片

Sitemap: 网站地图告诉爬虫这个页面是网站地图

robots.txt文件应该放置在网站根目录下。举例来说，当spider访问一个网站时，首先会检查该网站中是否存在robots.txt这个文件，如果 Spider找到这个文件，它就会根据这个文件的内容，来确定它访问权限的范围。

wordpress的robots位置

没有在 wordpress网站根节目上传过robots.txt,当搜寻引擎和用户拜访某个文件时，wordpress程序会主动生成一个robots.txt给搜寻引擎和用户;若是我们上传编写的robots.txt到网站根节目，用户和搜寻引擎蛛蛛拜访的就是我们上传的文件，wordpress就不会再产生那个文件了。只有服务器找不到robots的时候wordpress才会生成这个文件。

# User-agent: baiduspider    #禁止百度蜘蛛访问所有目录
# Disallow: /                #与上一行合并禁止百度蜘蛛访问任何目录
# User-agent:*  # 允许所有的搜索引擎robot访问
# Allow:/       #允许访问的目录
# Disallow:/    #不允许访问的目录
# Disallow:/*.java$       #该目录下不允许访问的文件后缀名
# Disallow:/*.js$         #该目录下限制抓取JS文件
# Disallow:/*.css$        #该目录下限制抓取CSS文件
# Disallow:/*.inc$        #该目录下限制抓取inc文件
# Disallow:/?s=           #限制抓取搜索结果
# Sitemap:"URL"           #引用sitemap.xml地址

_南天北落

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
seo中搜索限制robots写法以及作用

Robots协议（也称为爬虫协议、机器人协议等）的全称是“网络爬虫排除标准”（Robots Exclusion Protocol），网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取。Robots协议用来告知搜索引擎哪些页面能被抓取，哪些页面不能被抓取；可以屏蔽一些网站中比较大的文件，如：图片，音乐，视频等，节省服务器带宽；可以屏蔽站点的一些死链接。方便搜索引擎抓取网站内容
复制链接

扫一扫