关于robots协议

最新推荐文章于 2024-04-24 15:45:08 发布

Dalean.

最新推荐文章于 2024-04-24 15:45:08 发布

阅读量2.4k

点赞数 4

分类专栏： web安全文章标签：爬虫搜索引擎 web安全

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_53105813/article/details/125747631

版权

web安全专栏收录该内容

10 篇文章 0 订阅

订阅专栏

robots协议也称爬虫协议、爬虫规则等,是指网站可建立一个robots.txt文件来告诉搜索引擎哪些页面可以抓取,哪些页面不能抓取,而搜索引擎则通过读取robots.txt文件来识别这个页面是否允许被抓取。通常被放置在根目录下

目前位置robots协议文件写法有如下：
user-agent:* 这里的代表对所有的搜索引擎种类类型，其实就是通配符的意思。
allow:/ 是代表所有的robots允许访问。
Disallow: /是代表所有的robots不允许访问。

文件写法

User-agent: * 这里的*代表的所有的搜索引擎种类，*是一个通配符

Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录

Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录

Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录

Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以".htm"为后缀的URL(包含子目录)。

Disallow: /*?* 禁止访问网站中所有包含问号 (?) 的网址

Disallow: /.jpg$ 禁止抓取网页所有的.jpg格式的图片

Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。

Allow: /cgi-bin/　这里定义是允许爬寻cgi-bin目录下面的目录

Allow: /tmp 这里定义是允许爬寻tmp的整个目录

Allow: .htm$ 仅允许访问以".htm"为后缀的URL。

Allow: .gif$ 允许抓取网页和gif格式图片

Sitemap: 网站地图告诉爬虫这个页面是网站地图

robots文件的作用：

1、可以屏蔽网站内一些打不开的链接，也就是死链接

2、可以屏蔽搜索引擎蜘蛛访问网站内重复的内容和重复的页面

3、阻止搜索引擎访问网站的隐私性的内容。

4、阻止搜索引擎访问网站的后台内容。

5、告诉搜索引擎那些内容是需要被访问的。指定爬网延迟，以便在爬网程序一次加载多个内容时防止服务器过载

6、防止搜索引擎索引您网站上的某些文件(图像，PDF等)

关注

4
点赞
踩
7

收藏

觉得还不错? 一键收藏
0
评论
关于robots协议

每天积累一点点
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。