加载中...

robots.txt 是放置在网站根目录下的纯文本文件,用于告知网络爬虫哪些路径允许或禁止抓取,其规则体系称为爬虫排除协议(Robots Exclusion Protocol),由 Martijn Koster 于 1994 年提出,长期作为行业约定,2022 年由 Google 等推动成为正式标准 RFC 9309。
文件由若干规则组组成:User-agent 指定适用的爬虫,Disallow/Allow 声明禁止或允许的路径前缀,常配合 Sitemap 行声明站点地图地址;通配符 * 与 $ 得到主流引擎支持。
robots.txt 是"君子协定",依赖爬虫自觉遵守,不具备强制力,恶意爬虫可无视;它也不是权限控制,被禁止抓取的 URL 仍可能因外链出现在搜索结果中,敏感内容应使用鉴权或 noindex 元标记。
随着 AI 训练爬虫兴起,GPTBot、CCBot 等的 robots 条目成为内容方表达"是否允许用于 AI 训练"的主要手段,协议的边界再度成为热点议题。

登录 后参与讨论
暂无讨论,来发表第一条评论吧