robots.txt 是放在网站根目录下的纯文本文件,用于告诉搜索引擎爬虫哪些页面可以抓取、哪些禁止访问,是站长做 SEO 和控制收录时最基础的配置文件之一。

| 类型 | 网站爬虫抓取规则文件(爬虫排除协议) |
| 提出者 | 早期互联网社区(Martijn Koster 等) |
| 文件位置 | 网站根目录 /robots.txt |
| 常用指令 | User-agent、Disallow、Allow、Sitemap |
| 适用对象 | 搜索引擎蜘蛛及各类网络爬虫 |
| 官网 | robotstxt.org |
robots.txt 是一个放置在网站根目录下的纯文本文件,用来告诉搜索引擎蜘蛛等网络爬虫:本站哪些路径允许抓取、哪些路径请勿访问,它是「爬虫排除协议」(Robots Exclusion Protocol)的具体载体。
互联网上的搜索引擎依靠爬虫程序自动访问网页来建立索引(参见网络爬虫词条)。但并非网站的所有内容都适合被抓取,例如后台管理页面、搜索结果页、重复参数页等。robots.txt 由早期互联网社区提出,后来被各大搜索引擎普遍支持,并最终形成正式的互联网标准文档,成为站长与爬虫之间约定俗成的「君子协议」。
它的工作方式很简单:爬虫在抓取一个网站前,会先请求域名根目录下的 /robots.txt(例如 example.com/robots.txt),根据其中的规则决定哪些内容跳过、哪些正常抓取。文件本身对所有人公开,任何人都能在浏览器里直接查看。
对站长而言,robots.txt 是技术 SEO 的第一步:合理屏蔽低价值页面可以节省「抓取配额」,让搜索引擎把精力花在重要内容上;配合 Sitemap 声明还能加快收录。近年来,不少网站也开始用它来管理 AI 公司的数据采集爬虫,例如允许或拒绝用于模型训练的抓取程序。
问:写了 Disallow 就能保证页面不被访问吗?答:不能。robots.txt 只是约定而非强制手段,正规搜索引擎会遵守,但恶意爬虫可以无视它。涉及隐私或敏感数据的内容应使用登录验证、权限控制等真正的防护措施。
问:被 robots.txt 屏蔽的页面还会出现在搜索结果里吗?答:有可能。如果其他网站链接到该页面,搜索引擎仍可能收录其网址(只是不展示正文内容)。想彻底不被收录,应在页面中使用 noindex 标记或设置访问权限。
问:网站没有 robots.txt 会有影响吗?答:没有该文件时,爬虫默认可以抓取全站,网站照常被收录。但对内容较多的站点,建议配置一份,以便屏蔽无价值路径并声明站点地图。

| 类型 | 网站爬虫抓取规则文件(爬虫排除协议) |
| 提出者 | 早期互联网社区(Martijn Koster 等) |
| 文件位置 | 网站根目录 /robots.txt |
| 常用指令 | User-agent、Disallow、Allow、Sitemap |
| 适用对象 | 搜索引擎蜘蛛及各类网络爬虫 |
| 官网 | robotstxt.org |
登录 后参与讨论
暂无讨论,来发表第一条评论吧