Robots.txt 文件承担着引导搜索引擎爬虫抓取路径的重要职能。通过合理的规则设定,既能让爬虫集中资源收录核心内容,又能避免后台、隐私页面被索引。掌握其基础语法与配置逻辑,有助于站长更规范地管理站点与搜索平台的交互方式。
该文件须置于域名根目录下,通过浏览器直接访问域名后加 /robots.txt 即可查看。它由若干组规则段落构成,每一段落先声明适用的爬虫对象,再定义具体的访问许可。
一个最简单的开放配置示例如下,此处放行所有爬虫并声明地图位置:
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
务必使用纯文本格式保存文件,并确保服务器返回 200 状态码。若文件无法访问或格式错误,爬虫通常默认视为允许抓取全部内容。
根据网站的实际运营阶段与内容敏感程度,需要采用差异化的配置方式。以下列举几种常见诉求的具体实现方案。
当站点处于改版维护或测试阶段,不希望被搜索引擎留档时,可执行以下全局封禁配置:
User-agent: *
Disallow: /
注意该项设置会阻断所有入口,包括首页。恢复上线后务必及时删除或修改此规则,避免长期影响收录。
较多站点需要屏蔽后台管理、购物车或用户中心等动态路径,此时无需全局禁止,仅列出对应目录即可:
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /usercenter/
需要留意的是,Disallow 的路径匹配属于前缀匹配,/admin 同样会覆盖 /administrator 这类子路径。若希望保留后半部分访问权限,可将 Allow 指令排在 Disallow 之后,但最好预先确认目标爬虫是否兼容。
部分站点存在特定业务合作,需要单独优待某一爬虫,比如赋予 Googlebot 全站读取权限,而限制其余爬虫访问静态资源目录以降低带宽消耗:
User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /assets/
Disallow: /uploads/
顺序规则上,建议将针对性较强的爬虫段落置于靠前位置,通用规则往后放。不认识的爬虫默认会落入星号所对应的段落,并通过通配符匹配请求路径。
编写过程里若忽略细微规则,轻则让爬虫空跑,重则诱发站点异常。梳理几项高发问题供参考甄别:
规则上线前进行验证是极为关键的一步。多数搜索引擎的管理后台均提供 Robots.txt 测试工具,输入文件内容即可判断是否存在语法冲突,并能模拟特定链接的抓取判定结果。
另外需牢记,该协议对恶意爬虫并无强制力。若日志中出现高频率的异常采集行为,建议从服务器防火墙或 CDN 层面另行设置访问限制。
如果误将 Disallow: / 写入文件,则所有遵守协议的爬虫均会停止访问网站全部链接,直接表现为站点从搜索结果中消失。此时的排查重点在于检查文件内容,删除或修改错误指令后保存,并静候爬虫下一次重访,通常不会造成永久性惩罚。
大部分主流搜索引擎采用最短匹配优先原则,即哪个规则更接近当前请求的 URL 路径,该规则即为最终判定。例如 Disallow 了 /api,同时又 Allow 了 /api/public,那么访问 /api/public 时放行,访问 /api/private 时阻止。针对不熟悉的平台,建议先查阅对应文档确认其匹配逻辑。
搜索引擎并不会实时读取该文件,通常存在数小时至数天的缓冲周期。部分平台支持手动提交更新请求,可缩减等待时间。在等待期间建议不要反复大幅改动文件,以免造成判定波动。
网站爬虫规则的核心价值在于精确表达开放与封闭的边界。建议先梳理站内需要保护及希望重点收录的路径清单,再对应配置规则并反复验证。日常维护中养成做变更记录的习惯,这样即使出现异常也能迅速回溯原始配置,及时恢复抓取联通状态。