Robots.txt 是存放于网站根目录的一个纯文本文件,通过简单的指令与搜索引擎爬虫沟通,告知哪些页面可以抓取、哪些路径应当避开。这份文件虽不具强制力,依赖爬虫自觉遵守,但合理的配置能引导蜘蛛优先访问重要内容,同时减少服务器无谓的负载。
搜索引擎蜘蛛访问站点时,通常会先读取 robots.txt 文件,以此规划抓取路线。若文件缺失,蜘蛛会默认全站内容可抓取。站长可利用这份文件灵活调配爬虫的访问范围,常见的用途包括:隐藏后台管理路径、屏蔽搜索结果页、阻止自动生成的标签聚合页被抓取,或通过设置抓取间隔缓解服务器压力。
需特别留意的是,该协议只被正规搜索引擎遵循,恶意采集程序不会理会。因此,任何涉及敏感信息或需严格安全防护的内容,绝不能依赖 robots.txt 来保护。
robots.txt 由若干记录分组组成,每组先声明针对的爬虫,再列出具体指令。掌握以下几个基础指令,是编写有效配置的前提:
以下示例展示各指令如何协同工作:
User-agent: *
Disallow: /temp/
Disallow: /private/
Allow: /private/notice.html
Sitemap: https://www.example.com/sitemap.xml
此配置意为:所有蜘蛛不得抓取 temp 和 private 两个目录,但 private 下的 notice.html 例外,可正常访问,同时告知站点地图位置。
语法看似简单,实际部署时一个符号或空格都可能造成意外影响。以下情形值得特别注意:
完成编辑后,务必确认文件是否生效且符合预期。以下是几个实用方法:
若发现配置错误,修正后搜索引擎通常会在数天内重新抓取该文件,无需过度操作。
以 # 开头的注释行只为方便人工阅读,不影响实际匹配,可放心使用。
若页面已被搜索引擎收录,再通过 robots.txt 屏蔽只会让链接从索引中逐步移除,但不会立即消失。如需彻底删除,请结合使用 noindex 标签或移除工具。
标准建议文件不超过 500 KiB,超出部分爬虫可能忽略。保持配置精简,只写必要的规则,更有助于其快速处理。
合理利用 robots.txt 能有效优化蜘蛛抓取效率,但需谨慎规划,避免因语法问题或屏蔽过度造成不良影响。建议先梳理网站目录结构,明确必须公开与必须隐藏的内容,再动手配置,并及时验证效果,根据搜索引擎反馈持续调整。