Robots协议是站长与搜索引擎爬虫之间的“君子协定”,通过在网站根目录放置robots.txt文件,可以明确告知爬虫哪些内容可以抓取、哪些必须避开。配置得当,既能守住后台数据的安全底线,又能让优质页面顺利进入索引。本篇将围绕语法、实操和避坑三部分,帮助你一次性理清配置思路。
一份规范的robots.txt由若干规则块组成,每个块之间以空行隔开。其中的关键指令主要围绕User-agent和Disallow展开,同时Allow也扮演着重要的补充角色。
书写时需小心路径的字母大小写,比如Disallow: /user与Disallow: /User指向的是两个截然不同的路径。此外,Allow指令虽然被谷歌和必应广泛支持,但并非所有爬虫都能理解,因此不应把重要页面的放行完全托付给这个指令,最好配合精准的路径设置。
一个简单的配置实例:
User-agent: *
Disallow: /admin/
Allow: /admin/login
要让生成的robots文件在保护隐私的同时不拖累正常收录,可以按照以下顺序执行:
完成后,建议借助站长平台的“抓取检测”功能,输入一条具体链接查看爬虫视角下的访问结果,核对规则是否如实生效。
最常见的事故是把“User-agent: *”和“Disallow: /”同时写入文件,这等于向所有爬虫关上了全站的大门,网站将迅速从搜索结果中消失。除非正在临时维护,否则应避免这种写法。
“Disallow: /wp-admin/”和“Disallow: /wp-admin”的语义有细微差别,前者限制的是该目录下的内容,后者则可能连同前缀相关的文件一并拦下。书写时务必保持目录结尾的斜杠规范。
路径匹配默认区分大小写,若站内URL使用了大小写混排的格式,需要逐一检查对应的规则。部分搜索引擎支持“*”作为通配符,但兼容性不一,应谨慎使用以保证兼容性。
在正式上线前,可以用在线robots测试工具或站长后台的检测功能进行多轮验证,这比事后补救要省力得多。
不同的业务类型,robots配置的侧重点也不尽相同。例如新闻站点要重点加快新文章的抓取,而电商站点则需要对价格筛选参数进行严格的抓取控制。
需要注意的是,robots协议的本质是“劝阻”而非“阻止”,恶意爬虫通常会自动忽略该文件,因此敏感数据还需借助访问认证等手段作进一步保护。
不可以。robots.txt的文件位置被严格限定在域名根目录下,子目录中放置的robots文件不会被任何爬虫正确读取。
搜索引擎通常会定期重新抓取该文件,这一间隔短则几小时,长则数天。此外,还可以通过搜索引擎的站长平台主动提交更新即可加速索引刷新。
支持使用井号(#)在行尾或独立行添加注释,用以说明规则的用途,便于团队后期维护和排错。
配置robots协议的关键在于清晰的目录规划和严谨的路径书写。上线前多花几分钟检查大小写、斜杠以及规则顺序,就能避免绝大多数收录事故。建议每隔一段时间重新审视这份文件,删除冗余条目,并同步更新Sitemap,让搜索引擎始终沿着你设定的路径高效抓取。