外贸网站的robots.txt写错了,会有什么后果?
外贸建站 2026年9月13日
外贸网站的robots.txt写错了,会有什么后果?
不少外贸企业把网站交给外部人员改过一次以后,会突然发现搜索流量开始下滑,收录的页面一天比一天少。排查半天找不到原因,问题常常出在一个只有几行字的文件上。robots.txt 藏在网站根目录,平时没人注意,一旦写错,影响面却不小。
robots.txt 是做什么的,放在哪里
robots.txt 是一个纯文本文件,用来说明搜索引擎的抓取程序可以访问网站上的哪些地址、不可以访问哪些地址。它放在网站的根目录,也就是通过域名后面直接加斜杠就能访问到。访问域名下的斜杠加 robots.txt,如果能看到内容,说明文件位置是对的;如果显示找不到页面,那么文件可能根本没有放上去,或者放错了目录。
需要说明的是,robots.txt 只是一份约定。正规的搜索引擎会遵守它,但恶意采集程序通常不会理会。所以它适合用来减少无意义的抓取、指引站点地图位置,不适合用来保护私密内容。真正需要控制收录的页面,应当使用页面级别的 noindex 标记。
常见的几种写错方式
- 整站屏蔽。文件里写着禁止抓取所有地址,等于告诉搜索引擎不要访问这个站点的任何页面。这种写法在测试环境很常见,网站上线时忘了删掉,就会出现整站从搜索结果里消失的情况。
- 误屏蔽程序目录。把存放主题、样式和脚本的目录,或者存放上传图片的目录一起屏蔽,会带来一系列连锁问题。
- 站点地图地址写错。地图文件的路径拼错、多写或少写斜杠、换域名以后没有同步更新,都会让搜索引擎找不到地图,新页面被发现的速度就会变慢。
- 语法和大小写错误。字段名大小写写错、冒号前后多了空格、一条规则里放了多个路径而没有分开写,都会让规则失效或者产生意料之外的匹配结果。
- 用通配符时匹配范围算错。本意是想屏蔽某个目录下的临时页面,结果规则匹配到了整个栏目,把需要收录的产品页也挡在外面。
写错以后会出现的后果
第一层后果是抓取受阻。搜索引擎爬虫到达站点时先读取这个文件,发现目标地址被禁止访问,就会放弃抓取。页面没有被抓取,自然也就不会被收录,新的产品页和文章页从出现的那一刻起就没有机会进入搜索结果。
第二层后果是已经收录的页面逐步消失。搜索引擎会定期回访已收录的地址,如果持续遇到禁止抓取的提示,这些页面在索引里的信息会慢慢过时,最终被移出。这个过程不是一夜之间发生的,往往在几周甚至更长时间里慢慢显现,等企业注意到流量下降时,损失已经积累了一段时间。
第三层后果与图片和样式有关。图片抓取不到,图片搜索就带不来流量,页面在搜索结果里的展示形式也会受影响。样式和脚本文件被挡住,搜索引擎渲染页面的效果会变差,对页面质量的判断可能产生偏差。这些影响不像整站消失那么显眼,但会一点点削弱网站的整体表现。
还有一种情况容易被忽略:如果屏蔽规则是在测试域名下配置、后来站点迁移到正式域名,规则可能跟着一起搬了过来。这种情况下,企业看到的网站一切正常,访客也能打开,唯独搜索引擎看不到,表面症状和普通的故障完全不同,排查时容易走弯路。
怎么自查当前的文件
最直接的办法是在浏览器地址栏里输入域名加斜杠加 robots.txt,看看返回的内容是什么。重点确认三件事:有没有出现禁止抓取所有地址的规则;有没有误伤图片或程序目录;站点地图那一行的地址是否指向真实存在的地图文件。如果返回的是页面找不到,那也要处理,因为文件缺失意味着搜索引擎得不到任何指引。
在搜索引擎的站长工具里,一般都有抓取测试的入口,可以填入具体网址,查看它是否被规则拦截,也能看到是哪一条规则起了作用。覆盖报告或者索引报告中若出现大量因规则而无法抓取的提示,就要回头检查文件内容。页面级的排查工具通常也能显示某个地址是否可被抓取。
需要提醒的是,修改之前先把原文件的内容备份一份。改动一个字符就可能影响整个站点的抓取,有备份才方便对比和回退。
写这个文件时的几条基本规则
文件应当是纯文本,不要用带格式的文档另存,也不要在里面夹杂无关内容。规则按字段逐行写,每个字段名后面跟一个冒号和一个空格,然后写具体路径。同一类规则尽量一条一行,不要挤在一行里用逗号分隔。路径区分大小写,写字母时要和服务器上的目录名完全一致。文件名的拼写也要注意,写成大小写不同的变体,在部分服务器上会被当成另一个文件。
如果网站有多个域名或子域名,需要确认规则是否要分开维护。改版、换域名、调整目录结构以后,这个文件也应当同步检查。把它列入网站上线前的检查项,比事后排查省事得多。文件内容不多,出错的空间却集中在几个字符上,改完以后用工具验证一遍是比较稳妥的习惯。
改完以后怎么验证
修改并上传以后,不要只看文件内容对不对,还要实际验证效果。可以用浏览器强制刷新再次访问该文件,确认服务器返回的是新版本而不是缓存里的旧版本。随后在抓取测试工具里重新提交一两个之前被挡住的地址,看提示是否已经转为可以抓取。
接下来观察几天到几周。被抓取不等于马上被收录,重新收录需要搜索引擎逐步处理。可以主动提交站点地图,加快发现新页面的速度。如果之前是整站屏蔽,恢复抓取后索引量的回升通常需要一段时间,不必因为短期内没有变化就再次改动文件。
屏蔽抓取和 noindex 的区别
这两个概念经常被弄混,但它们的作用方向并不相同。robots.txt 里的禁止规则是阻止爬虫访问页面,页面内容不会被读取;noindex 则是允许爬虫访问页面,但在读取之后被告知不要把它放进搜索结果。前者是拦在门口,后者是让进门之后不要登记。
这个区别在实际操作里很重要。如果一个页面既被 robots.txt 挡住,又加了 noindex,爬虫根本没机会读到 noindex 标记,这个标记就不会生效,页面可能因为外部链接等原因仍然出现在索引里。因此想让某个页面彻底退出搜索结果,通常应该只使用 noindex,而不要同时用 robots.txt 去挡它。反过来,如果只是想减少无意义的抓取、节省服务器资源,用 robots.txt 更合适。
一个常见的场景
湖南有企业把网站交给外部人员做改版,改版过程中为了不让测试版本被搜索引擎看到,在文件里加上了整站屏蔽的规则。网站正式上线后,这条规则没有被删除。企业又换过一次域名,站点地图那一行仍指向旧地址。几个月后业务同事反馈自然询盘明显变少,检查站长工具才发现抓取一直被挡着。
这类问题的处理并不复杂:去掉整站屏蔽的规则,把地图地址改成新域名下的真实路径,把误伤的图片目录放行,然后提交地图并等待恢复。真正麻烦的是时间成本,几个月的收录空白很难立刻补回来。为了避免走到这一步,网站上线前把这几行内容列入检查清单是值得的。
