先给结论:不要试图用一份 robots.txt 同时管理多个相似域名的去留,而应把每个域名当成独立站点,用 robots.txt 表达“这个域名当前允许抓什么”,用页面级信号表达“这个域名与主站是什么关系”。如果旧域名只是过渡保留,可以继续允许抓取但收敛内容;如果旧域名已无保留价值,用 robots.txt 全站禁止抓取只是第一步,不能替代迁移和退出安排。
多个域名承载相似内容,常见来源是旧品牌、旧系统、旧合作关系或历史活动站。处理前先给每个域名定一个用途,因为用途决定 robots.txt 的写法。
一个实际动作是:先列出域名清单,为每个域名标注保留、改写或退出,再写 robots.txt。这个动作的结果会直接决定下一步是配置重定向、更新站点地图,还是只做抓取限制。
robots.txt 的强项是告诉爬虫哪些路径可以抓、哪些路径不要抓。它不负责说明“这个域名和另一个域名是同一批内容”,也不负责把已经收录的页面移除。把多个相似域名都写成禁止抓取,可能让爬虫不再访问,但旧索引仍可能保留一段时间,具体表现取决于搜索引擎如何处理。
如果保留域名只是过渡,比较稳妥的做法是:
站点地图不保证收录,它只是帮助发现。若旧域名页面已经无价值,不要因为提交了站点地图就认为问题已解决。
多个域名内容相似时,不要只看“是否重复”,而要看造成相似的原因。不同原因对应不同处理。
假设一个旧活动域名与主站产品页高度相似,但旧域名还有外部链接。若直接全站禁止抓取,爬虫不再访问,旧链接的价值也更难传递。更合适的动作是先确认哪些旧 URL 有外链,再把它们重定向到主站对应页面,同时让旧域名 robots.txt 允许抓取这些重定向路径。这个动作的结果是:爬虫仍能到达旧 URL,并看到指向新位置的信号,下一步就可以观察主站对应页面是否开始承接这些链接。
如果决定让某个域名退出,顺序通常是:先确认没有仍在使用的服务、邮件或登录入口,再处理内容迁移,最后才考虑用 robots.txt 限制抓取。直接把 robots.txt 写成全站禁止,可能让仍在排查的人误以为域名已经下线,但实际页面仍可被直接访问。
还要注意,抓取限制不等于索引移除。若希望旧页面从搜索结果中消失,需要结合页面返回状态、规范链接、移除请求或搜索引擎提供的其他机制。不同搜索引擎对这些机制的支持和反应时间不同,必须分别核查。
HTTPS 不解决域名用途问题。一个旧域名即使配置了 HTTPS,也不代表它应该继续保留相似内容,更不保证它不会与主站竞争或造成维护负担。
robots.txt 本身不适合写长篇说明,但团队需要一个地方记录每个域名的用途、负责人和退出条件。否则半年后没人知道为什么某个域名被禁止抓取,也没人敢改。
建议为每个域名记录三项:
当有人问“为什么这个域名还开着”时,文档能直接回答。当需要调整时,也能判断改动会影响哪个环节。多个域名承载相似内容不是单纯的技术配置问题,而是先决定每个域名的角色,再让 robots.txt 与页面信号、重定向和站点地图保持一致。只有这样,保留、改写或退出的选择才不会互相矛盾。