在改动网站收录入口之前,必须先保存一份可回退、可对照的原始状态。最直接的做法是:把当前对外生效的 robots.txt、站点地图、页面 HTML 头部、HTTP 响应头和服务器配置分别导出为独立文件,记录导出时间、来源 URL 和文件哈希,再放入一个只读归档目录。这样做的目的不是“备份网站”这么笼统,而是确保改动后能判断:收录入口到底变了什么、变化是否影响了抓取与索引。
“网站收录入口”通常指搜索引擎发现和抓取网站内容的路径,主要包括 robots.txt、XML 站点地图、页面内的链接与元指令、HTTP 状态与响应头,以及服务器或 CDN 上的重定向规则。改动前应逐项保存:
robots.txt:完整原文,包括 User-agent、Allow、Disallow、Sitemap 行。<title>、<meta name="robots">、<link rel="canonical"> 等与收录相关的标签。Content-Type、X-Robots-Tag、重定向链。保存时不要只截图。截图无法直接用于 diff 对比,也无法验证文件是否被篡改。应保存原始文本或原始响应体,并记录获取方式。
下面是一套可以直接执行的流程,适合第一次处理这类改动的人:
archive/2025-xx-xx-before-change/,按日期命名,避免覆盖。curl -s https://example.com/robots.txt -o robots-before.txt。把 example.com 换成实际域名。curl -s https://example.com/sitemap.xml -o sitemap-before.xml。如果站点地图是索引文件,还要把其中列出的子地图逐个保存。curl -sI 保存响应头,再保存 HTML 源码,便于后续搜索 <meta name="robots"> 和 canonical。sha256sum robots-before.txt sitemap-before.xml,把结果写入 manifest.txt。如果无法使用命令行,也可以用浏览器打开对应 URL,选择“查看源代码”或“另存为”,但必须确认保存的是服务器返回的原始内容,而不是浏览器渲染后的 DOM。
保存动作完成不等于归档有效。改动前应做一次回读验证:从归档目录重新打开 robots.txt 和站点地图,确认内容完整、没有截断、编码正确。再随机挑一条页面 URL,用保存的响应头与当前线上响应头对比,确认状态码和 X-Robots-Tag 一致。
判断标准可以设为:归档文件能被 diff 工具正常读取;robots.txt 中每一条规则都能在原文中找到;站点地图中的 URL 数量与保存时记录的数量一致。若任何一项对不上,说明归档不完整,不应开始改动。
从交付结果倒推,一次可回退的改动至少需要三类记录:
验收时不要只看“页面能打开”。应重新抓取同一组 URL,确认 robots.txt 是否仍允许目标路径、站点地图是否仍返回 200、页面头部指令是否与预期一致。robots.txt 的抓取限制不等于可靠的索引移除;站点地图不保证收录;HTTPS 不保证安全无漏洞或排名。不同搜索引擎对指令的支持情况须分别核查,因此验收应针对实际关注的搜索引擎分别进行。
现在就可以建立本次改动的归档目录,先保存 robots.txt 和站点地图原文,再计算哈希并写入清单。完成这一步之后,再开始修改任何收录入口。