上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能拿到页面、拿到的页面允许被收录、收录后看到的是你希望展示的版本。做法不是逐条背规则,而是用“抓取—解析—索引”三个检查点,把 robots、状态码、canonical、meta robots、sitemap 和结构化数据串起来验证。适用前提是页面已能在外网访问,且你手上有该站点的配置修改权限。
robots.txt 是抓取阶段的第一道闸门。打开 https://你的域名/robots.txt,确认没有对整站或目标目录写 Disallow: /。常见误伤是测试环境留下的 Disallow: / 被带到正式环境,或者把 CSS、JS 目录一并屏蔽,导致渲染后内容缺失。
robots.txt 只控制抓取,不控制索引。一个页面被 Disallow 后仍可能因外链被索引,所以不要把它当成“禁止收录”的唯一手段。
抓取能否成功,取决于服务器返回的状态码和内容。用浏览器开发者工具或 curl -I 查看目标 URL:
同时确认页面主体内容在未登录状态下可见。若内容依赖登录、弹窗或异步接口才出现,抓取工具可能只看到一个空壳。此时应检查服务端渲染或预渲染是否覆盖了目标内容。
解析阶段最容易出问题的是“页面能抓,但搜索引擎被引导到别的地址”。逐页核对 <link rel="canonical">:
再看 <meta name="robots">。若出现 noindex,页面即使被抓取也不会进入索引。测试环境常带 noindex,上线前必须移除。若同时存在 canonical 指向 A、meta robots 为 noindex,判断结果以 noindex 为准,该页不会被收录。
sitemap 是告诉搜索引擎“哪些 URL 值得抓”的清单,不是收录保证。验收时执行以下步骤:
验收信号是:目标 URL 返回 200、robots 允许抓取、canonical 自指向、meta robots 无 noindex、sitemap 包含该 URL、抓取测试能取到正文。六项中任何一项不通过,都先修复再上线。
上线前的核对只能排除已知配置错误,不能保证收录速度和排名。上线后应关注抓取统计中的状态码分布、已发现但未抓取的 URL 数量,以及 sitemap 的读取情况。若发现大量 5xx 或重定向,优先回到服务器和跳转规则排查。下一步是建立一份上线检查表,把上述六项固化为每次发布前的必过项,避免同类问题重复出现。