上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否顺利抓到页面、抓到后是否被明确允许索引、索引结果是否指向你希望用户看到的地址。下面用一个假设例子说明步骤,并指出常见错误。
假设你有一个已有网站,最近调整了栏目结构,把部分页面从旧路径迁移到新路径,同时新增了几十篇内容页。上线前你需要在测试环境或本地先做一轮检查,而不是等上线后再看结果。假设某个页面地址为 /guide/seo-basics,旧地址为 /old/seo-basics,你要确认新地址可被抓取、可被索引,旧地址正确跳转。
抓取是搜索引擎发现页面的前提。检查项包括:
robots.txt 检查是否误屏蔽了整站或某个目录。常见错误是测试阶段写了 Disallow: /,上线时忘记删除。noindex 标签或响应头挡住。抓取和索引是两回事,noindex 不阻止抓取,但会阻止索引。判断结果:如果 robots.txt 返回 200 且没有屏蔽目标路径,页面返回 200,正文可读,抓取通道基本正常。
索引许可决定页面能否进入搜索结果。检查项包括:
<head> 中是否有 <meta name="robots" content="noindex">。有则删除或改为 index,follow。<link rel="canonical"> 指向自己或正确版本。常见错误是 canonical 指向旧地址、测试域名或另一个不相关页面。www 与不带 www、带参数与不带参数。应通过 301 跳转或 canonical 统一到一个主地址。noindex 或 robots 屏蔽。判断结果:如果目标页面 canonical 指向自身,robots 元标签允许索引,且没有重复地址竞争,索引配置基本正确。
假设旧地址 /old/seo-basics 已有外部链接或历史收录,直接删除会浪费已有入口。应设置 301 跳转到新地址 /guide/seo-basics。检查项:
判断结果:旧地址返回 301 到新地址,站点地图只含有效地址,站内链接已更新,迁移配置才算完成。
常见错误包括:测试环境的 noindex 带到线上;canonical 指向测试域名;robots.txt 屏蔽了 CSS 或 JS 导致渲染异常;站点地图包含 404 或跳转地址;只检查首页,忽略深层内容页。
上线后复核方法:对目标页面发起请求,确认状态码、robots 元标签、canonical 和正文内容;查看服务器日志中搜索引擎爬虫的访问状态;在搜索平台提交站点地图并观察索引覆盖报告。注意,不同搜索引擎的抓取与索引行为存在差异,以上检查是通用配置核对,不保证收录时间或排名结果。
下一步:从你网站中选一个最近改过路径或新增的页面,按“抓取通道—索引许可—规范地址—跳转与地图”四项逐一核对,把发现的问题记录成清单,再决定是否上线。