上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否抓到页面、抓到后是否允许索引、最终呈现的地址是否唯一且正确。建议在正式开放访问前,用抓取工具模拟一次访问,再逐项检查 robots、站点地图、规范地址和页面级 meta 指令,最后在搜索引擎的站长平台提交并复查。
抓取是索引的前提。如果服务器返回错误状态码,或关键资源被拦截,后续配置再正确也没有意义。上线前可以按下面的顺序观察:
robots.txt 是否误屏蔽了整站或关键目录。常见写法是 Disallow: /,它会让整站无法被抓取。这里的判断依据是:状态码正常且 robots 未屏蔽,才说明抓取通道基本通畅。如果某个页面返回 200 但内容为空,可能是前端渲染问题,需要用带渲染能力的抓取方式再验证一次。
抓取通畅不等于会被索引。页面级指令和 HTTP 响应头都可能影响索引,核对时要保证它们不互相矛盾。
<head> 中是否有 <meta name="robots" content="noindex">。如果测试环境遗留了这个标签,上线后会阻止索引。X-Robots-Tag,它同样可以设置 noindex,且优先级不受页面标签影响。判断结果是:如果页面同时出现“允许抓取”和“禁止索引”的信号,最终以更严格的限制为准。上线前应把测试用的 noindex 全部清除,只对确实不想收录的页面保留。
同一内容如果有多个可访问地址,搜索引擎需要知道哪个是主版本。核对时重点看规范标签和站点地图是否指向同一批地址。
<link rel="canonical">,且指向自身或正确的主版本地址。假设一个页面可以通过带 www 和不带 www 两种地址访问,而规范标签只写了其中一种,那么另一种就应通过 301 跳转统一过去。这样做的目的是减少重复入口,让索引集中到一个地址上。
配置检查完成并不代表已经生效。上线后需要在搜索引擎的站长平台提交站点地图,并用抓取测试工具请求几个代表性页面。复查时关注以下检查项:
如果发现页面长时间未被索引,先回到抓取和索引指令排查,而不是反复提交。索引建立需要时间,具体周期因网站规模和抓取频率而异,不宜用固定天数判断成败。
下一步建议:整理一份上线前检查清单,把抓取状态、robots 规则、索引指令、规范地址和站点地图逐项打勾,再在站长平台提交并记录首次复查日期。