检查一个网站为什么没有被收录,动手之前最该做的不是打开工具,而是先把基础信息整理齐。你需要准备六类材料:目标网址清单、robots.txt 的当前内容、站点地图地址、页面返回状态、页面自身的可抓取信号,以及你希望被收录的具体页面范围。缺了其中任何一项,后面的判断都容易变成猜测。
先写下具体要查的 URL,不要只写域名。首页、栏目页、文章页被收录的条件并不相同。建议按类别列成清单:
结果说明什么:如果只有新页面没收录,问题多半在页面本身或抓取节奏;如果连首页都没有,就要优先看 robots.txt 和服务器响应。
在浏览器打开目标域名的 robots.txt,把内容原样复制下来。重点看有没有 Disallow: /,以及是否误封了某个目录。
需要记住一个边界:robots.txt 只限制抓取,不等于把页面从索引里移除。反过来,放开 robots.txt 也不代表页面一定会被收录。它只是排查的第一道门。
结果说明什么:如果目标目录被 Disallow,搜索引擎可能无法抓取该页,收录自然无从谈起;如果 robots.txt 完全放开,说明限制不在这里,继续往下查。
找到站点地图文件,常见写法是 /sitemap.xml,也可能在 robots.txt 里用 Sitemap: 一行声明。打开它,确认:
站点地图是给抓取提供线索,不保证收录。它只能说明“我提交了这些地址”,不能说明“这些地址已经被处理”。因此它适合作为线索核对,不适合当作收录结论。
对清单里的每个 URL,记录三件事:返回状态码、是否发生跳转、最终落地地址。
结果说明什么:状态码不正常时,收录问题基本可以定位在技术层;状态码全部正常,才需要往内容质量和重复度方向查。
打开页面源码,确认两处:
<meta name="robots" content="noindex">。noindex 会阻止页面进入索引,这和 robots.txt 的抓取限制是两回事。另外确认页面使用 HTTPS。这里要分清:HTTPS 只表示传输加密,不保证站点没有安全漏洞,也不保证排名提升。它属于基础项,不是收录的决定项。
把上面五项信息填进同一张表,每个 URL 一行,列包括:网址、状态码、robots 限制、noindex 有无、是否在站点地图中、最后检查时间。这样做的价值在于,当多个页面表现不一致时,你能立刻看出差异出在哪一列。
举个假设例子:A 页和 B 页内容结构相近,A 未被收录,B 已收录。对照后发现 A 的源码里有 noindex,B 没有,那么 A 的问题就基本定位在页面级指令,而不需要再去怀疑服务器或站点地图。
最后提醒一点:不同搜索引擎对 robots.txt、noindex、站点地图的支持细节并不完全一致,上述检查要在你实际关心的那个搜索引擎里分别核对,不要用一家的结果推断另一家。
下一步:把这张对照表填完,先处理状态码异常和 noindex 这两类确定性障碍,再去看内容层面的问题。