解决收录失败时,要取得可复查的状态证据,核心做法是:对同一个URL,在固定时间点分别记录抓取状态、HTTP响应、页面可索引信号和站点提交记录,并保存原始返回内容或截图。可复查的意思是,另一个人或另一个时间点的你,能根据这些记录判断当时发生了什么,而不是只看到一句“没收录”。
收录失败可能表现为:抓取被拒、抓取成功但未索引、页面被判定为重复、或内容质量不足。不同表现对应不同证据,不能混在一起看。
curl -I或浏览器开发者工具保存的HTTP响应头,重点看状态码、X-Robots-Tag、Location。<meta name="robots">、<link rel="canonical">,以及robots.txt中对该路径的规则。如果只有提交记录,没有抓取日志和响应头,就无法判断是搜索引擎没来、来了被拒,还是来了但没索引。时间和人手有限时,优先补抓取证据和响应证据,因为这两类最难事后重建。
有些证据会随时间消失或被覆盖,例如服务器日志、临时返回的5xx、CDN缓存状态。这些应最先处理。可随时重新获取的证据,例如当前页面HTML、当前robots.txt,可以稍后补。
curl -I -L "目标URL",把完整输出复制到文本文件,记录执行时间。如果返回301或302,继续看最终地址的状态码。/robots.txt,找到可能匹配目标路径的Disallow规则。注意robots.txt的抓取限制不等于可靠的索引移除:被禁止抓取不等于页面不会被索引,被允许抓取也不等于一定会被索引。适用条件:你能访问服务器日志或至少能执行一次HTTP请求。判断结果:如果日志中有爬虫请求且状态码为200,但页面仍未收录,问题更可能在可索引信号或内容质量;如果日志中完全没有爬虫请求,问题更可能在发现路径或抓取预算。
零散文件不利于复查。建议为每个待查URL建一条时间线,至少包含以下字段:
假设一个例子:某页面在周一发布,周三检查发现未收录。时间线应记录:周一发布时的URL、周三执行curl -I得到的状态码、周三导出的日志中是否有爬虫访问、以及robots.txt中该路径是否被禁止。如果周三的日志显示爬虫周二来过并得到200,而页面HTML中canonical指向了另一个地址,那么可复查的证据指向canonical冲突,而不是抓取失败。这个例子是假设,用于说明证据如何排除可能性,不代表真实项目结果。
复查者拿到证据后,按以下顺序判断,可以避免被单一现象带偏:
如果以上证据都正常,但页面仍长期未收录,应把重点转向内容质量与站点整体可抓取性,而不是继续重复提交。HTTPS不保证安全无漏洞或排名,它只是响应证据中的一个字段。
下一步:选一个你最关心的未收录URL,按上面的时间线模板建立第一条记录,并在记录中附上curl -I输出和当天日志片段。之后每次修改页面或提交站点地图,都在同一条时间线上追加一行,直到能明确判断失败发生在抓取、索引还是内容评估阶段。