先给一个有条件的结论:当百度收录查询显示入口页已被收录、深层页却长期缺席,而站点地图、内链和robots都看似正常时,断点通常不在“是否被发现”,而在“被发现后是否值得继续抓取”。这个结论成立的前提是:入口页能被抓取、深层页返回200、且没有全站级noindex。反例是:如果深层页依赖前端渲染且首屏无实质内容,那么问题可能退回渲染层,而不是抓取预算分配——此时继续优化内链不会改变结果。
把深层链路拆成四段:入口页→列表/聚合页→详情页→可被抓取的最终URL。逐段做百度收录查询,记录每段是“已收录”“未收录”还是“抓取异常”。如果入口页和列表页都收录、只有详情页不收录,断点大概率在详情页的可发现性或价值判断;如果列表页也不收录,断点更可能在内链深度或抓取路径上。
一个可区分的证据是百度抓取频次日志:假设某详情页在30天内被抓取多次但始终不收录,说明“被发现”已解决,问题在内容质量或重复度;若从未被抓取,则问题在路径或入口信号。这两种情况下一步动作完全不同。
返回200不等于可索引。常见遗漏条件有三个:
<a>但href指向锚点或空值,爬虫无法跟进。验证动作:用抓取工具查看详情页的原始响应,确认正文是否在HTML中。若正文不在,先修渲染或服务端输出,再观察百度收录查询结果是否变化。若正文在但仍不收录,再转向内容重复度和内链权重。
入口页正常、深层页失效,常见原因是深层页只有一条内链路径,且该路径位于折叠菜单或需要多次点击。百度对深层页的抓取依赖链接传递,如果详情页只从列表页第5页之后进入,抓取优先级会明显下降。
可操作动作:在入口页或高权重聚合页增加指向深层页的直接链接,并确保链接是标准<a href>。执行后不要立刻下结论,先观察百度收录查询中该深层页的抓取频次是否上升。若抓取上升但收录仍无变化,说明断点已从“发现”转移到“索引判断”,下一步应检查内容是否与已有页面高度重复。
如果多个深层页内容相似,或聚合页覆盖了详情页的全部信息,百度可能只保留聚合页而放弃详情页。这不是抓取问题,而是索引选择问题。
一个假设例子:某站有10个详情页,正文仅参数不同,其余文字完全一致,同时存在一个汇总页列出全部参数。百度收录查询显示汇总页收录、10个详情页全部未收录。此时增加内链不会有效,正确动作是让详情页具备独立可索引信息,或合并重复页面。执行后若汇总页和详情页同时存在竞争,仍需观察哪个版本被保留,再决定是否做规范化。
选一个未收录的深层页,只改一个变量:要么补一条从入口页直达的内链,要么把正文改为服务端输出。保持其他条件不变,等待百度重新抓取后做百度收录查询。如果结果变化,说明该变量就是断点;如果无变化,说明断点在更上游,应回到列表页和入口页的抓取日志继续排查。不要同时改多个变量,否则无法判断哪个动作真正影响了下一步。