抓取、索引和排名是三个先后不同、判定依据也不同的环节:抓取是搜索引擎发现并读取页面,索引是把页面内容存入可供检索的库,排名是用户搜索某个词时页面出现在结果中的位置。判断问题时,先看页面有没有被抓取,再看能不能被索引,最后才看某个查询下的排名。快照位置可以理解为某个时间点搜索引擎对页面的收录与呈现状态,它更接近抓取和索引的结果,不等同于排名。
多人协作时,最容易返工的地方是把“没排名”直接当成“没被收录”,然后去改标题、堆内容,实际原因可能只是页面还没被抓取。可以按下面这组检查项逐层确认:
这三类痕迹对应不同动作:日志对应抓取,URL查询对应索引,查询词结果页对应排名。把它们混在一起看,就会得出错误结论。
不要凭感觉判断,按顺序问三个问题,每个问题只回答是或否:
这里要区分“可能原因”和“已经定位的原因”。例如页面没出现在结果里,可能是还没被抓取,可能是被抓取但未被索引,也可能是被索引但该查询下不展示。只有拿到日志、URL查询结果和查询词结果页三项证据,才能说已经定位到某一层,否则只能列为待验证的假设。
定位到抓取层,优先检查是否被规则拦截、链接是否可达、服务器是否稳定返回;定位到索引层,优先检查页面是否有可索引的内容、是否与重复页面冲突、是否被指令排除;定位到排名层,才去考虑内容与查询意图的匹配、标题与摘要的呈现、以及页面之间的竞争关系。
举个假设例子:某页面在日志中有爬虫访问,URL查询也能返回该页面,但搜索“快照位置 判断方法”时排在第5页。这说明抓取和索引都已完成,问题在排名层,此时改robots或提交收录没有意义,应针对该查询调整内容覆盖与表达。反过来,如果日志里根本没有爬虫记录,却去优化标题,就是典型的返工。
处理之后要复查,复查也要分层。抓取层看日志中新出现的访问记录;索引层重新做URL查询,确认返回页面是否变化;排名层在相同查询词、相同环境、相近时间下再记录一次位置。只有同一层的证据发生变化,才能说明该层的处理起了作用。跨层对比,比如用排名变化去证明抓取改善,结论不成立。
协作交付时,建议在任务单里固定写清三列:当前处于哪一层、依据是哪条证据、下一步只改哪一层。这样接手的人不会把索引问题当排名问题重做一遍。
下一步:选一个你正在处理的URL,先查服务器日志确认抓取,再做一次URL查询确认索引,最后固定一个查询词记录排名,把三项结果写进同一张表,再决定改什么。