抓取、索引和排名是三个先后不同、判定方式也不同的环节。抓取是搜索引擎发现并读取URL;索引是它把读取到的内容处理后存入可供检索的库;排名是用户搜索某个词时,系统从索引中挑出结果并决定顺序。三者不能互相替代:页面被抓取不等于被索引,被索引不等于有排名,有排名也不等于排名稳定。
多人协作时,最常出现的返工是:执行同学提交“页面已收录”,需求方却理解为“这个词应该能排上来”。收录只说明页面进入了索引候选,和某个查询下能否出现、出现在第几位没有直接对应关系。反过来,页面没有排名时,也不能直接判定是“没收录”,因为可能已经索引,只是没有进入该查询的可见结果。
把三个环节混在一起,会导致排查方向错误:明明是抓取问题,却去改标题;明明是查询意图不匹配,却反复提交收录。要减少返工,交付时必须写清楚当前结论属于哪一层。
判断时不要凭感觉,按下面顺序逐层核对,每一层只回答本层的问题:
关键判断规则:抓取失败时,先修可访问性;抓取成功但未索引时,先看内容质量和重复问题;已索引但无排名时,先看查询与页面主题是否匹配,而不是回头改抓取。
假设某产品页目标查询是“小型咖啡机推荐”,协作中有人反馈“页面没排名”。按下面步骤走:
这个例子的前提是:该查询确实有搜索需求,且页面主题与查询一致。如果页面讲的是商用咖啡机,却拿“家用推荐”类查询去判断排名,那问题不在抓取或索引,而在主题错配,应换查询或换页面。
为了减少返工,交付记录建议固定三行:抓取状态、索引状态、排名状态,各自附上核对方式。例如:
这样写的好处是,任何人拿到记录都能知道下一步该做什么,不会把“没排名”误判成“没收录”,也不会把“没抓取”当成“内容不够好”。适用条件是:页面本身可访问、查询与页面主题一致。若页面被robots屏蔽或返回404,应先解决可访问性,再谈索引和排名。
选一个你正在跟进的目标页面和一个目标查询,按抓取、索引、排名三层各记录一条可核对的现象,再据此决定下一步动作:抓取层问题修可访问性,索引层问题修内容与重复,排名层问题修主题匹配与内容深度。