搜索引擎营销的定义中,抓取、索引和排名是三个不同环节:抓取是搜索引擎发现并获取页面内容,索引是把可用的页面内容存入可供检索的数据库,排名是用户搜索时从索引中挑选并排序结果。判断问题出在哪一步,不能只看“搜不到”,而要从交付结果倒推:页面是否被请求过、是否被收录、是否在特定查询下出现。三者混在一起,容易把“没排名”误判成“没收录”,或把“没收录”误判成“没抓取”。
从结果倒推,先确认你观察到的是哪一种现象。现象不同,所需资料和验收方式也不同。
site: 或搜索引擎的 URL 检查类工具查不到该页面,或页面被标记为“已发现但未编入索引”。交付结果是“页面是否进入可检索库”。这里的关键是:索引是排名的前提,抓取是索引的前提。任何一步没有通过,后面的结果都无从谈起。但反过来,抓取成功不等于索引成功,索引成功也不等于有排名。
抓取环节的验收对象是服务器访问日志和页面可访问性。需要收集的资料包括:目标 URL 在日志中的请求记录、HTTP 状态码、请求时间、爬虫 User-Agent、返回内容长度。如果日志里完全没有该爬虫的请求,可能原因包括:页面没有内部链接或外部链接指向、robots.txt 屏蔽、服务器防火墙拦截、DNS 解析异常。如果日志里有请求但状态码是 5xx,可能原因是服务器过载或程序错误;如果是 403,可能是权限或防护规则拦截。
可执行的检查步骤:
robots.txt 测试工具确认目标 URL 未被禁止抓取。判断结果:如果日志有 200 且内容完整,抓取环节通过,问题不在抓取;如果日志无记录或状态码异常,先解决抓取,不要急着讨论排名。
索引环节的验收对象是搜索引擎的收录状态。需要收集的资料包括:用 site: 查询目标 URL 是否出现、搜索引擎提供的 URL 检查工具返回的“已编入索引/已发现但未编入索引/已排除”状态、页面 canonical 标签指向、meta robots 标签内容、页面内容是否与目标查询相关。常见导致“抓取了但没索引”的原因包括:内容质量过低或与已有页面高度重复、canonical 指向了其他 URL、meta robots 写了 noindex、页面需要登录才能看到主体内容、返回给爬虫和用户的内容不一致。
可执行的检查步骤:
meta name="robots",确认没有 noindex。link rel="canonical",确认指向的是本页而非其他页面。判断结果:如果状态是“已编入索引”,索引环节通过;如果是“已发现但未编入索引”,说明抓取已发生但搜索引擎暂未将其纳入检索库,需要检查内容质量和重复问题,而不是继续改标题。
排名环节的验收对象是特定查询下的结果位置。需要收集的资料包括:目标查询词、搜索结果页面中目标 URL 的实际位置、同一查询下排在前面的页面类型和内容、页面标题和描述是否与查询匹配、页面是否满足搜索意图。排名不理想可能的原因包括:查询意图与页面内容不匹配、页面主题不够集中、标题和正文没有覆盖查询的核心表达、竞争页面在相关性和权威性上更强、搜索结果页本身有特殊模块占位。
可执行的检查步骤:
判断结果:如果页面已索引但排名靠后,问题在相关性、内容质量或竞争强度,不在抓取和索引。此时改服务器日志或 robots.txt 不会带来排名变化。
把三个环节分开后,责任和验收也随之分开。抓取环节由服务器、robots.txt 和链接结构负责,验收标准是日志中有正常请求。索引环节由页面内容、canonical、meta robots 和站点质量负责,验收标准是 URL 检查工具显示已编入索引。排名环节由内容相关性、标题描述、页面体验和竞争环境负责,验收标准是目标查询下出现预期位置。假设一个例子:某页面在日志中有 200 请求,但 URL 检查显示“已发现但未编入索引”,此时应优先处理内容重复和 canonical,而不是修改标题或发外链。另一个假设例子:页面已被索引,但目标查询下排在第五页,此时应检查搜索意图匹配和内容深度,而不是检查 robots.txt。
下一步:选一个你正在观察的目标 URL,先查服务器日志确认抓取,再用 URL 检查工具确认索引,最后用目标查询确认排名。把三个结果分别记录,再决定改哪一层。只有当前一层通过后,后一层的优化才有意义。