上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否顺利抓到页面、抓到的页面是否被允许进入索引、最终展示的地址是否唯一且正确。对第一次接触这个问题的人来说,起点不是改代码,而是先列出“应该被抓、应该被索引”的页面清单,再逐项比对实际配置,最后用抓取工具复查。
抓取和索引是两件事,核对时不要混为一谈。抓取指搜索引擎能否获取页面内容,索引指页面能否进入可被搜索展示的库。一个页面可以被抓取,但被设置成不索引;也可能被索引,却因为地址重复导致权重分散。
这份清单是后续所有判断的依据。没有清单,看到任何一条规则都无法判断它是否正确。
按“观察—判断—处理”的顺序检查,比凭记忆改配置更可靠。
<meta name="robots" content="noindex">。判断标准是:该页是否在“应该被索引”清单里。若是,删除noindex;若页面确实不该被索引,保留并确认它仍可被抓取。技术示例中提到的标签,写进页面时要注意转义与闭合,例如在HTML里写成<meta name="robots" content="noindex">,避免标签被解析成实际指令。
配置正确不等于结果正确。复查时可以用搜索引擎提供的抓取测试或URL检查类工具,也可以先用命令行观察响应头。例如:
curl -I https://example.com/page
假设某页面返回HTTP/1.1 200 OK,但页面里同时有noindex,那么它可被抓取、不会被索引。若返回301,则要确认跳转目标是否是你希望被索引的地址。若返回403或503,搜索引擎可能暂时或长期无法抓取,需要先解决访问问题。
复查还要看抓取工具渲染后的结果。如果页面内容依赖JavaScript加载,而关键内容在初始HTML中不存在,抓取工具能否执行脚本会影响判断。这时应对比“原始HTML”和“渲染后HTML”两种结果,确认标题、正文、链接是否都能被看到。
上线不是终点。提交sitemap后,观察服务器日志中搜索引擎的抓取记录,确认它访问的是你期望的地址,而不是大量参数页或测试地址。再抽查几个关键页面,确认它们出现在索引中,且展示的标题和摘要与预期一致。
如果发现应该被索引的页面没有进入索引,按以下顺序排查:先看robots.txt是否屏蔽,再看页面是否noindex,再看canonical是否指向别处,最后看内链是否可达。这个顺序能避免在错误的方向上反复修改。
下一步行动:打开你的“应该被抓、应该被索引”清单,逐条对照robots.txt、meta robots、canonical和sitemap四项配置,把不一致的地方记录下来,再从影响范围最大的那一项开始修正。