核对抓取限制,核心是确认搜索引擎能不能正常访问你的页面,以及哪些规则挡住了它。最直接的办法是打开搜索引擎的抓取测试工具,输入一个具体网址,看返回状态和抓取结果;再对照 robots.txt 和页面 meta 标签,找出拦截点。时间人手有限时,优先检查首页、栏目页和近期不收录的重点内容页,不必一次全站铺开。
抓取限制通常出现在三个地方,按排查顺序看:
Disallow 挡住了整站或某个目录。特别注意 Disallow: / 这种写法,它会让所有抓取停止。<meta name="robots" content="noindex"> 或 nofollow。noindex 影响的是收录,不是抓取,但两者常被一起误判。先看现象:如果搜索结果里完全没有某个页面,可能是抓取被挡或收录被拒;如果页面能打开但快照内容陈旧,问题更可能出在抓取频率或渲染环节,而不是限制规则。
主流搜索引擎都提供网址检查或抓取测试功能,可以模拟抓取并显示返回的 HTML。操作步骤:
判断依据:状态码 200 且源码完整,说明抓取本身没有障碍;状态码 4xx 要查链接和路径;5xx 要查服务器和程序;被 robots 拦截会明确提示。注意,抓取测试成功不等于一定收录,收录还取决于内容质量和索引策略,但抓取被挡时收录基本无望。
定位到原因后再动手,不要同时改多项,否则复查时分不清哪一步起了作用。
index,follow。模板批量输出的标签要改模板,而不是逐页改。如果时间和人手有限,先处理影响面最大的那一项:整站被 robots 挡住,优先级最高;单页 noindex 只影响单页,可以稍后处理。
修改后重新运行抓取测试,确认返回状态和源码符合预期。之后观察服务器日志中该搜索引擎的抓取记录是否恢复,以及索引状态是否变化。
比较时要注意干扰因素:搜索需求本身有季节波动,数据采集也有延迟,所以不要用改动前后一两天的数据下结论。更稳妥的做法是记录改动日期,观察两到四周的趋势,同时确认没有其他改动同时发生。如果复查后抓取仍被挡,回到观察步骤,重新检查是否还有第二处限制没被发现。
下一步:挑一个当前不收录的重点页面,按上面的顺序跑一遍抓取测试,把命中的限制项记下来,再决定先改哪一处。