重复页面排查最先要做的不是改标题或写canonical,而是先把“同一内容存在多个可访问URL”的清单拉出来,再判断哪一组重复正在分散排名信号。时间和人手有限时,优先处理被内部链接或站点地图推荐的重复版本,因为它们最可能被搜索引擎抓取和选择。
不要凭记忆猜重复页面,按可核对的入口收集:
?sort=、?page=、?color=等参数是否生成可访问页面,且没有规范指向。把结果整理成三列:主版本URL、重复版本URL、重复来源(参数、大小写、斜杠、分页、打印页等)。这一步只做记录,不急着改。
判断优先级看两个信号:该重复URL是否有内部链接指向,以及是否出现在站点地图中。两者占其一,就先处理。常见处理方式:
rel="canonical",指向选定的主版本。noindex,但不要同时用robots.txt屏蔽又指望noindex生效——被屏蔽的页面无法被读取noindex。最关键的一步是选对主版本:选已经有外部链接或稳定点击的那个URL,而不是选你觉得“看起来更干净”的那个。选错主版本,等于把已有信号主动丢弃。
改动后不要只看首页排名。取改动前记录的那批重复URL,逐项检查:
比较时注意:搜索需求会随季节波动,数据采集也可能有延迟。不要用改动后三天的数据直接断定“有效”或“无效”,至少观察一个完整的抓取和更新周期,并对比同类未改动页面的变化作为参照。
重复页面会随新功能、新参数、新模板不断产生。人手有限时,不必每月全站扫描,可以固定在两类时机检查:上线新筛选或分页功能后,以及发布大批量内容后。检查项只保留三个:新增URL是否有唯一主版本、是否有canonical、是否被站点地图或内部链接推荐。发现重复后按前面的优先级处理,不积压。
下一步:从站点地图导出全部URL,按参数、大小写、斜杠、分页四类分组,先标出同时有内部链接和站点地图推荐的重复组,从这一组开始处理。