重复页面排查的核心不是“找两个一模一样的网址”,而是找出内容高度相似、却能被分别访问和收录的页面。做法是先用站内抓取列出所有可访问URL,再按标题、正文指纹和规范链接分组,最后决定保留哪个、合并哪个、跳转哪个或加noindex。最关键的一步是分组后只保留一个主版本,其余页面用301或规范标签指向它,而不是让多个版本同时参与收录。
不要凭感觉挑页面。先导出站点地图和内部链接报告,把返回200状态码的URL全部列出。常见重复来源包括:带与不带www、http与https、结尾带与不带斜杠、大小写不同、带跟踪参数、分页参数、打印版本、排序筛选参数,以及同一内容被归到多个栏目路径下。
/a和/a/两个可访问版本。这一步的产出是一张URL清单,至少包含地址、状态码、页面标题、规范链接和被抓取到的内部链接数。没有这张清单,后面的判断容易变成猜。
把每个页面的标题、H1、正文前若干段提取出来,去掉导航、页脚和广告后做文本指纹。指纹相同或高度接近的URL归为一组。然后看组内每个页面的规范链接指向谁:如果都指向同一个地址,说明重复已被部分控制;如果各自指向自己,说明需要处理。
假设一个项目有三条URL:/product/100、/product/100?color=red、/product/100?sort=price。前一条是主版本,后两条只是参数变化。若参数不影响页面主要内容,可让后两条用301跳回主版本;若参数确实产生不同内容,则应保留独立页面并各自写清标题和规范链接。判断依据是“用户看到的内容是否因参数发生实质变化”,不是参数名称本身。
处理方式按优先级排列:
noindex并确保不被内部链接大量暴露。最关键的一步是“组内只留一个主版本”。如果同一组里两个页面都保留自指规范链接,搜索引擎仍可能分别选择和收录,重复问题没有真正解决。
改动上线后,先抽查跳转链:用抓取工具访问旧URL,确认返回301且最终落到正确主页面,没有跳转链过长或跳到无关页。再检查主页面规范链接是否自指,次要页面是否指向主页面。最后观察站点地图中是否还包含已被合并的URL;如果包含,应更新站点地图,避免继续提交重复地址。
比较前后数据时要注意:一次改动前后比较要考虑季节、搜索需求变化和数据采集差异。不要因为某天抓取量下降就断定改动失败,也不要因为某天收录数上升就断定成功。更可靠的判断是看重复URL组是否减少、主版本是否稳定获得内部链接、旧URL是否逐步退出抓取队列。
重复页面往往不是一次清理就结束。新栏目上线、参数规则调整、旧内容迁移、多语言或移动版改版,都可能重新产生重复。建议在发布前做三项检查:新页面是否有唯一标题和自指规范链接;是否与已有页面内容指纹高度接近;是否生成了不必要的参数URL。发布后定期抽查站点地图和抓取报告中的状态码异常。
下一步可以直接做一件事:从站点地图中随机抽取20个URL,按标题和正文指纹分组,找出其中规范链接指向不一致的组,先处理这一批。这比一次性全站重写更快暴露问题,也更容易验证处理方式是否有效。