重复页面排查的核心,是找出内容主体相同或高度相似、只是URL不同的一组页面,然后判断哪一条应该保留、其余如何处理。对手机网站来说,这件事比桌面端更容易被忽略,因为移动端常出现带参数、带端口、带m子域、带分享追踪码的地址,同一篇内容可能被生成好几份。下面用一个假设例子说明排查步骤。
假设某手机端资讯站做了一次改版,原来文章地址是 /article/123,新版增加了频道路径,变成 /news/tech/article/123。改版后没有做跳转,旧地址仍能打开,新地址也被站内推荐位大量引用。一段时间后,搜索结果显示同一篇文章出现两个标题相近的条目,移动端流量分布变得分散。
这个例子里,重复并不是“复制粘贴了两篇文章”,而是同一内容被两个可访问URL同时暴露。排查时要先确认这一点,再决定保留哪个版本。
www、不带 www、http、https、带 ?from= 分享参数的地址访问,记录哪些能正常打开。rel="canonical"),指向的是哪一个版本。这里的关键判断是:如果多个URL返回相同正文,且没有互相指向同一个规范地址,就属于需要处理的重复页面。如果只是URL不同、正文确实不同,那不算重复,不要误删。
移动端列表页带分页参数时,?page=2 和 ?page=3 内容不同,不能当作重复页面合并。商品筛选页如果筛选后展示的商品集合不同,也各有独立价值。真正需要警惕的是以下几类:
一个常见错误是只改站内链接,不管旧地址是否还能打开。只要旧地址仍返回正常页面,重复就可能继续存在。另一个错误是给所有带参数的地址都加规范链接,指向不带参数的版本,但实际内容确实随参数变化,这样会把有效页面错误合并。
确认重复后,先确定保留哪个版本。判断依据可以按这个顺序:哪个地址已经被站内主要入口引用、哪个地址结构更稳定、哪个地址更适合长期使用。确定保留版本后,其余版本的处理方式包括:
改动后不要立刻下结论。移动端流量会受季节、活动、搜索需求变化影响,比较前后数据时要看同一类页面、同一时间段,并注意数据采集是否完整。一次改动前后有波动,不等于重复问题已经解决或没有解决。
先挑一个内容量不大的栏目,按上面的步骤把该栏目所有能打开的URL列出来,标出内容相同的组,再决定保留哪一个。完成这一组之后,把同样的方法扩展到全站主要栏目。如果站点使用模板生成页面,检查模板里规范链接的写法是否随URL变化,这往往比逐页修改更省力。