核心要点
做电商独立站的,几乎都逃不开分面导航(Faceted Navigation)——左侧那排”按颜色筛、按尺寸筛、按价格区间筛、按品牌筛”的过滤条件。用户体验很好,但它在 SEO 上是个暗雷。
问题不在筛选本身,而在于:每一次勾选组合,都会生成一个新 URL。颜色×尺寸×价格×品牌,排列组合下来可能是几千上万个页面。其中绝大多数是 Google 根本不该索引的低价值页。不少站点的”已收录页面数”里,一大半是这种筛选垃圾,真正有价值的分类页反而被挤到抓取队列后面。
本文讲清分面导航会惹什么祸、以及怎么把这几万个 URL 优雅地收口,既保住筛选体验,又不拖累 SEO。系统打法我们放在 SEO 优化指南 里讲过,核心就一句:该索引的才索引。
什么是分面导航,为什么会爆 URL
分面导航就是”多维过滤”。一个卖鞋的站,用户能按颜色(红/蓝/黑)、尺码(38–46)、价格(0–50/50–100)、品牌同时筛选。技术上每加一个筛选参数,URL 就多一段:/shoes?color=red&size=42&price=50-100&brand=nike。
组合数 = 各维度取值的乘积。假设颜色 10 个、尺码 9 个、价格 5 档、品牌 20 个,光这四项就能组合出 10×9×5×20 = 9000 个 URL。再叠加排序参数(price-asc/desc)、分页(page=2),轻松破万。
这些页里,大部分内容高度重叠(只是筛选条件不同),Google 一眼能看出是”近重复”。如果全部放任索引,灾难就来。
三大危害
1. 抓取预算被浪费 Google 给每个站分配一定的“抓取预算”(crawl budget)。前面讲过的 JS 渲染对 SEO 的影响 里也提到,渲染队列本身就在吃抓取预算,分面垃圾页会进一步挤占它。爬虫时间有限,如果你的站点几万个页面里九成是低价值筛选页,它花大量精力爬这些,反而没空爬你真正重要的产品页和分类页。我们审计过的几个大 catalog 站,抓取统计里 70%+ 是筛选参数页,核心页反而抓取慢、更新滞后。
2. 重复内容信号 几千个”近重复”页面,会让 Google 难以判断哪个才是规范的、该排名的版本。它可能随便挑一个低质量组合页来呈现,或者直接认为你站内容稀薄。权重被稀释到一堆垃圾页上,谁都排不好——这跟主题集群里讲的“权重要聚不要散”正好相反。
3. 长尾词误匹配 某些筛选组合页(比如”红色+42码+预算50内”)确实可能有真实长尾需求,但绝大部分组合没搜索量。放任全部索引,等于让无需求的页占着茅坑,有需求的页反而没被好好优化。
正确的收口策略
核心原则:只让”窄而深、有真实需求”的筛选页被索引,其余一律挡掉或收口。
第一层:基础分类页必须索引
/shoes、/shoes/running 这种人工定义的主分类,是 SEO 主力,全部索引、认真优化标题和描述。
第二层:高价值筛选组合,单独放行 如果你发现”红色跑步鞋”这种组合有稳定搜索量,就把它当成一个正经着陆页来做:独立优化标题、补一段引导文案、保证内容不空。这类”窄而深”的页值得索引。
第三层:绝大多数组合,用 canonical 指回基础页
对没有单独优化价值的筛选页,在 HTML 里加 <link rel="canonical" href="基础分类URL">。告诉 Google”我是基础页的变体,别单独索引我,权重归它”。这是最常用也最有效的收口手段。
第四层:纯参数垃圾,robots 挡或 noindex
对”多条件叠加、无独立意义”的组合(比如 color+size+price+sort 四个参数齐活的),直接在 robots.txt 里 Disallow 对应参数,或加 noindex。别让爬虫浪费时间。
GSC 里设 URL 参数
Google Search Console 有”网址参数”工具,可以告诉 Google 某个参数(如 sort、page)“不改变内容,忽略它”。这能减少重复抓取。不过 canonical 和 robots 是更稳的主手段,参数工具是辅助。
实操步骤
- 导出全站 URL,筛出带筛选参数的(? 后有多段)。
- 按”参数个数”分层:单参数(如只筛颜色)可酌情放行;三参数以上基本挡掉。
- 找出有真实搜索量的”窄深”组合,列成白名单,单独优化并索引。
- 其余筛选页统一加 canonical 指回对应基础分类。
- robots.txt 里 Disallow 高参数组合模式(如
*?*&*&*这类多参数)。 - 更新 XML sitemap,只放该索引的页(基础分类+白名单筛选页),不要把垃圾组合塞进去。
- 上线后看 GSC 抓取统计,确认参数页抓取占比下降、核心页抓取变勤。
常见误区
误区一:筛选页全部 noindex,图省事 结果用户从 Google 搜”红色跑步鞋”进来,发现没有对应页可索引,白白丢了长尾流量。正确做法是”分层”,不是一刀切。
误区二:靠 canonical 就万事大吉,不挡 robots canonical 是”软信号”,Google 仍会来抓这些页确认。参数组合太多,抓取预算照样被吃。canonical + robots 双管才彻底。
误区三:把筛选组合全写进 sitemap sitemap 里塞几万个筛选 URL,等于主动告诉 Google”这些都重要”。恰恰相反,sitemap 应该只放你真想索引的页。
误区四:忽略排序/分页参数
?sort=price-asc 和 ?page=2 也是参数,也会造重复。这些通常该 canonical 回基础页或 robots 挡,别漏了。
常见问题
我的站筛选组合不多,也要管吗?
看规模。小站(几百个 URL 以内)影响有限,简单加 canonical 就够。一旦 catalog 上千 SKU、筛选维度多,就必须系统收口,否则抓取预算问题会肉眼可见地拖慢核心页收录。
canonical 指回基础页,那筛选页的流量不就没了?
筛选页本来就不该靠 SEO 拿流量,它是”站内导航工具”。真正有搜索量的窄深组合,你应该把它当正经着陆页单独做(不走 canonical),而不是指望一个自动生成的筛选 URL 去排名。
用 JavaScript 筛选、URL 不带参数,是不是就没这问题?
URL 不带参数确实少了一层麻烦,但前提是筛选结果不生成可被抓取的独立链接。如果筛选后仍产出可被爬虫发现的 URL(比如 pushState 改了路径且被 sitemap/内链暴露),问题还在。关键看”爬虫能不能拿到独立 URL”,不只是看参数形式。
收口之后,已收录的垃圾筛选页多久消失?
提交 canonical/ robots 后,Google 重新抓取并重新评估需要时间,可能几周到几个月。急的话可以在 GSC 里对已确认无价值的参数页做”移出索引”操作,但更稳的还是靠 robots + canonical 长期生效。
分面导航是”体验好、SEO 险”的典型。处理好,它帮你承接长尾;处理不好,整站权重被几万个垃圾页稀释。如果你打开 GSC 发现已收录页面里大半是 ? 参数页,那基本就是这个问题。我们可以帮你做全站 URL 审计,把该索引、该 canonical、该挡的分层列清楚,再落到 robots 和模板里。具体联系我们,也可以看我们的 SEO 优化服务。