数据抓取

如何分析竞争对手的品类结构与产品目录缺口

品类分析首先是一个匹配问题,其次才是比较问题。如何枚举产品目录、诚实地匹配产品,并将真正的缺口与噪音区分开来。

Chris Collins

Chris Collins

2026年9月7日 · 1 分钟阅读

品类分析听起来像是集合运算。拿他们的品类,拿你的,做减法。差集就是机会。

这个算术本身很简单。决定答案对错的一切都发生在算术之前:你是穷举了他们的品类还是只是抽样了它,以及”同一个产品”在他们网站和你的网站上是否真的被识别为同一个产品。只要有一个环节出错,减法就会产出一份看似可信的机会清单,而这份清单大多是伪影。

匹配问题就是全部问题

同一件商品在每个销售它的零售商那里描述都不同。不同的标题惯例,不同的品牌拼写,不同的包装规格,不同的捆绑方式,以及在各自公司之外毫无意义的内部SKU。

如果你的匹配器在百分之二十的商品上失败,那么他们品类中的百分之二十看起来像是你应该填补的差距,而你自己品类中的百分之二十看起来像是独特的差异化优势。这两个结论都是错的,而且错的方向恰好是让分析看起来更有价值的方向,输出结果中没有任何东西会标记出这一点。

按以下顺序进行匹配:

首先是标准标识符。 GTIN、UPC、EAN、MPN。在这些标识符公开发布的地方,它们接近于确定无疑,在任何可用的情况下都应作为你的主键。

其次是品牌加规范化型号。 大力规范化:大小写、标点符号、空白字符、品牌别名、常见缩写。保存规范化后的形式,以便日后可以审计匹配决策。

第三是属性匹配。 尺寸、颜色、容量、包装数量。这里包装规格造成的损害最大,因为六件装和单件是真正不同的产品,却几乎共享所有属性,而且经常共享同一个标题。

始终对样本进行人工审核。 抽取一份随机的匹配和不匹配样本,让人来检查。这会产生一个让其他一切都能被解读的数字:你的匹配率。一份未附带这个数字的分析,是没人能衡量其误差大小的分析。

穷举,不要抽样

第二个失误是把爬取当成普查,而它实际上只是抽样。

大多数品类展示页面对可以显示给你的内容设有上限。无论一个分类声称有多少产品,分类列表页可能在固定页数处就停止了。搜索结果通常比分类遍历受到更严格的限制。筛选器和分面往往是触及长尾商品的唯一途径,通过将一个大分类切分成足够小、能被完整返回的片段。

实际的方法是遍历分类树而不是使用搜索,对任何结果数超过可见页数上限的节点进行细分,并为每个节点记录声称的产品数量和你实际检索到的数量。第二个数字才是你的证据。当声称数量与检索数量出现偏离时,你就找到了自己可见范围的边界,超出这个边界的一切都会呈现为你品类中的差距,而不是你数据中的差距。

不同零售商之间的分类结构也不同,所以不要假设他们的分类就是你的分类。在产品层面进行匹配,之后再汇总到你自己的分类体系中。

针对特定零售商的技术细节见抓取Amazon产品数据监控产品可用性和库存

品类是分地区的

同一个零售商在不同市场经营不同的品类组合,而且经常按不同的店面提供完全不同的品类。

如果你的采集只从一个国家进行,那么他们仅在其他市场销售的每一个产品都会显示为缺失,而他们仅在你恰好采集数据的那个市场销售的每一个产品都会显示为普遍存在。对于一个跨市场经营的企业来说,这不是一个小小的修正,它会改变哪些差距是真实的。

带有国家定向功能的住宅代理能让每个市场的品类保持独立。使用Shifter网关时,定向和会话信息写在针对p.shifter.io:443的凭据中:

customer-USERNAME-country-es-sid-cat-es-0119-ttl-600:PASSWORD

country-es设定市场,sid-cat-es-0119在整个分类遍历过程中保持一个出口不变以确保分页的连贯性,ttl-600将该地址保留十分钟。规则是每次分类遍历使用一个会话,而不是每次页面请求使用一个会话。在遍历过程中途轮换,正是导致两个不同视角的页面混入同一份品类快照的原因。

保持并发量适度,遇到错误时退避而不是硬冲,方法见速率限制和请求节流。产品视图见用于电商的住宅代理页面。

四种输出结果

一旦产品完成匹配、品类完成枚举,比较就会产生四种截然不同的结果,而混淆它们是最常见的分析错误。

真实差距。 他们有,你没有。这是标题性的输出结果,只有与你的匹配率成比例才可信。

反向差距。 你有,他们没有。通常被忽视,而且通常更有价值,因为这是你的差异化库存,营销团队可以立即据此行动。

深度差距。 双方都经营这个品牌,他们有四十个SKU,你有六个。这在朴素的集合差运算中很少显现出来,因为该品牌在双方都存在,但它往往是整个分析中最大的商业发现。

幻影差距。 披着真实差距外衣的匹配失误。每份分析都有这种情况。问题在于你是否测量了它们有多少。

报告前三种结果,同时给出第四种的量化数字。“在百分之九十一匹配率下的两百四十个真实差距”是一个可用的发现。“两百四十个差距”则是一个即将浪费品类经理一周时间的数字。

更新节奏与偏移

品类变化的速度比价格慢得多,这很方便:每周或每两周进行一次完整枚举通常就足够了,对于正处于激烈竞争中的品类可以采用更快的节奏。

比频率更重要的是稳定性。在各次运行之间保持遍历方式、匹配规则和分类映射固定不变,并进行版本管理。如果你的差距数量急剧下降,首先要问的问题是他们的品类组合变了,还是你的匹配器变了。逐次运行对比匹配率和检索数量的差异,几秒钟内就能回答这个问题,并避免大量分析工作被浪费。

常见问题

多高的匹配率才足以据此采取行动?

高于百分之九十对于品类层面的决策是可行的。低于百分之八十,差距清单大多是匹配噪声,此时的精力应该投入到匹配器上,而不是分析上。

枚举时应该使用搜索还是分类遍历?

分类遍历,当某个节点超过页数上限时用分面进行细分。搜索受到的限制更严格,而且其排序是个性化的,这使它成为一个糟糕的枚举工具。

如何处理第三方卖家的市场listing?

将它们作为单独的集合来追踪。将自营和市场listing混在一起会高估竞争对手的既定品类范围,因为第三方listing并不是他们自己做出的采购决定。

如果他们不公布标准标识符怎么办?

更加依赖规范化的品牌和型号,接受较低的匹配率,并诚实地测量它。有些品类,尤其是服装和自有品牌,永远无法干净利落地匹配,正确的应对方式是报告置信度而不是确定性。

结论

品类分析末尾的比较是算术运算。真正的工作在上游:穷举一个品类而不是抽样它,清楚自己的可见范围止于何处,用一套可审计的规则匹配产品,并将真实差距与深度差距、匹配失误区分开来。

分市场分别采集,在整个遍历过程中保持会话连贯,将声称数量与检索数量对照记录,并在每个差距数字旁边公布你的匹配率。价格信息见定价页面

准备好开始了吗?

试用 Shifter 住宅代理,205M+ 个 IP,195+ 个国家,低至 $0.10/GB。

立即开始