RFM 模型把客户分 3—9 层够用但太粗,KMeans 聚类能在 7 个维度上切出真正有差异的 5 类客户,但 90% 的电商团队听过名字不会用。本文给一套不写代码也能跑通的方法:维度选择 → 数据清洗 → 聚类 → 解读 → 落地,每个客户类型对应什么运营动作都说清楚。
KMeans 是个学术词,但电商应用没那么神秘——本质就是「用数据自动找差异」。这篇给一套不写代码也能跑通的方法。
第一节:什么时候该用 KMeans
- 3 个条件同时满足才考虑用:①客户数 > 1000 / ②订单数据完整 / ③运营团队能接受 5 类分层;
- 不满足任意一个就用 RFM;
- 适合场景:精细化私域运营、个性化推荐、差异化营销;
- 不适合场景:新店冷启动、小店简单运营、决策时间紧迫;
- 别为了「听起来高端」用 KMeans,业务用不上的工具就是噪音。
第二节:第一步——选 7 个核心维度
- 维度太少切不出差异,太多模型会过拟合;
- 电商场景的 7 个黄金维度:
- ① 累计消费金额(M)
- ② 最近购买距今天数(R)
- ③ 总订单数(F)
- ④ 平均客单价(M ÷ F)
- ⑤ 购买品类宽度(买过几个不同类目)
- ⑥ 退款率
- ⑦ 评价频次(带评率);
- 这 7 个维度覆盖消费力 + 行为 + 偏好 + 质量4 个角度。
第三节:第二步——数据清洗与标准化
- 拉数据:从订单系统、客服系统、评价系统导出最近 12 个月的客户级数据;
- 清洗:①剔除测试单 / 内部单 / 异常单 / ②补全缺失字段 / ③用「默认值」填空字段(比如没退款用 0);
- 标准化:消费金额几千 vs 订单数几次,单位不同 KMeans 会被金额主导;
- 解决方法:z-score 标准化——所有维度都转化到「距均值多少倍方差」的尺度;
- Excel 公式:
=(A1-AVERAGE($A:$A))/STDEV($A:$A),一秒搞定。
第四节:第三步——确定聚类数 K
- 用「肘部法则」找最佳 K 值;
- 简化版:分别跑 K=3,4,5,6,7 五次,看「类内方差平方和」的下降曲线;
- 曲线突然变平的那个点 = 最佳 K;
- 电商场景一般 K=5 最优,少数情况是 4 或 6;
- 不要纠结找「完美 K」——业务用得了的就是好 K。
第五节:第四步——5 个客户类型的解读
- 跑出 5 个 cluster,每个 cluster 看 7 个维度的均值,命名:
- 类型 A:超级 VIP —— 高消费、高频、近期活跃、低退款;
- 类型 B:稳定老客 —— 中消费、中高频、近期活跃、低退款;
- 类型 C:偶尔消费型 —— 中消费、低频、长间隔、跨品类;
- 类型 D:价格敏感型 —— 低客单、高频、买促销品、退款率高;
- 类型 E:流失风险型 —— 60+ 天没买、原本是 B 类、近期退款;
- 命名要业务化——避免「Cluster 1」「Cluster 2」这种数学语言。
第六节:第五步——每类客户的运营动作
- A 类(超级 VIP):专属客服 + 内购预售 + 新品首发 + 0 推送广告(他们不喜欢被推送);
- B 类(稳定老客):定期福利 + 节点活动 + 主营品类新品推荐 + 月度 EDM;
- C 类(偶尔消费型):跨品类种草 + 新品测试 + 节假日大促重点触达;
- D 类(价格敏感型):限时秒杀 + 满减券 + 加群专属优惠 + 控制退款政策;
- E 类(流失风险型):流失唤醒 + 高额回归券 + 1 对 1 主动沟通 + 调研流失原因;
- 5 套运营动作,90 天内能看到复购率明显提升。
第七节:聚类结果的稳定性检查
- 跑完聚类不要立刻信——先做 3 个稳定性检查:
- ① 类别人数均衡度:每个 cluster 占比 10—30% 较合理,单类 > 50% 或 < 5% 都不正常;
- ② 跨期稳定性:拿上个月的数据再跑,看同一客户的归类是否一致;
- ③ 业务可解释性:每类客户的特征业务团队能不能秒懂——不能秒懂就是没用;
- 3 项都通过才能落地,否则重新选维度或调 K。
第八节:聚类与现有客户标签结合
- 不要把 KMeans 当成「取代标签」的工具,它是标签的「自动生成器**」**;
- 5 个 cluster 各自成为 1 个自动更新的标签:「A 类客户」「B 类客户」等;
- 原有的手工标签(如「孕妇」「学生」)继续保留;
- 客户最终有 2—3 个标签并存:1 个自动聚类 + 1—2 个手工属性;
- 运营动作根据多标签交叉触发,精度比单标签高 3 倍。
第九节:每月怎么更新聚类
- 月度自动化:月初 1 号跑一次最近 90 天数据的 KMeans;
- 用同样的维度 + 同样的 K;
- 输出:每个客户的新 cluster + 与上月对比的「类型变化」;
- 关注 3 类变化:①B → A 升级(VIP 培育成功)/ ②B → E 退化(流失预警)/ ③D → B 升级(价值化教育成功);
- 这些变化是运营效果的实时反馈——比看总 GMV 准 10 倍。
第十节:常见的 5 个误区
- 误区 1:把 KMeans 当「预测模型」用——它只是分类,不预测;
- 误区 2:维度选 20 个—— 「多 ≠ 好」,7 个最优;
- 误区 3:K 值越大越好——5 类已经够,太多记不住;
- 误区 4:聚类结果丢给业务不解读——模型 80% 价值在解读;
- 误区 5:跑完一次就不更新——客户在变化,模型要跟着更新;
- 避开这 5 个误区,KMeans 才能真正驱动业务。
第十一节:写在最后
KMeans 在电商不是「炫技」,是让运营动作精准化的工具。
不用 KMeans,运营只能凭感觉;用了 KMeans,每个客户都有自动归类 + 对应动作 + 月度跟踪。
工具不复杂,复杂的是让运营团队相信「数据比经验靠谱」。
常见问题
以下为可见 FAQ,与 FAQPage 结构化数据一致。
先 RFM 后 KMeans。RFM 是 3 个维度的固定切分,足够用 80% 的场景。KMeans 适合店铺有 5000+ 老客户且想做精细化运营时使用。新店、小店用 RFM 就够。
可以。腾讯文档表格、Excel 的「数据分析」插件、Tableau、PowerBI 都内置了聚类功能。但要看得懂结果——这才是核心难点。
至少 1000 个有完整数据的客户。少于这个量聚类结果不稳定,5000 个以上效果最好。但有效订单数据更重要——只下过 1 单的客户参考价值低。
电商场景 4—6 类最实用。少于 4 类等同于 RFM 没必要用 KMeans,多于 7 类运营人员记不住、用不上。5 类是黄金分割。
月度更新 + 季度大调。每月用最近 90 天数据重新跑,看客户类型是否变化。每季度复盘模型是否还合理——业务变化大时模型可能要换维度。


评论一下吧
取消回复