预测质量四面板
01

误差:预测与实际差多少

02

偏差:是否持续高估或低估

03

分层:品类、SKU、门店与周期

04

可用性:缺货和新品标记

05

行动:库存、服务与资金成本

结论:平均误差小不代表补货可用

A 商品高估 100 件、B 商品低估 100 件,汇总误差可能接近零,但 B 仍会缺货。

同时看绝对误差和有方向的偏差,并按实际补货粒度评估。

指标要匹配业务规模

MAPE 在实际销量为零或很小时会失真;WAPE 便于看总体量级,但可能被大单品主导。

应同时展示样本覆盖、零销量比例、中位误差和不同价值层级的结果,不能用一个分数淘汰所有模型。

实际销量不总等于真实需求

缺货时记录的是卖出量,不是未满足需求;促销、调价、渠道限流和新品首发也会改变可比性。

训练和评估数据应标记这些事件,必要时把缺货期排除或估算受限需求,并说明假设。

把预测误差翻译成经营成本

低估可能导致缺货、加急和服务损失,高估可能增加库存、过期和资金占用。

不同商品成本不对称,同样 20% 的误差可能需要不同策略;模型选择应结合补货周期和业务损失。

用滚动回测验收

按历史时点重新生成预测,只使用当时可见数据,比较多个周期、层级和基线模型,并记录偏差是否持续。

BI0 可作为需求与库存分析候选;预测算法、受限需求修正、回测和补货联动能力需项目确认。

用公式区分误差大小与方向

对时点 t,误差可定义为 e_t = actual_t - forecast_t。MAE 观察绝对偏差的平均规模;RMSE 更重罚极端错误;WAPE = Σ|e| / Σ|actual| 便于组合层理解;bias 可用 Σe / Σactual 或平均误差表示持续方向。必须统一正负号约定,否则“正偏差”在不同团队会表示高估或低估。

任何指标都有盲区。MAPE 遇到零销量会无定义或爆炸,WAPE 容易被头部 SKU 主导,RMSE 对异常峰值敏感。报告应同时给出样本覆盖、零值占比、中位数、分位数和按 ABC 价值层、门店、品类、预测周期的切片,不能把一个总分当作模型质量。

在决策粒度评估并检查层级一致性

补货按“SKU-地点-日”发生,就应在这个粒度衡量短缺风险;公司月总量准确不能弥补门店错配。与此同时,预测可能在 SKU、品类和总量层分别生成,需要检查层级汇总是否一致。若底层预测相加不等于品类预测,计划人员会面对多个互相冲突的数字。

可以使用自下而上、自上而下或层级协调方法,但选择要与数据量和决策责任匹配。评价时分别看各层误差与偏差,并观察错误是否在不同 SKU 之间抵消。连续数周同方向低估,即使平均绝对误差不大,也会持续侵蚀服务水平。

识别被库存截断的需求

缺货日 actual sales 只表示可售数量,不代表客户真实需求。若直接把它作为训练标签,模型会学到“缺货商品需求低”,形成低预测—低库存—继续缺货的循环。需要用库存可用状态、页面曝光、加购、未履约订单或同类门店证据标记 censored demand,并对修正假设单独记录。

促销、调价、新品、渠道限流、门店关闭和一次性大单也会改变可比性。可以排除、加事件特征或分场景建模,但不能在回测后才用未来已知事件“修正”历史输入。每个预测时点只能使用当时可获得的信息,否则会产生数据泄漏和虚假的高准确率。

用滚动原点回测代替一次切分

时间序列不能随机打乱训练测试。应在多个历史决策日重复训练或模拟,分别预测 1、7、14 或交期对应的 horizon,并与季节朴素、移动平均等简单基线比较。每个回测窗口记录当时的数据版本、特征和事件,确保没有看到未来退款、补录或促销结果。

除了统计误差,还要模拟补货结果:缺货天数、服务水平、平均库存、过期和加急。模型 A 的 WAPE 略低,却持续低估高价值 SKU,可能不如更稳健的模型 B。选择标准应由业务成本函数和风险偏好决定,而不是只追排行榜。

建立监控、触发重训与 BI0 边界

上线后监控预测误差分布、偏差漂移、输入缺失、事件覆盖和人工计划改量。连续偏差、商品结构变化或新门店增加可触发调查,但重训不应完全自动;先区分真实需求变化、数据故障和库存截断。保留模型版本和每次预测快照,才能复盘当时决策。

BI0 可作为需求与库存经营分析候选,但算法、层级协调、受限需求修正、回测、监控和补货回写是否存在,需要项目逐项确认。本文不承诺预测会消除缺货,也不提供统一的“最佳指标”;数据稀疏、新品和剧烈结构变化时,应显示区间和人工判断需求。

给计划团队一张可操作的预测质量面板

面板按预测 horizon 和补货粒度展示 WAPE、MAE、bias、零销量占比、缺货标记、样本数和相对季节朴素基线的提升,并单独列出连续低估、高价值和新商品。点击任一异常可回到当时预测版本、可见特征、人工计划改量和实际库存状态。只有把误差连接到具体决策,团队才知道该改模型、数据还是安全库存。

设定分层触发规则:输入缺失先修数据,持续偏差检查事件和模型,局部 SKU 错配检查层级协调,缺货期销量异常检查受限需求。人工计划改量不是噪声,应记录原因并评估是否改善结果。每月用最新成熟窗口回测,但保留旧结论,避免后来补数让历史模型看起来比当时更准确。

公开参考资料

把下一步交给 BI0.AI

预约一次业务场景交流,看看组织化的 AI BI 如何进入你的团队。

了解产品