电商场景里,1B以下的小模型能做到百毫秒级响应,但性能上限有限。10B左右的模型推理耗时5-10秒,刚好适配异步实时决策的窗口。
DeepSeek V4 Flash激活参数13B,推理速度覆盖这个区间,性能比同量级小模型强。更大的模型激活参数不在这个区间,要么跑不动,要么太慢,只能退而求其次用性能弱的小模型。
这个版本给异步实时决策场景提供了新选项,速度够,性能碾压同量级模型。在电商的实时推荐、智能客服、风控拦截、主动服务里,能大规模落地产生业务价值。它不是比顶级大模型强,而是补上了异步实时场景里性能和速度的空白。