概念 FP4(4位浮点量化)

FP4(4位浮点量化)

概念 1 min read · 2026-05-04 #concept#optimization#inference#model

FP4(4-bit Floating Point)是使用 4 位浮点数表示模型权重的量化格式,大幅减少模型存储和推理内存需求。

在 V4 中的应用

DeepSeek-V4 采用 FP4 + FP8 混合精度

参数类型精度说明
MoE expert 参数FP4大量但每次只激活少量
其他参数FP8共享层、注意力等

效果:V4-Pro 从理论 ~3.2TB 压缩到 ~865GB。

量化精度演进

FP32 → FP16 → BF16 → FP8 → FP4,每一步精度降低但效率提升。

关联

  • DeepSeek — V4 中采用 FP4 量化
  • MoE — FP4 量化的天然受益者
  • HBM — FP4 减少的目标资源
  • Muon — 配合 FP4 的训练优化器

来源

DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md