概念 MoE(混合专家)

MoE(混合专家)

概念 1 min read · 2026-05-04 #concept#architecture#training#model

MoE(Mixture of Experts,混合专家)是一种将计算稀疏化的模型架构:只激活一部分专家网络处理每个 token,而非让全部参数参与计算。

核心原理

  • 模型包含多个"专家"子网络
  • 门控机制(Router)根据输入决定激活哪些专家
  • 每个 token 只激活少量专家,实现稀疏计算,降低每 token 的计算成本

与 Engram 的关系

Engram 定位为 MoE 之外的另一条稀疏轴 ^[raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md]:

维度MoEEngram
稀疏化对象计算(只激活部分专家)存储(只查部分条目)
作用减少计算量减少静态知识的推理开销
互补性两者不冲突,可叠加使用

实验表明,固定总参数后让 MoE 专家和 Engram 记忆抢预算,约 20%-25% 稀疏参数分给 Engram 时模型 loss 最低——纯 MoE 不是最优解。

应用

  • DeepSeek-V3/V4 均采用 MoE 架构
  • DeepSeek-V4 在 MoE 基础上引入 mHC、CSA、HCA 等创新
  • Engram 组合可进一步释放模型能力

关联

  • Engram — MoE 的互补稀疏轴
  • DeepSeek — MoE 架构的重要实践者

来源

DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md