概念 ›MoE(混合专家)
MoE(Mixture of Experts,混合专家)是一种将计算稀疏化的模型架构:只激活一部分专家网络处理每个 token,而非让全部参数参与计算。
核心原理
- 模型包含多个"专家"子网络
- 门控机制(Router)根据输入决定激活哪些专家
- 每个 token 只激活少量专家,实现稀疏计算,降低每 token 的计算成本
与 Engram 的关系
Engram 定位为 MoE 之外的另一条稀疏轴 ^[raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md]:
| 维度 | MoE | Engram |
|---|---|---|
| 稀疏化对象 | 计算(只激活部分专家) | 存储(只查部分条目) |
| 作用 | 减少计算量 | 减少静态知识的推理开销 |
| 互补性 | 两者不冲突,可叠加使用 |
实验表明,固定总参数后让 MoE 专家和 Engram 记忆抢预算,约 20%-25% 稀疏参数分给 Engram 时模型 loss 最低——纯 MoE 不是最优解。
应用
关联
来源
DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md