Engram 是 DeepSeek 与北大联合提出的条件记忆模块(Conditional Memory),2026年1月12日发表于 arXiv(2601.07372)。核心思想:给 Transformer 加一个原生知识查表模块——能查的别算,先查一下 ^[raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md]
核心动机
语言建模包含两种性质不同的任务:
- 深度动态计算:组合推理,需要逐层特征拼凑
- 静态知识检索:如「伦敦是英国首都」,本质是查表
传统 Transformer 把两者混在一起。论文举例:识别「Diana, Princess of Wales」需要走 6 层才能完成,前几层纠结于「Wales 是英国地区」、「Princess of Wales 是头衔」等中间状态。这种用昂贵运行时计算重建静态查找表的工作,本可以让深层网络做更高阶推理。
技术方案
- 位置:在 Transformer 的第 2 层和第 15 层之间各插入一个 Engram 模块
- 机制:每个位置的输入触发一次哈希查找,将当前 token 和前几个 token 组成的 N-gram 映射到巨大嵌入表,直接取出对应向量
- 门控:查到的内容与当前上下文不匹配时自动屏蔽(如「张」是常见姓氏,但「张仲景」三字组合是固定历史人物实体)
- 哈希实现:论文中使用多头哈希,TaoLin 研究了 Minimal Perfect Hash Function 替代方案(结果反直觉:无冲突设计无稳定提升)
- 与 MoE 互补:MoE 把计算稀疏化(只激活部分专家),Engram 把存储稀疏化(只查部分条目)
核心实验结果
最优参数分配
固定总参数和每 token 激活参数,让 MoE 专家和 Engram 记忆抢预算,得到 U 形曲线:纯 MoE 不是最优解,把约 20%-25% 的稀疏参数分给 Engram 时模型 loss 达到最低点。
Engram-27B 验证
| 指标 | MoE-27B 基线 | Engram-27B | 提升 |
|---|---|---|---|
| MMLU | - | - | +3.4 |
| CMMLU | - | - | +4.0 |
| BBH | - | - | +5.0 |
| ARC-Challenge | - | - | +3.7 |
| HumanEval | - | - | +3.0 |
| MATH | - | - | +2.4 |
| Multi-Query NIAH | 84.2% | 97.0% | +12.8pp |
知识密集型任务提升符合预期,但通用推理和代码数学的提升超出预期。
为什么记忆模块能提升推理?
LogitLens 和 CKA 分析显示:Engram-27B 第 5 层的表征,与 MoE 基线第 12 层的表征最相似。Engram 把早期层从「重建静态知识」中解放出来,变相加深了网络。
工程特性
- 1000 亿参数 Engram 表整个放到 host DRAM,H800 上推理,8B-Dense 吞吐损失仅 2.8%
- Engram 索引具有确定性(只取决于输入 token 序列),可提前计算,CPU 异步预取与 GPU 计算重叠
- 天生不靠 HBM,适合大规模嵌入表卸载到 DRAM 或 CXL 内存池
后续研究进展
CXL 内存池化(2026.03.10)
北大、阿里云、山东英信、人大、港大联合论文(arXiv: 2603.10087)。将 Engram 嵌入表放入 CXL 内存池:GPU HBM 放计算权重,本地 DRAM 做二级缓存,CXL 池做三级。8 台服务器共享 4TB 内存池,集成进 SGLang,端到端吞吐损失 <5%。
无冲突热层实验(2026.01.23)
TaoLin 单作者论文(arXiv: 2601.16531)。验证"消除哈希冲突是否能提升性能"——结果反直觉:严格 iso-parameter 控制下,无冲突设计没有稳定提升验证 loss。训练初期热路径 loss 更低,但训练后期冷路径反超。
视觉 Tiny Engram(AutoArk)
AutoArk 基于 Qwen-3 复现文本 Engram 后,将其搬到 Stable Diffusion。视觉 patch 经分层编码后丢进哈希查表。与 LoRA 对比:同等效果下,Engram 额外参数仅 LoRA 的 15%-30%,且连续注入多个新概念时不会出现概念退化。
论文评价
Engram 论文摘要结尾写道:「我们认为条件记忆将是下一代稀疏模型不可或缺的建模原语。」但 DeepSeek-V4 未采用 Engram,代码仓库(deepseek-ai/Engram)最后一次提交停在 1 月 14 日。社区期待 V5 或 V4.1 能整合 Engram。