概念 Engram(条件记忆)

Engram(条件记忆)

概念 4 min read · 2026-05-04 #concept#architecture#optimization#model

Engram 是 DeepSeek 与北大联合提出的条件记忆模块(Conditional Memory),2026年1月12日发表于 arXiv(2601.07372)。核心思想:给 Transformer 加一个原生知识查表模块——能查的别算,先查一下 ^[raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md]

核心动机

语言建模包含两种性质不同的任务:

  1. 深度动态计算:组合推理,需要逐层特征拼凑
  2. 静态知识检索:如「伦敦是英国首都」,本质是查表

传统 Transformer 把两者混在一起。论文举例:识别「Diana, Princess of Wales」需要走 6 层才能完成,前几层纠结于「Wales 是英国地区」、「Princess of Wales 是头衔」等中间状态。这种用昂贵运行时计算重建静态查找表的工作,本可以让深层网络做更高阶推理。

技术方案

  • 位置:在 Transformer 的第 2 层和第 15 层之间各插入一个 Engram 模块
  • 机制:每个位置的输入触发一次哈希查找,将当前 token 和前几个 token 组成的 N-gram 映射到巨大嵌入表,直接取出对应向量
  • 门控:查到的内容与当前上下文不匹配时自动屏蔽(如「张」是常见姓氏,但「张仲景」三字组合是固定历史人物实体)
  • 哈希实现:论文中使用多头哈希,TaoLin 研究了 Minimal Perfect Hash Function 替代方案(结果反直觉:无冲突设计无稳定提升)
  • MoE 互补:MoE 把计算稀疏化(只激活部分专家),Engram 把存储稀疏化(只查部分条目)

核心实验结果

最优参数分配

固定总参数和每 token 激活参数,让 MoE 专家和 Engram 记忆抢预算,得到 U 形曲线:纯 MoE 不是最优解,把约 20%-25% 的稀疏参数分给 Engram 时模型 loss 达到最低点。

Engram-27B 验证

指标MoE-27B 基线Engram-27B提升
MMLU--+3.4
CMMLU--+4.0
BBH--+5.0
ARC-Challenge--+3.7
HumanEval--+3.0
MATH--+2.4
Multi-Query NIAH84.2%97.0%+12.8pp

知识密集型任务提升符合预期,但通用推理和代码数学的提升超出预期

为什么记忆模块能提升推理?

LogitLens 和 CKA 分析显示:Engram-27B 第 5 层的表征,与 MoE 基线第 12 层的表征最相似。Engram 把早期层从「重建静态知识」中解放出来,变相加深了网络

工程特性

  • 1000 亿参数 Engram 表整个放到 host DRAM,H800 上推理,8B-Dense 吞吐损失仅 2.8%
  • Engram 索引具有确定性(只取决于输入 token 序列),可提前计算,CPU 异步预取与 GPU 计算重叠
  • 天生不靠 HBM,适合大规模嵌入表卸载到 DRAM 或 CXL 内存池

后续研究进展

CXL 内存池化(2026.03.10)

北大、阿里云、山东英信、人大、港大联合论文(arXiv: 2603.10087)。将 Engram 嵌入表放入 CXL 内存池:GPU HBM 放计算权重,本地 DRAM 做二级缓存,CXL 池做三级。8 台服务器共享 4TB 内存池,集成进 SGLang,端到端吞吐损失 <5%。

无冲突热层实验(2026.01.23)

TaoLin 单作者论文(arXiv: 2601.16531)。验证"消除哈希冲突是否能提升性能"——结果反直觉:严格 iso-parameter 控制下,无冲突设计没有稳定提升验证 loss。训练初期热路径 loss 更低,但训练后期冷路径反超。

视觉 Tiny Engram(AutoArk)

AutoArk 基于 Qwen-3 复现文本 Engram 后,将其搬到 Stable Diffusion。视觉 patch 经分层编码后丢进哈希查表。与 LoRA 对比:同等效果下,Engram 额外参数仅 LoRA 的 15%-30%,且连续注入多个新概念时不会出现概念退化。

论文评价

Engram 论文摘要结尾写道:「我们认为条件记忆将是下一代稀疏模型不可或缺的建模原语。」但 DeepSeek-V4 未采用 Engram,代码仓库(deepseek-ai/Engram)最后一次提交停在 1 月 14 日。社区期待 V5 或 V4.1 能整合 Engram。

关联

  • DeepSeek — Engram 的发明者
  • MoE — Engram 的互补架构
  • CXL — Engram 嵌入表的内存池化方案

来源

DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md