实体 DeepSeek

DeepSeek

实体 2 min read · 2026-05-14 #entity#company#model#open-source

DeepSeek 是一家专注于大模型研发的中国 AI 公司,由梁文锋创立。以开源模型著称,代表作包括 DeepSeek-V3、DeepSeek-V4 等系列。

技术路线

  • MoE 架构:DeepSeek-V3 采用 MoE(混合专家)架构,V4 在此基础上引入 mHCCSAHCAMuonFP4 等创新
  • 条件记忆探索:2026年1月与北大联合发布 Engram(Conditional Memory via Scalable Lookup),提出在 Transformer 中嵌入哈希查表模块实现静态知识的快速检索
  • 开源策略:模型和论文均开源,Engram 代码仓库为 deepseek-ai/Engram

DeepSeek V4

DeepSeek-V4 技术报告包含多项架构创新(mHCCSAHCAMuonFP4),但未包含 Engram 模块,被社区视为"最大的遗憾" ^[raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md]

V4 未采用 Engram 的原因未公开说明,但 Engram 的理念已通过后续研究(CXL 内存池化、视觉 Tiny Engram)持续扩展。

相关论文

  • 《Conditional Memory via Scalable Lookup》(2026.01.12):Engram 原始论文,第一作者 Cheng Xin(北大),末位作者梁文锋
  • arXiv: 2601.07372

关联

  • Engram — DeepSeek 提出的条件记忆模块
  • MoE — DeepSeek 采用的基础架构

生态地位(2026 中国实验室观察)

Nathan Lambert 访问中国多家 AI 实验室后记录:多家实验室高度尊重 DeepSeek,认为它是中国生态中“执行品味”最好的技术领导者;但 DeepSeek 并非市场意义上的必胜者,字节跳动、阿里等资源型大厂仍被视为重要竞争者。这个观察补充了 DeepSeek 在中国AI实验室生态开放权重模型路线中的位置。 ^[raw/articles/nathan-lambert-notes-from-inside-chinas-ai-labs-2026.md]

中国AI芯片生态相关性

DeepSeek 的模型训练和部署常被放在中国AI基础设施自主化讨论中观察。围绕国产AI芯片、软件栈适配和推理成本优化的实践,会影响 HuaweiNVIDIAAI芯片出口管制 等议题的判断。

来源

DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md
Notes from inside China's AI labsraw/articles/nathan-lambert-notes-from-inside-chinas-ai-labs-2026.md