概念 HCA(重度压缩注意力)

HCA(重度压缩注意力)

概念 1 min read · 2026-05-04 #concept#architecture#inference#model

HCA(Heavily Compressed Attention)是 DeepSeek-V4 的重度压缩注意力机制,通过激进的 KV cache 压缩实现极低内存占用的长上下文推理。

核心思想

KV cache 是长上下文推理的主要内存瓶颈。HCA 通过激进压缩大幅减少 KV cache 体积。

在 V4 中的作用

  • CSA 组成 V4 的混合注意力架构
  • 主要负责内存效率——KV cache 仅需 V3.2 的 10%
  • 使百万 token 上下文在实际部署中可行

关联

  • CSA — HCA 的互补注意力机制
  • DeepSeek — HCA 的提出者
  • HBM — HCA 减少的目标资源
  • CXL — HBM 容量不足时的扩展方案
  • mHC — V4 的另一架构创新

来源

DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md