概念 ›HCA(重度压缩注意力)
HCA(Heavily Compressed Attention)是 DeepSeek-V4 的重度压缩注意力机制,通过激进的 KV cache 压缩实现极低内存占用的长上下文推理。
核心思想
KV cache 是长上下文推理的主要内存瓶颈。HCA 通过激进压缩大幅减少 KV cache 体积。
在 V4 中的作用
- 与 CSA 组成 V4 的混合注意力架构
- 主要负责内存效率——KV cache 仅需 V3.2 的 10%
- 使百万 token 上下文在实际部署中可行
关联
来源
DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md