概念 ›CSA(压缩稀疏注意力)
CSA(Compressed Sparse Attention)是 DeepSeek-V4 的压缩稀疏注意力机制,通过稀疏化注意力矩阵降低长上下文推理的计算复杂度。
核心思想
传统注意力机制计算复杂度 O(n^2),在百万 token 上下文下不可承受。CSA 通过稀疏化注意力矩阵,只计算重要的注意力连接。
在 V4 中的作用
- 与 HCA 组成 V4 的混合注意力架构
- 主要负责计算效率——1M token 下仅需 V3.2 单 token 推理 FLOPs 的 27%
- 是 DeepSeek 从 V3 的 MLA(Multi-head Latent Attention)的演进
与 HCA 的互补
| 维度 | CSA | HCA |
|---|---|---|
| 优化目标 | 计算效率(FLOPs) | 内存效率(KV cache) |
| 效果 | 27% FLOPs vs V3.2 | 10% KV cache vs V3.2 |
关联
来源
DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md