概念 CSA(压缩稀疏注意力)

CSA(压缩稀疏注意力)

概念 1 min read · 2026-05-04 #concept#architecture#inference#model

CSA(Compressed Sparse Attention)是 DeepSeek-V4 的压缩稀疏注意力机制,通过稀疏化注意力矩阵降低长上下文推理的计算复杂度。

核心思想

传统注意力机制计算复杂度 O(n^2),在百万 token 上下文下不可承受。CSA 通过稀疏化注意力矩阵,只计算重要的注意力连接。

在 V4 中的作用

  • HCA 组成 V4 的混合注意力架构
  • 主要负责计算效率——1M token 下仅需 V3.2 单 token 推理 FLOPs 的 27%
  • 是 DeepSeek 从 V3 的 MLA(Multi-head Latent Attention)的演进

与 HCA 的互补

维度CSAHCA
优化目标计算效率(FLOPs)内存效率(KV cache)
效果27% FLOPs vs V3.210% KV cache vs V3.2

关联

  • HCA — CSA 的互补注意力机制
  • DeepSeek — CSA 的提出者
  • mHC — V4 的另一架构创新
  • HBM — CSA/HCA 减少 HBM 占用

来源

DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md