概念 ›LogitLens(对数透镜)
LogitLens 是一种 LLM 可解释性技术,通过将中间层激活向量投影到词表空间,观察模型在每一层的"预测猜测"。
核心原理
对 Transformer 第 k 层隐藏状态,通过 LM Head 投影得到该层的预测分布。这让我们看到模型在每一层"认为"下一个 token 是什么。
典型发现
- 浅层:模型还在"纠结"实体歧义
- 中间层:逐步消歧
- 深层:最终推理
在 Engram 研究中,LogitLens 揭示:Engram-27B 第 5 层表征与 MoE 基线第 12 层最相似,证明 Engram 把早期层从"重建静态知识"中解放出来。
与 CKA 的互补
| 维度 | LogitLens | CKA |
|---|---|---|
| 分析类型 | 定性(模型在想什么) | 定量(表征相似度) |
| 输出 | 逐层预测分布 | 0-1 相似度分数 |
关联
来源
DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md