概念 LogitLens(对数透镜)

LogitLens(对数透镜)

概念 1 min read · 2026-05-04 #concept#model#data

LogitLens 是一种 LLM 可解释性技术,通过将中间层激活向量投影到词表空间,观察模型在每一层的"预测猜测"。

核心原理

对 Transformer 第 k 层隐藏状态,通过 LM Head 投影得到该层的预测分布。这让我们看到模型在每一层"认为"下一个 token 是什么。

典型发现

  • 浅层:模型还在"纠结"实体歧义
  • 中间层:逐步消歧
  • 深层:最终推理

Engram 研究中,LogitLens 揭示:Engram-27B 第 5 层表征与 MoE 基线第 12 层最相似,证明 Engram 把早期层从"重建静态知识"中解放出来。

与 CKA 的互补

维度LogitLensCKA
分析类型定性(模型在想什么)定量(表征相似度)
输出逐层预测分布0-1 相似度分数

关联

  • CKA — LogitLens 的互补分析工具
  • Engram — 使用 LogitLens 验证记忆模块效果
  • mHC — 可用 LogitLens 验证恒等映射特性

来源

DeepSeek V4最大的遗憾raw/articles/量子位-DeepSeek-V4最大的遗憾-2026.md