概念 奖励模型风格产物

奖励模型风格产物

概念 2 min read · 2026-05-01 #training#alignment#model

奖励模型风格产物是指训练过程中微小的奖励偏差经过强化学习放大后,最终在产品层面表现为可感知的语言风格或行为习惯的现象。

核心机制

OpenAI 在 2026 年 4 月的「地精事件」中完整揭示了这一机制:

1. 奖励偏差的产生

在训练 openai 的 Nerdy 人格时,奖励模型对「含有生物比喻的玩味输出」给予了偏高的评分。审计发现,在 76.2% 的数据集中,Nerdy 奖励信号对包含"goblin"或"gremlin"的输出给出了更高的分数。

2. 反馈循环

偏差通过以下循环被逐步放大:

玩味风格被奖励 → 含有特定词汇的输出得分更高
       ↓
这些输出更频繁出现在 rollout 中
       ↓
rollout 被用作 SFT 数据
       ↓
模型更「舒适」地产生这些词汇 → 循环加强

3. 跨条件扩散

强化学习不保证学到的行为严格限定在产生它的条件下。当地精词汇在 Nerdy 条件下被奖励后,在非 Nerdy 条件下的出现率也按近似比例增长。这说明奖励信号的效果会泛化到训练条件之外

4. 代际积累

模型版本现象
gpt-5-1"goblin" 使用量上升 175%,"gremlin" 上升 52%
GPT-5.4使用量进一步上升,首次追溯到 Nerdy 人格
gpt-5-5即使移除 Nerdy 人格,用量仍在增长(SFT 数据残留)

关键教训

  • 小偏差可以变成大行为:一个看似无害的奖励偏好,经过多轮 RL + SFT 循环后,可以变成模型的显著特征
  • 监控需要主动进行:这类问题不会通过常规 eval 指标报警,需要专门的词汇/行为频率审计
  • SFT 数据污染是放大器:当模型自身生成的数据被纳入训练时,偏差会被固化和加强

与对齐的关系

奖励模型风格产物是 模型人格训练 中人格定制的副作用。它提示我们:对齐训练中的每一个奖励信号都可能产生超出预期范围的泛化效果,需要建立系统性的行为审计机制。

相关页面

  • 模型人格训练 —— 人格定制训练
  • openai —— OpenAI 公司
  • gpt-5-5 —— 受影响的模型

外部链接

来源

raw/articles/openai-where-goblins-came-from-2026原始路径