概念 ›Constitutional AI(宪法式 AI)
概述
Constitutional AI(CAI,宪法式 AI)是 Anthropic 开发的一种 AI 训练方法,通过使用一组明确的原则(即"宪法")来引导 AI 模型的行为,而非完全依赖人类反馈中的隐含价值观。该方法旨在让 AI 的价值观更加透明、可调整和可扩展。Claude 模型的核心行为准则即通过宪法来定义和训练,宪法经历了从最初的原则列表到详细的指导文档的重大演变。
关键信息
训练流程
- 监督学习阶段:模型使用宪法和示例来批评和修订自己的回答
- 强化学习阶段:使用基于宪法的 AI 生成反馈来训练模型选择更少有害的输出,取代人类反馈
解决的传统问题
- 有害内容暴露:传统方法需要人类接触有害输出
- 可扩展性问题:众包工作者难以跟上复杂或大量的模型回答
- 资源密集:需要大量时间和资源
Claude 宪法的演变
- 初版宪法:基于多个来源的原则列表,包括《世界人权宣言》、Apple 服务条款、DeepMind Sparrow 原则、非西方视角和 Anthropic 研究成果
- 新版宪法:从独立原则列表转变为详细指导文档,强调解释行为背后的"原因"而非仅规定规则;在 Creative Commons CC0 1.0 下发布
核心优先级(新版)
- 广泛安全:不破坏人类监督机制
- 广泛道德:诚实、良好价值观、避免有害行为
- 遵守 Anthropic 指南:遵循 Anthropic 的具体指示
- 真正有帮助:使用户受益
关键优势
- 帕累托改进:可以同时比仅用人类反馈训练的模型更有帮助且更无害
- 可扩展监督:使用 AI 监督来处理对抗性输入
- 透明性:指导原则是明确的、可检查的和可理解的
- 减少人类暴露:最大限度减少人类接触创伤性内容的需要
关键洞察
- 简单宽泛的原则(如"无害且有道德")比冗长具体的原则更有效
- 宪法是活文档,会随反馈和研究不断演进
- 在 RSP 的 ASL-3 标准中,Constitutional AI 被用作产品安全防御深度方法的一部分
相关概念
来源
anthropic-claudes-constitution.md原始路径
anthropic-claude-new-constitution.md原始路径
anthropic-reflections-on-our-responsible-scaling-policy.md原始路径