概念 Responsible Scaling Policy(负责任扩展政策)

Responsible Scaling Policy(负责任扩展政策)

概念 3 min read · 2026-05-02 #safety#governance#responsible-ai#scaling-policy#asl

概述

负责任扩展政策(Responsible Scaling Policy,RSP)是 Anthropic 制定的一套技术和组织协议框架,用于管理日益强大的 AI 系统带来的灾难性风险。该政策于 2023 年首次发布,此后经历了多次迭代(截至 2026 年 2 月已更新至 v3.0),是 AI 安全治理领域的重要创新。

RSP 的核心机制是使用条件性("如果-那么")承诺,将安全措施与模型能力挂钩:当模型超过特定能力阈值时,自动激活更严格的安全保障。这一框架借鉴了美国政府的生物安全级别(BSL)体系,创造了 AI Safety Levels(ASL) 分级系统。

关键信息

核心框架:AI 安全级别(ASL)

  • ASL-1:不构成有意义的灾难性风险的系统(如 2018 年的 LLM、下棋 AI)
  • ASL-2:显示早期危险能力迹象但信息尚不可靠的系统。当前所有 Anthropic 模型(包括 Claude)均在此级别运行
  • ASL-3:相比非 AI 基线显著增加灾难性滥用风险的系统,或显示低级别自主能力的系统
  • ASL-4+:尚未定义,将涉及滥用潜力和自主性的质的升级

五大高层承诺

  1. 建立红线能力:识别并公开在当前安全标准下风险过高的能力
  2. 测试红线能力:通过经验测试证明这些能力不存在,否则按存在处理
  3. 响应红线能力:开发并实施新的安全标准(如 ASL-3),必要时暂停训练/部署
  4. 迭代扩展政策:在需要 ASL-3 之前,公布其适用上限(新的红线能力需要 ASL-4)
  5. 保障机制:通过压力测试评估、验证缓解措施、董事会/长期利益信托基金监督确保政策执行

能力阈值

RSP v2 明确定义了两个关键能力阈值:

  • CBRN 武器:如果模型能有意义地协助具有基础技术背景的人创建/部署化学、生物、放射性或核武器,需要 ASL-3 标准
  • 自主 AI 研发:如果模型能独立进行复杂的 AI 研发,需要 ASL-4+ 标准

RSP v3.0 的关键更新(2026 年 2 月)

  • 分离公司计划与行业建议:明确 Anthropic 独立可实现的措施 vs. 整个行业需要集体行动的措施
  • 前沿安全路线图:要求在安全、对齐、防护和政策四个领域发布具体的公开目标
  • 风险报告:每 3-6 个月发布一次,详细说明模型安全概况、威胁模型和缓解措施
  • 外部审查:特定报告将由专家第三方进行未删减审查

设计哲学与变革理论

  • 内部强制功能:将安全措施视为发布要求
  • 竞相向上(Race to the Top):将竞争激励转化为解决安全问题的动力
  • 创建共识:使用能力阈值倡导多边行动
  • 类似行业先例:类似于汽车/航空工业的上市前测试

实施经验与教训

  • 推动了 ASL-3 分类器(针对化学/生物武器)等更强安全措施的开发
  • 2025 年 5 月成功激活 ASL-3 标准,证明其可行性
  • 激励了 OpenAI、Google DeepMind 等公司采用类似框架
  • 为 AI 政策(如加州 SB 53、欧盟 AI 法案行为准则)提供了参考

治理结构

  • 由 Anthropic 董事会正式批准,修改需经董事会同意并咨询长期利益信托基金
  • 设有负责任扩展官(Responsible Scaling Officer)、负责任扩展团队、对齐压力测试团队等
  • 多个团队协作:前沿红队、信任与安全团队、安全与合规团队、对齐科学团队

相关概念

  • ASL-AI-Safety-Level:RSP 的核心分级体系,定义了不同级别的安全要求
  • Red-Teaming:RSP 的关键实施手段之一,用于评估模型的危险能力

来源

anthropic-anthropics-responsible-scaling-policy.md原始路径
anthropic-announcing-our-updated-responsible-scaling-policy.md原始路径
anthropic-responsible-scaling-policy-v3.md原始路径
anthropic-reflections-on-our-responsible-scaling-policy.md原始路径