概念 ASL(AI Safety Level)

ASL(AI Safety Level)

概念 3 min read · 2026-05-02 #asl#safety-level#safety#governance#responsible-ai

概述

AI 安全级别(AI Safety Level,ASL)是 Anthropic 在 负责任扩展政策(RSP) 中引入的分级框架,借鉴了美国政府的生物安全级别(BSL)体系。该系统要求安全、安保和运营标准与模型的潜在灾难性风险成比例——随着模型能力的提升,安全要求也随之升级。

ASL 系统是 RSP 的核心机制,通过定义明确的能力阈值和相应的安全措施,为 AI 安全治理提供了可操作的框架。截至 2026 年,已有多个级别的明确定义和实际实施经验。

关键信息

各级别定义

ASL-1:无有意义的灾难性风险

  • 适用于不构成有意义灾难性风险的系统
  • 示例:2018 年的 LLM、下棋 AI

ASL-2:早期危险能力迹象

  • 系统显示早期危险能力迹象(如提供生物武器指导的能力),但信息尚不可靠或未超过非 AI 基线
  • 当前所有 Anthropic 模型(包括 Claude)均在 ASL-2 下运行
  • 代表当前行业最佳实践
  • Claude 3.5 Sonnet 和 Computer Use 能力均被评定为 ASL-2

ASL-3:显著增加灾难性滥用风险

  • 相比非 AI 基线(如搜索引擎)显著增加灾难性滥用风险的系统
  • 或显示低级别自主能力的系统
  • 能力阈值:如果模型能有意义地协助具有基础技术背景的人创建/部署 CBRN(化学、生物、放射性、核)武器

ASL-4+:最高风险能力

  • 适用于最高风险能力,如自主 AI 研发
  • 如果模型能独立进行复杂的 AI 研发(可能不可预测地加速发展),需要 ASL-4+ 标准
  • 尚未完全定义,但将在达到 ASL-3 之前被明确

ASL-3 保护措施的实际激活

2025 年,Anthropic 为 Claude Opus 4 主动激活了 ASL-3 部署和安全标准,这是一个里程碑事件:

激活原因

  • Claude Opus 4 在 CBRN 相关知识和能力方面持续改进
  • 无法明确排除 ASL-3 风险
  • 采取预防性措施,允许提前开发和测试保护措施

ASL-3 部署措施(聚焦 CBRN 防护)

三重防御方法:

  1. 增强系统抗破解能力:实施 Constitutional Classifiers(宪法分类器)——在合成数据上训练的实时防护,阻止有害 CBRN 信息
  2. 检测破解行为:包括漏洞赏金计划、离线分类、威胁情报合作伙伴关系
  3. 迭代改进防御:使用合成数据快速修补发现的破解并重新训练分类器
  • 初始阶段聚焦于生物武器作为主要风险
  • 双重用途应用的经审核用户可获得定向豁免

ASL-3 安全措施(聚焦模型权重保护)

  • 针对保护模型权重不被复杂的非国家级行为者窃取
  • 涉及超过 100 项安全控制
  • 关键控制:出口带宽控制——利用模型权重的大体积来检测和阻止数据外泄
  • 其他控制:双方授权、增强变更管理、端点软件控制
  • 范围:针对复杂非国家级行为者;国家级威胁和复杂内部人员风险不在 ASL-3 范围内

ASL 系统的设计哲学

  • 条件性承诺:采用"如果-那么"逻辑,能力阈值触发更严格的安全保障
  • 比例原则:安全保障随潜在风险等比例升级
  • 平衡激励:在瞄准灾难性风险的同时,激励有益应用和安全进步
  • 隐式暂停要求:如果 AI 扩展速度超出安全程序的实施能力,隐式要求暂停更强大模型的训练

RSP v3 中的 ASL 演进

RSP v3.0(2026 年 2 月)对 ASL 框架进行了重要调整:

  • 认识到能力阈值比预期更加模糊,评估无法提供确定性答案
  • 更高级别的 ASL(如 ASL-4+)可能需要单个公司无法实现的缓解措施(如顶级模型权重安全)
  • 将公司独立可实现的措施与整个行业需要集体行动的措施分离
  • 每 3-6 个月发布风险报告,专家第三方可进行未删减审查

相关概念

来源

anthropic-activating-asl3-protections.md原始路径
anthropic-responsible-scaling-policy-v3.md原始路径