概念 ›CBRN
概述
CBRN 是 Chemical(化学)、Biological(生物)、Radiological(放射性)、Nuclear(核武器) 的缩写,指代大规模杀伤性武器的四大类别。在 AI 安全领域,CBRN 是评估前沿 AI 模型最关键的风险维度之一,因为它关系到 AI 是否可能帮助不具备专业知识的人制造或部署这些危险武器。Anthropic 在其 Responsible-Scaling-Policy 中将 CBRN 能力作为触发 ASL-3 安全标准的核心能力阈值之一。
关键信息
- 能力阈值:如果一个 AI 模型能够为具有基本技术背景的人有意义地协助制造或部署 CBRN 武器,则需要达到 ASL-3 安全标准(来自 RSP 框架)。
- ASL-3 部署措施:针对 CBRN 的防护采用三层防御方法:
- 使系统更难被 越狱——使用 Constitutional Classifiers 实时拦截有害 CBRN 信息
- 检测越狱行为——包括漏洞赏金计划、离线分类和威胁情报合作
- 迭代改进防御——利用合成数据重新训练分类器
- 初始重点:ASL-3 CBRN 防护最初聚焦于生物武器作为主要风险。
- Claude Opus 4 是首个触发 ASL-3 预防性措施的模型,因为无法完全排除其 CBRN 相关知识和能力的风险。
- 红队测试:Anthropic 的前沿威胁红队专门针对 CBRN 等高后果风险进行对抗测试,与生物安全专家合作超过 150 小时。
- 透明度框架:Anthropic 提出的安全开发框架(SDF)要求前沿模型开发者明确说明如何评估和减轻 CBRN 相关风险。
- 风险评估挑战:在已建立的 CBRN 领域,专家之间对风险优先级存在合理的分歧,需要咨询多种专家。
相关概念
来源
anthropic-activating-asl3-protections.md原始路径
anthropic-announcing-our-updated-responsible-scaling-policy.md原始路径
anthropic-challenges-in-red-teaming-ai-systems.md原始路径
anthropic-the-need-for-transparency-in-frontier-ai.md原始路径