概念 ›Bug Bounty(漏洞赏金计划)
概述
漏洞赏金计划(Bug Bounty)是 Anthropic 与 HackerOne 合作开展的安全测试项目,邀请外部安全研究人员对 AI 模型的安全防护系统进行压力测试。该计划聚焦于发现通用越狱攻击(Universal Jailbreaks)——即能够持续绕过 AI 安全护栏的漏洞,尤其针对 CBRN(化学、生物、放射性和核武器)及网络安全等高风险领域。
关键信息
计划演进
- 2024年8月(首次启动):作为邀请制计划,与 HackerOne 合作,奖励高达 $15,000,聚焦于通用越狱攻击发现
- 2025年初(第二次迭代):测试更新版的 Constitutional Classifiers 系统,在 Claude 3.7 Sonnet 上进行,奖金提高至 $25,000
- 2025年5月(第三次迭代):扩展至 Claude Opus 4 模型,并开始接受公开平台上的通用越狱报告
核心机制
- 早期访问:参与者在安全措施公开部署前获得早期访问权限
- 通用越狱定义:能够在多个主题上持续绕过 Claude 安全措施的漏洞
- 测试对象:Constitutional Classifiers——一种遵循原则列表来定义允许/禁止内容的防御系统
- 邀请制:初始阶段为邀请制,以便及时反馈
与 ASL-3 的关系
该赏金计划帮助 Anthropic 迭代和压力测试其 ASL-3 安全防护措施,这是 Responsible-Scaling-Policy 中为高级 AI 模型制定的部署标准。
与政府合作的互补
漏洞赏金计划与 Third-Party-Testing 中的政府红队测试(如与 US CAISI 和 UK AISI 的合作)互为补充——前者覆盖广泛社区发现,后者深入挖掘复杂漏洞。
相关概念
Red-Teaming、Jailbreak、ASL-AI-Safety-Level、Responsible-Scaling-Policy、Constitutional-AI、Frontier-Model-Security、Third-Party-Testing、Distillation-Attack、Child-Safety、Usage-Policy
来源
anthropic-model-safety-bug-bounty.md原始路径
anthropic-testing-our-safety-defenses-with-a-new-bug-bounty-program.md原始路径