概念 Bug Bounty(漏洞赏金计划)

Bug Bounty(漏洞赏金计划)

概念 2 min read · 2026-05-02 #security#safety#testing#red-teaming

概述

漏洞赏金计划(Bug Bounty)是 Anthropic 与 HackerOne 合作开展的安全测试项目,邀请外部安全研究人员对 AI 模型的安全防护系统进行压力测试。该计划聚焦于发现通用越狱攻击(Universal Jailbreaks)——即能够持续绕过 AI 安全护栏的漏洞,尤其针对 CBRN(化学、生物、放射性和核武器)及网络安全等高风险领域。

关键信息

计划演进

  • 2024年8月(首次启动):作为邀请制计划,与 HackerOne 合作,奖励高达 $15,000,聚焦于通用越狱攻击发现
  • 2025年初(第二次迭代):测试更新版的 Constitutional Classifiers 系统,在 Claude 3.7 Sonnet 上进行,奖金提高至 $25,000
  • 2025年5月(第三次迭代):扩展至 Claude Opus 4 模型,并开始接受公开平台上的通用越狱报告

核心机制

  • 早期访问:参与者在安全措施公开部署前获得早期访问权限
  • 通用越狱定义:能够在多个主题上持续绕过 Claude 安全措施的漏洞
  • 测试对象:Constitutional Classifiers——一种遵循原则列表来定义允许/禁止内容的防御系统
  • 邀请制:初始阶段为邀请制,以便及时反馈

与 ASL-3 的关系

该赏金计划帮助 Anthropic 迭代和压力测试其 ASL-3 安全防护措施,这是 Responsible-Scaling-Policy 中为高级 AI 模型制定的部署标准。

与政府合作的互补

漏洞赏金计划与 Third-Party-Testing 中的政府红队测试(如与 US CAISI 和 UK AISI 的合作)互为补充——前者覆盖广泛社区发现,后者深入挖掘复杂漏洞。

相关概念

Red-TeamingJailbreakASL-AI-Safety-LevelResponsible-Scaling-PolicyConstitutional-AIFrontier-Model-SecurityThird-Party-TestingDistillation-AttackChild-SafetyUsage-Policy

来源

anthropic-model-safety-bug-bounty.md原始路径
anthropic-testing-our-safety-defenses-with-a-new-bug-bounty-program.md原始路径