概念 ›Jailbreak(越狱攻击)
概述
越狱攻击(Jailbreak)是指绕过 AI 系统内置安全措施和道德准则的方法,使用户能够获取通常被限制或禁止的响应或行为。其中,通用越狱(Universal Jailbreak)是一种更为严重的漏洞类型,允许用户在广泛的主题上持续绕过安全措施。越狱攻击是 AI 安全领域最核心的威胁之一,直接影响 CBRN 和网络安全等高风险领域,也是 ASL-3 部署措施重点防御的对象。
关键信息
越狱类型
- 特定越狱:针对特定话题或查询的绕过方法
- 通用越狱:可在广泛话题上持续绕过安全措施的漏洞,如果被利用,可能在各种有害、不道德或危险领域产生深远后果
防御措施(ASL-3 框架)
- 使系统更难被越狱
- 实施 Constitutional Classifiers(宪法分类器)——基于合成数据训练的实时守卫,用于拦截有害的 CBRN 信息
- 增加适度的计算开销
- 检测越狱行为
- 漏洞赏金计划(最高奖励 $15,000)
- 离线分类
- 威胁情报合作伙伴关系
- 迭代改进防御
- 快速修复发现的越狱方法
- 使用合成数据重新训练分类器
漏洞赏金计划
- 与 HackerOne 合作运营
- 最高奖励 $15,000,针对新颖的通用越狱攻击
- 聚焦 CBRN 和网络安全等高风险领域
- 参与者可在新安全措施公开部署前获得早期访问权限进行测试
- 计划从邀请制开始,逐步扩展
红队测试发现
- 生物安全专家与 LLM 专家合作超过 100 小时
- 专家学习与模型交互并尝试"越狱"以揭示真实能力
- 目标是基于专家知识构建新的自动化评估,使测试可重复和可扩展
- 当前模型仅显示出风险的最初迹象,这是评估和减轻风险的关键窗口
挑战
- 越狱防御与模型有用性之间存在张力——过度防御可能导致合法查询被误拒
- 需要为有双重用途应用的经过审核的用户提供针对性豁免
- 防御措施需要持续迭代,因为攻击方法不断演进
- 发现具有敏感性,需要可信的第三方合作伙伴和强大的信息安全
相关概念
来源
anthropic-activating-asl3-protections.md原始路径
anthropic-frontier-threats-red-teaming-for-ai-safety.md原始路径
anthropic-model-safety-bug-bounty.md原始路径