概念 Jailbreak(越狱攻击)

Jailbreak(越狱攻击)

概念 2 min read · 2026-05-02 #security#attack#safety#adversarial

概述

越狱攻击(Jailbreak)是指绕过 AI 系统内置安全措施和道德准则的方法,使用户能够获取通常被限制或禁止的响应或行为。其中,通用越狱(Universal Jailbreak)是一种更为严重的漏洞类型,允许用户在广泛的主题上持续绕过安全措施。越狱攻击是 AI 安全领域最核心的威胁之一,直接影响 CBRN 和网络安全等高风险领域,也是 ASL-3 部署措施重点防御的对象。

关键信息

越狱类型

  • 特定越狱:针对特定话题或查询的绕过方法
  • 通用越狱:可在广泛话题上持续绕过安全措施的漏洞,如果被利用,可能在各种有害、不道德或危险领域产生深远后果

防御措施(ASL-3 框架)

  1. 使系统更难被越狱
    • 实施 Constitutional Classifiers(宪法分类器)——基于合成数据训练的实时守卫,用于拦截有害的 CBRN 信息
    • 增加适度的计算开销
  2. 检测越狱行为
    • 漏洞赏金计划(最高奖励 $15,000)
    • 离线分类
    • 威胁情报合作伙伴关系
  3. 迭代改进防御
    • 快速修复发现的越狱方法
    • 使用合成数据重新训练分类器

漏洞赏金计划

  • 与 HackerOne 合作运营
  • 最高奖励 $15,000,针对新颖的通用越狱攻击
  • 聚焦 CBRN 和网络安全等高风险领域
  • 参与者可在新安全措施公开部署前获得早期访问权限进行测试
  • 计划从邀请制开始,逐步扩展

红队测试发现

  • 生物安全专家与 LLM 专家合作超过 100 小时
  • 专家学习与模型交互并尝试"越狱"以揭示真实能力
  • 目标是基于专家知识构建新的自动化评估,使测试可重复和可扩展
  • 当前模型仅显示出风险的最初迹象,这是评估和减轻风险的关键窗口

挑战

  • 越狱防御与模型有用性之间存在张力——过度防御可能导致合法查询被误拒
  • 需要为有双重用途应用的经过审核的用户提供针对性豁免
  • 防御措施需要持续迭代,因为攻击方法不断演进
  • 发现具有敏感性,需要可信的第三方合作伙伴和强大的信息安全

相关概念

来源

anthropic-activating-asl3-protections.md原始路径
anthropic-frontier-threats-red-teaming-for-ai-safety.md原始路径
anthropic-model-safety-bug-bounty.md原始路径