概念 ›Red Teaming(红队测试)
概述
红队测试(Red Teaming)是对技术系统进行对抗性测试以识别漏洞的方法。在 AI 安全领域,红队测试是评估前沿 AI 模型潜在风险和危险能力的核心手段,也是 负责任扩展政策(RSP) 的关键实施环节之一。
Anthropic 建立了专门的前沿红队(Frontier Red Team),专注于国家安全风险领域的评估,包括生物安全、网络安全和自主 AI 风险。红队测试不是一个一次性事件,而是必须随着模型能力演进的安全生命周期的关键组成部分。
关键信息
红队测试方法论
Anthropic 采用多种红队测试方法:
1. 领域专家红队测试
- 政策漏洞测试(PVT):针对使用政策覆盖的主题(如儿童安全、选举完整性、激进化)进行深入定性测试
- 前沿威胁测试:聚焦高后果风险,包括 CBRN(化学、生物、放射性、核)、网络安全和自主 AI 风险
- 多语言/多文化测试:超越英语中心视角,识别区域风险。例如与新加坡 IMDA 合作,使用泰米尔语、普通话和马来语进行测试
2. 模型辅助红队测试
- 自动化红队/蓝队对抗:红队模型生成攻击以诱发目标行为,蓝队模型在这些输出上微调以变得更稳健
- 目标:创建迭代循环,覆盖比手动测试更大的测试面
3. 多模态红队测试
- 针对处理视觉信息的模型(如 Claude 3),测试欺诈活动、视觉威胁、暴力极端主义等风险
4. 开放式红队测试
- 众包测试:使用众包工作者在受控环境中应用自己的判断
- 社区测试:大规模活动如 DEF CON 的 AI Village 和 GRT 挑战赛,涉及数千名非技术参与者
从定性到定量的转化
Anthropic 提出了一个关键的"元挑战"——将临时的人类测试转化为累积的组织价值:
- 临时探测:专家识别威胁模型并手动诱发有害行为
- 标准化:红队测试人员优化输入以一致地触发漏洞
- 自动化:语言模型生成数千个成功输入的变体
- 评估:定性的人类洞察转化为全面、定量、自动化的基准测试
生物安全红队测试发现
- 与顶级生物安全专家进行了超过 150 小时的合作测试(历时 6 个月)
- 核心发现:当前前沿模型有时能产生复杂、准确、专家级的知识,这种能力随模型规模增长
- 评估:未经缓解的 LLM 可能加速恶意行为者对生物学的滥用,风险被认为是近期的(2-3 年)
- 缓解措施:训练过程变更(如 Constitutional AI)、基于分类器的过滤器
网络安全红队测试发现(2025 年 3 月)
- 快速进步:2024 年是从 0 到 1 的转折点,Claude 在 CTF 练习中从高中生水平提升到本科生水平
- 基准表现:Claude 3.7 Sonnet 在 Cybench 公共基准上五次尝试内解决约 33% 的挑战(一年前为 5%)
- 现实测试:在与卡内基梅隆大学合作的大规模网络靶场实验中,模型无法自主成功,但配备工具后可复制复杂攻击
- 生物安全:Claude 在实验室故障排除评估中已超过世界级病毒学专家
- 但专家红队测试认为模型无法可靠地指导新手完成端到端生物武器获取
战略合作伙伴关系
- 与 美国 AI 安全研究所 和 英国 AI 安全研究所 进行部署前测试
- 与 美国国家核安全管理局(NNSA) 合作进行核/放射性风险的机密红队测试
- 正在试点负责任披露流程
政策建议
Anthropic 向政策制定者提出了五项建议:
- 标准化资金:资助 NIST 开发安全有效红队测试的技术标准
- 独立机构:支持政府和非营利组织作为独立红队伙伴
- 专业市场:鼓励建立专业 AI 红队测试服务市场,附带正式认证流程
- 第三方访问:为经审核/认证的外部团体提供进行第三方红队测试的途径
- 与扩展挂钩:鼓励公司将红队测试结果与 RSP 关联,决定模型是否安全发布
相关概念
- Responsible-Scaling-Policy:红队测试是 RSP 的关键评估手段,用于确定模型是否触发更高级别的安全措施
- ASL-AI-Safety-Level:红队测试的结论直接影响模型的 ASL 分级
来源
anthropic-frontier-threats-red-teaming-for-ai-safety.md原始路径
anthropic-challenges-in-red-teaming-ai-systems.md原始路径
anthropic-strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team.md原始路径