概念 ›Prompt Injection(提示注入)
概述
提示注入(Prompt Injection)是一种针对 AI 系统的攻击技术,攻击者通过嵌入隐藏指令或误导性内容,诱使 AI 代理忽略其原始指令、泄露数据或执行非预期行为。随着 AI 代理(如 Claude-Code、Computer-Use)的自主性增强,提示注入已成为 AI 安全领域最关键的威胁之一。
关键信息
攻击类型与发现
通过与 US CAISI 和 UK AISI 的合作,已发现并修补了多种提示注入漏洞:
- 隐藏指令注入:攻击者在输入中嵌入隐藏指令,绕过分类器防护。已被修补。
- 虚假人工审查声明:攻击者声称内容已通过人工审查,诱骗系统信任恶意内容。已被修补。
- 编码有害交互:政府红队开发了将有害交互编码以逃避标准检测的利用方式,导致安全架构的根本性重构。
- 密码/混淆攻击:使用密码和混淆技术编码有害请求,推动了检测系统的改进。
- 输入/输出碎片化:将有害字符串分割为良性组件的通用越狱方式,推动了过滤改进。
Anthropic 的防护措施
- 分类器检测:Claude 使用分类器检测和防范误用
- 威胁情报团队:持续监控新的恶意行为模式
- MCP 安全标准:MCP 目录中的工具必须满足安全、安全性和兼容性标准
- 客户指导:提供访问权限、认证、数据隔离等方面的风险降低指导
Agent 安全框架中的定位
在 Anthropic 的安全代理开发框架中,提示注入防护是五大原则之一("保护代理交互安全")的核心内容:
- 平衡代理自主性与人类控制
- 确保代理行为透明度
- 保护跨交互的隐私
- 防范工具/子代理中的漏洞
与通用越狱的区别
- 提示注入:针对特定交互,通过嵌入指令改变 AI 行为
- 通用越狱(Universal Jailbreak):持续绕过多主题安全措施的系统性漏洞(见 Jailbreak)
相关概念
Jailbreak、Claude-Code、Computer-Use、MCP、Red-Teaming、Bug-Bounty、Frontier-Model-Security、Responsible-Scaling-Policy、Usage-Policy
来源
anthropic-our-framework-for-developing-safe-and-trustworthy-agents.md原始路径
anthropic-strengthening-our-safeguards-through-collaboration-with-us-caisi-and-uk-aisi.md原始路径