概念 Prompt Injection(提示注入)

Prompt Injection(提示注入)

概念 2 min read · 2026-05-02 #security#attack#agents#safety

概述

提示注入(Prompt Injection)是一种针对 AI 系统的攻击技术,攻击者通过嵌入隐藏指令或误导性内容,诱使 AI 代理忽略其原始指令、泄露数据或执行非预期行为。随着 AI 代理(如 Claude-CodeComputer-Use)的自主性增强,提示注入已成为 AI 安全领域最关键的威胁之一。

关键信息

攻击类型与发现

通过与 US CAISI 和 UK AISI 的合作,已发现并修补了多种提示注入漏洞:

  1. 隐藏指令注入:攻击者在输入中嵌入隐藏指令,绕过分类器防护。已被修补。
  2. 虚假人工审查声明:攻击者声称内容已通过人工审查,诱骗系统信任恶意内容。已被修补。
  3. 编码有害交互:政府红队开发了将有害交互编码以逃避标准检测的利用方式,导致安全架构的根本性重构
  4. 密码/混淆攻击:使用密码和混淆技术编码有害请求,推动了检测系统的改进。
  5. 输入/输出碎片化:将有害字符串分割为良性组件的通用越狱方式,推动了过滤改进。

Anthropic 的防护措施

  • 分类器检测:Claude 使用分类器检测和防范误用
  • 威胁情报团队:持续监控新的恶意行为模式
  • MCP 安全标准MCP 目录中的工具必须满足安全、安全性和兼容性标准
  • 客户指导:提供访问权限、认证、数据隔离等方面的风险降低指导

Agent 安全框架中的定位

在 Anthropic 的安全代理开发框架中,提示注入防护是五大原则之一("保护代理交互安全")的核心内容:

  • 平衡代理自主性与人类控制
  • 确保代理行为透明度
  • 保护跨交互的隐私
  • 防范工具/子代理中的漏洞

与通用越狱的区别

  • 提示注入:针对特定交互,通过嵌入指令改变 AI 行为
  • 通用越狱(Universal Jailbreak):持续绕过多主题安全措施的系统性漏洞(见 Jailbreak

相关概念

JailbreakClaude-CodeComputer-UseMCPRed-TeamingBug-BountyFrontier-Model-SecurityResponsible-Scaling-PolicyUsage-Policy

来源

anthropic-our-framework-for-developing-safe-and-trustworthy-agents.md原始路径
anthropic-strengthening-our-safeguards-through-collaboration-with-us-caisi-and-uk-aisi.md原始路径