概念 ›Distillation Attack(蒸馏攻击)
概述
蒸馏攻击(Distillation Attack)是指未经授权的实体通过大规模 API 调用,从前沿 AI 模型中提取能力来训练自己的模型的非法行为。虽然蒸馏本身是一种合法的训练方法(小模型从大模型输出中学习),但恶意使用则允许竞争者以极低的开发成本快速获取能力,同时往往缺乏关键的安全保障。
关键信息
已识别的大规模攻击活动
Anthropic 发现了三家 AI 实验室的大规模非法蒸馏活动:
| 攻击方 | 交换规模 | 主要目标 |
|---|---|---|
| DeepSeek | 15万+ | 推理能力、基于评分的奖励模型、"审查安全"替代方案 |
| Moonshot AI(Kimi) | 340万+ | Agentic 推理/工具使用、编码、计算机视觉 |
| MiniMax | 1300万+ | Agentic 编码和工具使用/编排 |
攻击手段
- 访问方式:使用商业代理服务("hydra cluster"架构)配合大量欺诈账户网络
- 规避检测:流量与合法请求混合;账户被封后立即替换新账户
- 攻击模式:高频、重复性提示,针对窄能力领域
- 归因方法:通过请求元数据追踪至特定研究人员
核心风险
- 安全保障缺失:蒸馏模型往往缺乏关键安全防护,导致危险能力扩散
- 出口管制规避:允许外国实验室在无需直接芯片访问的情况下缩小竞争差距
- 战略威胁:允许威权政府将前沿 AI 用于进攻性操作、虚假信息和监控
地区限制与应对
Anthropic 加强了地区限制措施:
- 禁止受受限地区(如中国)控制超过50%所有权的公司/组织使用服务
- 防止通过在其他国家注册子公司规避限制
- 倡导强有力的出口管制政策
防御措施
- 检测:API 流量的分类器和行为指纹识别,包括思维链提取检测
- 情报共享:与其他实验室、云提供商和当局共享技术指标
- 访问控制:加强对常被利用途径(教育、安全研究、初创企业账户)的验证
- 对策:开发模型/API 安全措施以降低非法蒸馏的输出效力
相关概念
Frontier-Model-Security、Responsible-Scaling-Policy、Bug-Bounty、Usage-Policy、Red-Teaming、Third-Party-Testing
来源
anthropic-detecting-and-preventing-distillation-attacks.md原始路径
anthropic-updating-restrictions-of-sales-to-unsupported-regions.md原始路径