概念 ›Child Safety(儿童安全)
概述
儿童安全是 Anthropic 安全工作的核心优先事项之一。Anthropic 参与了由 Thorn 和 All Tech Is Human 领导的"Safety by Design"倡议,致力于防止生成式 AI 被用于创建或传播儿童性虐待材料(AIG-CSAM)以及其他形式的儿童性伤害。Claude 的安全防护团队通过多层策略覆盖模型的整个生命周期来保护儿童安全。
关键信息
Safety by Design 原则
Anthropic 承诺在三个阶段实施儿童安全措施:
开发阶段:
- 负责任地获取训练数据,避免含有已知 CSAM/CSEM 风险的数据
- 在数据摄入时检测、移除和报告 CSAM/CSEM
- 对模型进行结构化、可扩展的 AIG-CSAM 压力测试(Red-Teaming)
- 禁止客户使用模型进一步对儿童的性伤害
部署阶段:
- 检测输入和输出中的滥用内容(CSAM、AIG-CSAM、CSEM)
- 提供用户报告和反馈选项
- 集成分阶段部署,早期监控滥用行为
- 在模型卡中纳入儿童安全部分
维护阶段:
- 向 NCMEC(美国国家失踪和受虐儿童中心)报告时使用生成式 AI 文件标注
- 利用开源情报(OSINT)能力了解平台被滥用的方式
- 投资工具保护内容免受 AI 生成的操纵
实时检测与执行
作为 Claude 安全防护体系的一部分:
- 使用分类器(prompted 或微调的 Claude 模型)实时检测策略违规
- 通过图像哈希比对专门检测 CSAM
- 严格禁止描述、鼓励、支持或分发任何形式的儿童性剥削或虐待内容
- 检测到此类材料将报告至 NCMEC
统一伤害框架
儿童安全评估纳入五维度框架:身体、心理、经济、社会和个人自主权,综合考虑误用的可能性和规模。
相关概念
Usage-Policy、Red-Teaming、Constitutional-AI、Jailbreak、Bug-Bounty、Prompt-Injection、Frontier-Model-Security、Third-Party-Testing
来源
anthropic-child-safety-principles.md原始路径
anthropic-building-safeguards-for-claude.md原始路径