概念 ›Computer Use(计算机使用)
概述
Computer Use(计算机使用)是 Anthropic 于 2024 年 10 月推出的一项突破性 AI 能力,允许 Claude 像人类一样操作计算机——通过查看屏幕、移动光标、点击和打字来完成任务。这是一种范式转变:从为特定任务创建专用工具,转向教会 AI 通用的计算机操作技能,使其能够使用为人类设计的各类软件和工具。
该能力随 Claude 3.5 Sonnet 升级版一同发布,是首个提供公开测试版计算机使用功能的前沿 AI 模型。
关键信息
核心技术
- 训练基础:在工具使用和多模态能力的基础上构建,训练 Claude 解释屏幕图像并精确计算像素以定位光标
- 泛化能力:仅在少数简单离线应用(如计算器、文本编辑器)上训练,Claude 却能泛化到操作其他软件
- 自主能力:能将书面指令分解为逻辑步骤,遇到障碍时自我纠正和重试任务
- API 接入:通过 API 让 Claude 感知和与计算机界面交互,将自然语言指令转化为计算机命令
基准测试表现
- OSWorld 基准(仅截图类别):Claude 得分 14.9%,远高于第二名的 7.8%;增加操作步骤后得分 22.0%
- 虽然远低于人类表现(70-75%),但已是同类模型中的最优水平
当前局限
- 操作速度较慢、容易出错
- 无法执行拖拽、缩放等复杂操作
- "翻页书"式的截图查看方式可能错过短暂事件
- 有趣的失误:在演示中 Claude 意外停止了屏幕录制,还去浏览黄石公园的照片
安全考虑
- 安全等级:Computer Use 被评定为 AI Safety Level 2,未发现新的灾难性风险
- 战略时机:在模型处于安全级别 2 时引入此能力,可在更高风险模型出现前先解决安全问题
- 主要风险与缓解:
- 提示注入(Prompt Injection):截图中的恶意指令可能覆盖用户意图,需要开发者采取防护措施
- 故意滥用:部署分类器等方法来标记滥用行为
- 选举安全:密切监控并阻止 Claude 生成社交媒体内容、注册域名或与政府网站交互等行为
早期采用者
Asana、Canva、Cognition、DoorDash、Replit、The Browser Company 等公司正在探索将其用于复杂的多步骤任务。
发展方向
- 提高速度、可靠性和易用性
- 从"让工具适应模型"转向"让模型适应现有工具"的范式转变
相关概念
- Claude-Code:同为 Anthropic 的 AI 交互能力,Claude Code 专注于代码开发,Computer Use 专注于 GUI 操作
- ASL-AI-Safety-Level:Computer Use 被评定为 ASL-2 级别
来源
anthropic-developing-computer-use.md原始路径
anthropic-3-5-models-and-computer-use.md原始路径