概念 Computer Use(计算机使用)

Computer Use(计算机使用)

概念 2 min read · 2026-05-02 #computer-use#agentic-ai#multimodal#gui-automation

概述

Computer Use(计算机使用)是 Anthropic 于 2024 年 10 月推出的一项突破性 AI 能力,允许 Claude 像人类一样操作计算机——通过查看屏幕、移动光标、点击和打字来完成任务。这是一种范式转变:从为特定任务创建专用工具,转向教会 AI 通用的计算机操作技能,使其能够使用为人类设计的各类软件和工具。

该能力随 Claude 3.5 Sonnet 升级版一同发布,是首个提供公开测试版计算机使用功能的前沿 AI 模型。

关键信息

核心技术

  • 训练基础:在工具使用和多模态能力的基础上构建,训练 Claude 解释屏幕图像并精确计算像素以定位光标
  • 泛化能力:仅在少数简单离线应用(如计算器、文本编辑器)上训练,Claude 却能泛化到操作其他软件
  • 自主能力:能将书面指令分解为逻辑步骤,遇到障碍时自我纠正和重试任务
  • API 接入:通过 API 让 Claude 感知和与计算机界面交互,将自然语言指令转化为计算机命令

基准测试表现

  • OSWorld 基准(仅截图类别):Claude 得分 14.9%,远高于第二名的 7.8%;增加操作步骤后得分 22.0%
  • 虽然远低于人类表现(70-75%),但已是同类模型中的最优水平

当前局限

  • 操作速度较慢、容易出错
  • 无法执行拖拽、缩放等复杂操作
  • "翻页书"式的截图查看方式可能错过短暂事件
  • 有趣的失误:在演示中 Claude 意外停止了屏幕录制,还去浏览黄石公园的照片

安全考虑

  • 安全等级:Computer Use 被评定为 AI Safety Level 2,未发现新的灾难性风险
  • 战略时机:在模型处于安全级别 2 时引入此能力,可在更高风险模型出现前先解决安全问题
  • 主要风险与缓解
    • 提示注入(Prompt Injection):截图中的恶意指令可能覆盖用户意图,需要开发者采取防护措施
    • 故意滥用:部署分类器等方法来标记滥用行为
    • 选举安全:密切监控并阻止 Claude 生成社交媒体内容、注册域名或与政府网站交互等行为

早期采用者

Asana、Canva、Cognition、DoorDash、Replit、The Browser Company 等公司正在探索将其用于复杂的多步骤任务。

发展方向

  • 提高速度、可靠性和易用性
  • 从"让工具适应模型"转向"让模型适应现有工具"的范式转变

相关概念

  • Claude-Code:同为 Anthropic 的 AI 交互能力,Claude Code 专注于代码开发,Computer Use 专注于 GUI 操作
  • ASL-AI-Safety-Level:Computer Use 被评定为 ASL-2 级别

来源

anthropic-developing-computer-use.md原始路径
anthropic-3-5-models-and-computer-use.md原始路径