实体 Claude Sonnet 4.5

Claude Sonnet 4.5

实体 3 min read · 2026-05-02 #model#anthropic

概述

Claude Sonnet 4.5Anthropic 于 2025 年 9 月 29 日发布的中端大语言模型,被定位为全球最佳编码模型以及构建复杂智能体和 Computer-Use 的最强模型。在推理和数学方面展现了实质性提升,是 Claude 4 系列中性能与效率最优平衡的选择。

关键特性

编码能力

  • SWE-bench Verified:77.2%(标准),82.0%(高计算量)
  • 可在复杂任务上保持专注 30+ 小时
  • 全球最佳编码模型

Computer-Use

  • OSWorld 基准:61.4%(较 Sonnet 4 的 42.2% 大幅提升)
  • 在桌面操作能力方面领先

推理与数学

  • 在各评估中展现改进的推理和数学能力

领域专业知识

  • 金融、法律、医学和 STEM 领域专家反馈:相比旧模型(包括 Opus 4.1)知识和推理能力显著提升

产品升级

Claude-Code 增强

  • Checkpoints:保存进度并即时回滚(高度需求功能)
  • 刷新的终端界面
  • 原生 VS Code 扩展

Claude API 与智能体能力

  • 新的上下文编辑功能
  • 记忆工具,支持更长时间运行的复杂智能体

Claude 应用(Web、iOS、Android)

  • 代码执行和文件创建(电子表格、幻灯片、文档),直接在对话中完成

Claude for Chrome 扩展

  • 向 Max 用户从等待名单中开放

Claude Agent SDK

  • 驱动 Claude-Code 的基础设施现可供开发者构建自己的智能体

测试反馈

  • Cursor:最先进的编码性能,尤其在长期任务上
  • GitHub Copilot:在多步推理和代码理解方面为 Agentic-Coding 体验带来显著改进
  • Canva:为 2.4 亿+ 用户处理复杂长上下文任务,明显更智能
  • Figma:在早期测试中改善了 Prompt 迭代和功能原型设计
  • Devin:规划性能提升 18%,端到端评估得分提升 12%
  • 金融分析:以更少的人工审核提供投资级洞见

安全与对齐

最对齐的模型

  • 在对齐方面展现大幅改进,减少了以下令人担忧的行为:
    • 阿谀奉承(sycophancy)
    • 欺骗(deception)
    • 权力追求(power-seeking)
    • 鼓励妄想(encouraging delusions)

Prompt-Injection 防御

安全等级

  • ASL-3 保护下发布
  • 包含检测 CBRN 相关内容的分类器

误报处理

  • 自首次描述以来误报减少 10 倍
  • 用户可以无缝地用 Sonnet 4 继续被中断的对话

定价与可用性

  • API 模型标识claude-sonnet-4-5
  • 定价:输入 $3/百万 tokens,输出 $15/百万 tokens(与 Sonnet 4 相同)
  • 可用性:即日起在所有平台可用
  • 推荐Anthropic 建议作为所有用途的即插即用升级

附加功能:"Imagine with Claude" 研究预览

  • 一项临时实验,Claude 实时动态生成软件
  • Max 订阅用户开放 5 天,访问 claude.ai/imagine

相关概念

来源

anthropic-claude-sonnet-4-5原始路径