概念 Extended Thinking(扩展思维)

Extended Thinking(扩展思维)

概念 2 min read · 2026-05-02 #reasoning#model-capability#performance

概述

Extended Thinking(扩展思维)是 Anthropic 在 Claude 模型中实现的一种推理能力,允许模型在回答问题前进行自我反思和逐步推理。它首次随 Claude 3.7 Sonnet 推出,作为"混合推理模型"的核心特性,将快速响应和深度反思能力整合到单一模型中,模拟人类认知过程。该功能在数学、物理、编程和指令遵循等任务上显著提升了性能,并在后续的 Claude 4 系列中得到进一步增强。

关键信息

Claude 3.7 Sonnet(首次引入)

  • 混合推理模型:市场上首个同时具备即时响应和深度思考能力的模型
  • 双模式
    • 标准模式:Claude 3.5 Sonnet 的升级版
    • 扩展思维模式:回答前自我反思,提升数学、物理、编程等任务表现
  • API 控制:用户可设置 token 预算(最高 128K tokens)来控制思考时间,平衡速度/成本与答案质量
  • 现实世界优化:相比竞赛题,更注重现实商业任务

Claude 4 系列增强

  • 扩展思维+工具使用(Beta):两个模型都可以在扩展思维期间使用工具(如网络搜索),在推理和工具使用之间交替进行
  • 思维摘要:较小的模型会浓缩冗长的思考过程(约 5% 的时间)。完整思维链可通过新的"开发者模式"访问
  • 减少捷径行为:两个模型在易受影响的智能体任务上使用捷径或漏洞的可能性降低了 65%

Claude Opus 4.6 演进

  • 自适应思考:模型可以自行决定何时需要更深层推理,取代了之前的二元扩展思维开关
  • 努力控制:四个级别(lowmediumhigh[默认]、max)来控制智能、速度和成本
  • 上下文压缩(Beta):自动摘要旧上下文以支持更长时间的任务
  • 128K 输出 tokens:支持更大的输出,无需将任务分成多个请求

性能提升

  • 在 SWE-bench Verified 上取得最先进的成绩
  • GPQA Diamond、MMMLU、AIME 等基准测试中,使用扩展思维时报告最高分数
  • 扩展思维在数学和科学领域提供显著提升

相关概念

来源

anthropic-claude-3-7-sonnet.md原始路径
anthropic-claude-4.md原始路径
anthropic-claude-opus-4-6.md原始路径