原始文档 文章 51CTO MiMo V2.5 OpenClaw Agent Harness 2026

51CTO MiMo V2.5 OpenClaw Agent Harness 2026

文章 5 min read · 未标注

Token效率国内第一!MiMo-V2.5 Pro登顶开源Agent王者;罗福莉:OpenClaw是巨大分水岭,模型与Harness需同步演进,MLA不符合Agent范式

51CTO技术栈 | 玉澄

编辑 | 玉澄

今天凌晨,小米突然开源了其最强模型 MiMo-V2.5 系列!其中 MiMo-V2.5-Pro 在 Agent 基准测试上登顶开源第一,超过了 DeepSeek V4-Pro、Kimi K2.6 和 GLM 5.1!

就在公测短短 5 天后,小米罗福莉团队就把 MiMo-V2.5-Pro 和 MiMo-V2.5 两个主力模型权重、tokenizer 全甩到 Hugging Face 上了。

两款模型均支持 1M 上下文窗口,都取得了 MIT 协议,而且都是面向 Agent 设计的。

有 MIT 协议就意味着商用部署、持续预训练、LoRA 细调、甚至二次开发,全都随便玩,没有任何限制。

模型开源就算了,小米 MiMo 还开启了一个"Xiaomi MiMo Orbit 百万亿 Token 创造者激励计划",又添了一把火。

同时就在上周,被誉为"AI 天才少女"的罗福莉接受了人生中第一次长时间的技术访谈。在这场对谈中,她分享了自己近两个月对于 Agent 的使用经历和深度思考。

MiMo-V2.5 系列 Agent 能力

在 MiMo-V2.5 系列中,MiMo-V2.5-Pro 是专为复杂的 Agent 和编码任务而设计的,总参数 1.02T,激活参数 42B。而 MiMo-V2.5 是具有强大 Agent 能力的原生全模态模型,总参数 310B,激活参数 15B。

通用 Agent 评估基准的三个重要指标:

  • GDPVal-AA(Elo):Agent 能不能干真实世界中专业人士的活,覆盖 44 个职业,评估只看实际产出质量并采用 Elo 评级系统。
  • τ³-Bench:Agent 能不能当好真实客服,是否具有长时间对话、多轮对话和遵守策略的能力,更强调可靠性。
  • ClawEval(pass^3):2026 年才发布的端到端 Agent 评估基准,考的是 Agent 在全程透明和被干扰时完成 300 个真实任务的水平。每一步 Agent 动作都会通过执行轨迹、审计日志、环境快照三重证据记录,实现轨迹感知评分。

V2.5-Pro 在 GDPVal-AA(Elo)上拿下 1581,在 ClawEval(pass^3)上拿下 63.8,τ³-Bench 上拿下 72.9,稳居开源榜首,和世界顶尖闭源模型进行比较也没在怕的。

V2.5-Pro 的 Token 效率相较 Kimi K2.6 能省 42%,而其编码能力又直逼 DeepSeek V4 Pro,并且成本更低。

两款模型可以在 Hugging Face 上一键下载,小米与社区合作实现了 vLLM 和 SGLang 的当天支持,并且模型原生支持 FP8 混合精度,量化后哪怕消费级显卡也能处理长上下文任务。

罗福莉关于 Agent 的见解

OpenClaw 使用经历

罗福莉在一月份刚知道 OpenClaw 时,只觉得"OpenClaw 不过就是 Claude Code 加上一个即时通讯(IM)界面。"不过,春节期间用了 OpenClaw 之后,她觉得它非常有自主性,而且很有"灵魂"。

这种温暖感和关怀感得益于 OpenClaw 的很多机制:比如它有 search.md,在每一轮对话的上下文中都会拼入当前时间,还有非常细微的设计,这就是为什么她把它称为"精细编排的上下文"。

到了第二天,她和 OpenClaw 就"如何在团队中激发好奇心"深入讨论了一个小时,并最终转化成一系列 Skills。到现在,无论是选人还是团队管理,她都会问 OpenClaw,觉得它基本变成了她的数字分身。

第三天,她尝试和 OpenClaw 讨论"如何构建一个好的用户 Agent",结果基本实现了。她可以将用户 Agent 与后训练(post-training)框架结合,构建更丰富的智能体场景数据。

她认为认知经历了三次转变:"从最初觉得它只是一个有灵魂、有温度的产品设计,进化到它能帮我分担生活或工作,最后甚至推动了我的研究。"

Agent 框架分析

罗福莉分析 OpenClaw 比 Claude Code 更好的原因:

  1. 它有一个更持久的记忆系统,体现在记忆的分层和分级上
  2. 多模型的协同利用:OpenClaw 会自动找视频理解能力强的模型来处理视频

她认为 OpenClaw 的核心产品逻辑是"尽可能通过整套 Agent 编排来弥补模型的短板"。

她和团队还把 MiMo V2 Flash 和非常小的 3B 端侧模型放到了 OpenClaw 里,依然能完成那些她认为小模型做不到的事情。所以她第一次感觉到,"原始且复杂的 Agent 框架设计确实能弥补很多模型能力的不足"。

持久化记忆设计

罗福莉认为,一个好的 Agent 框架有一些最基本的特征,比如持久化记忆。

OpenClaw 的设计借鉴了 Claude Code 的记忆系统设计思路,但更多考虑的是如何更好地端到端完成所有任务,以及如何针对当前模型在端到端任务中的短板进行设计。

她认为,OpenClaw 这种新的 Agent 框架加上中档模型,"可以在 85% 的任务上达到与 Claude Sonnet 同等量级的水平"。

Agent 的"自学习"

罗福莉讲到,Agent 的"自学习"最可能的发生路径是:

  1. 模型本身与 Agent 架构需要同步演进
  2. 随着模型的进步,它实际上在改变整个 Agent 框架
  3. 包括发送给模型的静态信息(记忆、Skill 文件夹)和动态信息(整个 Agent 架构的设计)
  4. 在提升模型能力的同时,需要提升 Agent 框架对该模型的适配度或泛化能力

Agent 框架 / Harness

罗福莉认为,"产品"可以定义为人机交互时能直接感知到的层面,但 Agent 框架位于定义交互层之前,它定义了你在那个层面如何与模型进行沟通。

Agent 框架能了解模型能力的优缺点,知道如何更好地调度。这一人与模型之间的中间层可以做得非常厚,而前端 UI 成为最薄的一层,不再是关键。

她认为"Claude Code 一直是一个非常复杂的 Agent 框架,只是因为它是个黑盒,所以我们不知道它是如何设计的。OpenClaw 是开源的,所以你知道它是如何设计的,然后你可以去改变它。这种'可改变性'非常非常重要。"

MLA 机制不符合 Agent 的范式

罗福莉认为,MLA 不符合 Agent 的范式。MLA 的原始设计是为了在 H 系列芯片上实现更好的访存计算比,从而打破访存瓶颈,不浪费算力。在这种结构下设计的模型架构,几乎没有发挥空间。

如果 KV Cache 很重要,同时推理速度也很重要,能不能用一些推理加速的方法?她想到了 MTP(多 Token 预测)也是一种方法,可以让实际推理速度提升 n 倍。

但 MLA 结构下很难写 MTP,因为 MLA 已经达到了压缩与访存(Memory Bound)的一个完美临界点。如果再用 MTP,它又会被计算受限(Calculation Bound)卡住。所以所有 MLA 结构的模型(GLM、Kimi)都没用 MTP,因为计算受限的情况下用 MTP 并不划算,所以他们的模型会慢一些。

她和团队选择的解决方式是:利用滑动窗口节省下来的注意力算力去填充 MTP。具体架构创新是:将混合比例推向了极致,全量注意力(Full Attention)和滑动窗口(Sliding Window)层的比例达到了极端的 7:1。这样节省了 KV Cache,使其在处理长文章时更有效,能支持更长的上下文。这样在实际推理中,访存和计算能达到很好的平衡,同时也兼顾了长文本的成本和推理速度。

来源

暂无来源