比较 ›AI Agent 模型横测(2026 年 4 月)
2026 年 4 月 30 日,「卡尔的AI沃茨」在完全相同的 hermes-agent-workflow-features 环境下(记忆、Skill、系统设置、工具全部一致),对四款顶级模型进行了五关 Agent 场景横测。
参赛选手
| 模型 | 总参数 | 特点 |
|---|---|---|
| gpt-5-5 | 未公开 | OpenAI 最新旗舰 |
| mimo-v2-5 | 1.02T(激活 42B) | 小米开源,Agent 基准开源第一 |
| DeepSeek V4 Pro | 1.6T | 比 V3.2 翻倍,新开识图模式 |
| MiniMax M2.7 | 未公开 | Coding Plan 量大管饱,自带多模态 |
五关测试结果
第一关:Skill 打包
将 Claude Design 提示语打包成可发布的 Skill。
- GPT 5.5:标准答案,列出能力但去掉了明显约束
- MiniMax M2.7:发现更多细节,认为触发条件不够宽
- DeepSeek V4 Pro:自检出较多问题,提出了新潜在问题
- MiMo-V2.5-Pro:先检查已有 Skill,确认后才新建,更关注触发阶段的使用问题
第二关:网页开发
基于 Skill 做个人网页,测试审美迁移能力。
- GPT 5.5:学到 Claude 精髓但定位/缩放有问题,有 SVG 互动
- MiniMax M2.7:表现最佳 — 优先保证完整性,互动有巧思(输入光标、动态图表),中英文字体搭配好
- DeepSeek V4 Pro:创意惊喜(鼠标探照灯交互),但长文处理差
- MiMo-V2.5-Pro:贴合普通个人网站,第四页做了命令行样式,交互不够亮眼
第三关:PPT 设计
把 Hermes 安装手册变成 HTML PPT。
- GPT 5.5:排版无问题,但像倒出全部思考过程
- MiniMax M2.7:更偏向说明性,认为 10 页只够安装部分
- DeepSeek V4 Pro:从第二页开始放飞,配色没问题但页面切换不一致
- MiMo-V2.5-Pro:频繁触发确认,上下文 154K 左右就不继续,但最终结果质量好
第四关:知识库管理
整理本地 Obsidian 知识库目录。
- GPT 5.5:给出完整方案(文件数量统计、测试流程、两周试点、定时迁移),延伸了 Agent 优势
- MiniMax M2.7:同样用定时迁移 + 试点,给出更具体的时间轴和评估标准(3 周内语义索引使用频率)
- DeepSeek V4 Pro:路线最激进 — 要求用户自问自答,给出 LLM wiki 完全重建方案
- MiMo-V2.5-Pro:给出三条路线,不动已有目录,在旁边新建 LLM wiki 作为速读层,主动要求对话
第五关:浏览器自动化
高 token 消耗的浏览器任务:对比 ClawHub Top 100 Skill 排名变化并可视化。
- GPT 5.5:耗时是其他模型的 2-3 倍
- MiniMax M2.7:结论最细致 — 记录路径错误、翻页实现方式,给出潜力 Skill 评估标准
- DeepSeek V4 Pro:发现排名大幅震荡但只提醒不修复
- MiMo-V2.5-Pro:浏览器自动化表现最好 — 完成 Skill 加载、网页梳理、找到 Obsidian 数据备份、编写分页脚本、配置本地定时任务
综合评价
如果一个模型只是会聊天,它很快就会露馅。如果一个模型只是编程强,它也会在 PPT 里露馅。
作者结论:在 Claude 反复调价的背景下,选择 GPT 5.5 + MiniMax M2.7 作为长期 Agent 模型搭配——不是最炸,但「真用得起、愿意每天用」。
各模型优劣势总结
| 维度 | GPT 5.5 | MiniMax M2.7 | DeepSeek V4 Pro | MiMo-V2.5-Pro |
|---|---|---|---|---|
| Skill 打包 | ⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
| 网页开发 | ⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ |
| PPT 设计 | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐ |
| 知识库管理 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ |
| 浏览器自动化 | ⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ |
| Token 效率 | 低 | 高 | 极低(8x sonnet) | 高 |
相关页面
- gpt-5-5 —— OpenAI 旗舰模型
- mimo-v2-5 —— 小米开源 Agent 模型
- hermes-agent-workflow-features —— 测试使用的 Agent 框架
- agent-harness —— Agent 框架概念
外部链接
来源
[[raw/articles/ai-agent-model-benchmark-gpt-deepseek-minimax-xiaomi-2026]]原始路径