原始文档 文章 AI Agent 模型横测 GPT DeepSeek MiniMax Xiaomi 2026

AI Agent 模型横测 GPT DeepSeek MiniMax Xiaomi 2026

文章 5 min read · 未标注

千元横测GPT、DeepSeek、Xiaomi、MiniMax的最强模型,我找到了跟Agent们的绝配

卡尔的AI沃茨 | 2026年4月30日

事情是酱的

这天我在AA榜上看前28的模型感到有点陌生。上周太集中发的后果就是光在用GPT-5.5了,小米的Mimo-V2.5-Pro,DeepSeek V4 Pro还没有放在Agent的场景上测。

所以我跟钱包一拍即合,复制了4个一模一样的Hermes Agent,记忆一样,skill一样,系统设置一样,能调用的工具也一样。我只换模型。

这次的4个候选是GPT 5.5、MiniMax M2.7、DeepSeek V4 Pro和小米Mimo-V2.5-Pro,默认能开高推理就上高。

选手介绍

  • DeepSeek V4 Pro:最近刚开了识图模式,5月底之前都是2.5折。总参数量1.6T,比V3.2翻了两倍多。但有被发现放在Agent场景上识别本地的Skill不成功,执行高风险动作的时候也没有询问,Agent框架失效了。还有说V4 Pro巨烧token的,同样的任务是sonnet 4.6 medium的8倍。
  • Mimo-V2.5-Pro:能跟GLM 5.1打得有来有回。但额度烧超快,据说是一个5分钟编程任务月额度就没了50%。
  • MiniMax M2.7:Coding Plan量大管饱。MiniMax开源了自家CLI,在一个coding plan里还用视频生成,音乐生成和语音合成模型,不需要额外去接MCP server,额度也是分开计算的。

五关横测

第一关:Skill打包

让模型把Claude Design提示语打包成可发布的skill。

GPT 5.5:列出了原版提示语提到的一些能力,去掉了一些很明显的约束条件,整体来说就是一个很标准的答案。

MiniMax 2.7:在打包的过程发现了更多的细节,包括因为它只是一个提示语,里面提到的很多环境都是没有的,所以直接打包成Skill的时候,会把这些理想化的条件设定进去。2.7还觉得现在Skill的触发条件不够宽。

DeepSeek V4 Pro:自检出了不少的问题,甚至提出了一些在之前用Claude Opus 4.6打包这个skill的时候没看到的一些潜在的问题。

小米:先是看到本地已经有一个打包好的Claude design skill,觉得这个skill已经非常完善了,去检查了一下它有没有什么问题。当我明确给他答复要打包成为一个新的skill之后,又给了一个新的,更多针对这个skill在触发的过程中会遇到什么使用问题。

第二关:网页开发

基于刚生成的skill做个人网页。测的是审美迁移。

GPT 5.5:学Claude有点学到精髓了,但定位跟整个尺寸的放大缩小有问题,页面跟组件不是完全对位的,整体是往左边上面缩小的。虽然有SVG点击跳转和右下角提问的互动,但整体不能说是一个成品。

MiniMax M2.7:优先保留了页面的完整性,然后再去做整体的设计和互动。互动有巧思,保留了输入光标,用动态图表做成果展示。中英文字体搭配不丑。

DeepSeek:脑回路跟大家想的都不一样,根据知识库过去分享的内容,想出了用鼠标作为探照灯去看四个角跟中间的信息。交互方式蛮惊喜的,但长文知识处理上差点。

小米:网页更贴合普通的个人网站,在第四页做了一个简单的命令行样式。太强调程序员身份了,没有给到很亮眼的交互。

第三关:PPT设计

加载PPT相关skill,把Hermes的安装手册变成一份能讲的HTML PPT。

GPT 5.5:排版没什么问题,但就像把自己的思考过程一股脑全部倒给你。

MiniMax M2.7:更偏向于说明,觉得10页只够安装Hermes,更想做一个总篇目录。

DeepSeek:从第二页开始放飞自己,配色没问题但页面切换一页蓝一页白,小字排版有问题。

小米:中间做了一次对话重置,会比较频繁触发确认。上下文明明只消耗了154K左右就不往下跑了,需要手动输入继续。但最后输出结果是好的。

第四关:知识库管理

让模型判断本地Obsidian目录怎么整理,准备了从5号到30号中间收录到知识库里的所有零散信息。

GPT 5.5:查看整个目录文件数量,补充说明文件,给了一个测试流程,选了一个合适的目录作为试点先连续观察两周。设置了不同的资料应该进哪个文件夹。延伸了Agent的优势,完全可以做到无感、定时化的缓慢迁移。

MiniMax M2.7:同样用了定时迁移+试点目录,给出了更具体的方案,有时间轴的答复,给出先按照哪几个目录,然后观察3周。评估标准就是这3周是不是多次用到了语义索引来提问搜索里面的文件。

DeepSeek:路线更激进,让我自己给自己问问题,觉得现在的obsidian是处理到一个什么样的阶段。给出了LLM wiki的一个完全重建方案,虽然会抹掉一些项目的目录结构,但会让整体语义匹配更高效。

小米:给了三条路线,并且还给了路线规划。处理方式是在已经有比较成体系的obsidian文件夹的情况下,希望AI能够更快速的理解知识库上下文。在生成方案之前还主动要求跟我进行对话。给出的方法是不动现在已有的目录,而是在旁边新建一个LM wiki作为速读层,obsidian作为一个桥接。

第五关:浏览器自动化

让模型完成高token消耗的浏览器自动化任务。查看Clawhub网页前100的skill,跟前一天的备份对比,看看有哪些新进前100名,会不会跟原有的100名有功能重叠。完成后把结论做成可视化的网页。

GPT 5.5:花了这些下面所有的模型两倍到三倍的时间才完成任务。

MiniMax M2.7:把结论写的最细致,不仅把中间遇到的路径错误告诉我,还说明了每次翻页是怎么实现的,给出了三个双十榜。给出了潜力Skill的评估标准:新进Top100、下载增量Top20、排名比起上次涨了八位以上。

DeepSeek:对比了多个本地备份后,发现前后排名有大幅度震荡,只给了提醒没有做修复。

小米:在浏览器自动化比前面几个任务表现更好。完成了skill加载,网页内容梳理,还找到了obsidian之前对于这个网页数据的数据备份,额外编写了一个脚本实现分页、结构标准化。最后成功配置了一个在本地运行的定时任务。

结论

如果一个模型只是会聊天,它很快就会露馅。如果一个模型只是编程强,它也会在PPT里露馅。如果一个模型只会跟着提示语走,它会在知识管理的环节受到原来偏好的影响限制。

在Claude反复调价,Pro套餐已经不包含Claude Code额度的情况下,我会选择GPT和MiniMax作为长期的Agent模型搭配。

它们的组合不一定最炸,但都是真用得起、愿意每天用的模型。

以前总是在问,哪个模型更聪明。但现在真正的问题应该是,哪个模型能长期稳定干活。能封装Skill,有自己的审美,能整理本地知识库,能在浏览器自动化里摔几次后继续爬起来干活的。这才配叫主力模型。

不是榜单上的第一名,是我真的敢把任务全盘交给它负责的那个。

来源

暂无来源