[硬核实测] MiniMax-M2.5 4000万 Token 深度跑分(转自 karminski-牙医):Agent 能力与吞吐量双向起飞!

国产大模型真的进入了“按月迭代”的魔鬼节奏!

今天同步一份来自业内大神 @karminski-牙医 的超硬核实测。这次总计消耗了约 **4000 万 Token**,全方位覆盖了 MiniMax-M2.5 的编程、Agent、长上下文等实战指标。

==========================================

:bar_chart: 核心实测数据一览

● **指令遵循(洛希极限)**:部分遵循率 80%,完全正确率 65.9%。
● **物理仿真(大象牙膏/鞭炮测试)**:物理细节大幅提升,4 substep 迭代下几乎无穿模,工程严谨性亮眼。
● **长文本召回**:均值 **96.7%+**(注:由于存在无参考召回异常,此分数仅供参考)。
● **Agent 专项测试(外卖骑手场景)**:

  • 总分 599,较 M2.1 提升 **42.8%**;
  • 准时率从 48.4% 激增至 **69.6%**;
  • 每公里利润提升 36.5%。

==========================================

:high_voltage: 性能与并发表现

最让开发者惊喜的是响应速度:
● **输出稳定性**:稳定在 **100 token/s**。
● **架构优势**:10B 激活参数配合极高 API 并发,在大规模 Agent 场景里简直是“吞吐量神器”。

==========================================

:speech_balloon: 总结与评价

大神一句话评价:“这版 M2.5 是性价比+实用性都在线的升级版,值得重点关注。”

目前看来,M2.5 并不是在追求学术榜单的极限,而是在追求**“更好用、更快速、更便宜”**的工业级交付。

社区的小伙伴们,你们对这波 100 tok/s 的输出速度有体感吗?这种高吞吐模型对你们的智能体工作流有多大提升?欢迎评论区交流!

测试完整视频

:thinking: