国产大模型真的进入了“按月迭代”的魔鬼节奏!
今天同步一份来自业内大神 @karminski-牙医 的超硬核实测。这次总计消耗了约 **4000 万 Token**,全方位覆盖了 MiniMax-M2.5 的编程、Agent、长上下文等实战指标。
==========================================
核心实测数据一览
● **指令遵循(洛希极限)**:部分遵循率 80%,完全正确率 65.9%。
● **物理仿真(大象牙膏/鞭炮测试)**:物理细节大幅提升,4 substep 迭代下几乎无穿模,工程严谨性亮眼。
● **长文本召回**:均值 **96.7%+**(注:由于存在无参考召回异常,此分数仅供参考)。
● **Agent 专项测试(外卖骑手场景)**:
- 总分 599,较 M2.1 提升 **42.8%**;
- 准时率从 48.4% 激增至 **69.6%**;
- 每公里利润提升 36.5%。
==========================================
性能与并发表现
最让开发者惊喜的是响应速度:
● **输出稳定性**:稳定在 **100 token/s**。
● **架构优势**:10B 激活参数配合极高 API 并发,在大规模 Agent 场景里简直是“吞吐量神器”。
==========================================
总结与评价
大神一句话评价:“这版 M2.5 是性价比+实用性都在线的升级版,值得重点关注。”
目前看来,M2.5 并不是在追求学术榜单的极限,而是在追求**“更好用、更快速、更便宜”**的工业级交付。
社区的小伙伴们,你们对这波 100 tok/s 的输出速度有体感吗?这种高吞吐模型对你们的智能体工作流有多大提升?欢迎评论区交流!