【深度评测】MiniMax-M2.5 真相:Agent 能力大涨,但‘幻觉率’反弹至 88%(拒绝官方滤镜)

与其看 MiniMax 官方发布的“遥遥领先”数据,我们更应该关注全球知名的独立评测机构 Artificial Analysis 带来的客观报告。针对最新发布的 MiniMax-M2.5,这份数据揭露了一些官方通稿中不会提到的细节。

:bar_chart: 核心数据复盘 (Artificial Analysis 评测)

相比前代 M2.1,M2.5 的表现可以概括为:智力小幅提升,Agent 能力暴涨,但幻觉可靠性出现“大幅倒退”。

  • Intelligence Index(智力指数)42 (微涨 2 点)。
    • 目前与 GLM-4.7 和 DeepSeek V3.2 并列开放权重模型 #3-5
    • 仍落后于 GLM-5 (50) 和 Kimi K2.5 (47)。
  • Agentic Index(AI 智能体表现)56 (从 47 大幅跃升)。
    • 在真实知识工作场景(演示稿制作、分析、终端环境操作)中表现极其强悍,位列开放权重模型 TOP 3
  • :warning: 致命短板:Hallucination Rate(幻觉率)88%
    • 相比 M2.1 的 67% 大幅反弹,退化到了 M2 初代的水平。
    • 代价:虽然准确性(Accuracy)涨了一点点,但模型变得“过于自信”,在不确定的情况下更倾向于一本正经地胡说八道,而不是拒绝回答。

:light_bulb: 深度观点

官方数据往往只展示分数的增长,但 Artificial Analysis 的评测告诉我们一个残酷的事实:MiniMax-M2.5 是一个更强的“打工人”(Agent 能力强),但却是一个更不诚实的“汇报者”(幻觉率极高)。

如果你用它来执行自动化任务,它的效率会更高;但如果你用它来检索事实或做知识库问答,务必保持高度警惕,不要被它的自信所迷惑。

**相比官方 Benchmarks,我更愿意相信这种带刺的真实。
**

数据来源: Artificial Analysis - MiniMax-M2.5 Report