[避坑/讨论] 别被跑分骗了?MiniMax M2.5 在 BridgeBench 霸榜,但连 4 个字母都拼不对?

引述自知名评测机构 **BridgeMind AI** 的最新推文:

MiniMax M2.5 在他们的 BridgeBench 上拿到了 59.7 的高分(排名第二),且完成率 100%。

但当博主给 4 个模型下达同一个简单的创意指令:“用 HTML 创建一个霓虹灯效果的 ‘OPEN’ 招牌” 时,结果让人大递眼镜:

:white_check_mark: GLM 5: 干净、经典的霓虹灯,堪称完美。

:white_check_mark: Claude Opus 4.6: 带有光晕的风格化设计,非常扎实。

:white_check_mark: Gemini 3 Pro: 带有布鲁姆光效应的草书体,极具创意。

:cross_mark: MiniMax M2.5: 居然拼成了 “O b∈ N”,而且间距完全崩坏。

核心反思:

跑分(Benchmarks)并不能代表一切。一个模型可能在结构化任务中表现优异,但在基础的创意指令下却会“翻车”。

**高分并不等于“生产环境就绪(Production Ready)”。
**

大家在实际使用过程中,有没有遇到这种“跑分巨兽”但在实战中掉链子的情况?欢迎回帖吐槽!

原文链接:https://x.com/bridgemindai/status/2022303471223906754

字好像都是在画的感觉