引述自知名评测机构 **BridgeMind AI** 的最新推文:
MiniMax M2.5 在他们的 BridgeBench 上拿到了 59.7 的高分(排名第二),且完成率 100%。
但当博主给 4 个模型下达同一个简单的创意指令:“用 HTML 创建一个霓虹灯效果的 ‘OPEN’ 招牌” 时,结果让人大递眼镜:
GLM 5: 干净、经典的霓虹灯,堪称完美。
Claude Opus 4.6: 带有光晕的风格化设计,非常扎实。
Gemini 3 Pro: 带有布鲁姆光效应的草书体,极具创意。
MiniMax M2.5: 居然拼成了 “O b∈ N”,而且间距完全崩坏。
核心反思:
跑分(Benchmarks)并不能代表一切。一个模型可能在结构化任务中表现优异,但在基础的创意指令下却会“翻车”。
**高分并不等于“生产环境就绪(Production Ready)”。
**
大家在实际使用过程中,有没有遇到这种“跑分巨兽”但在实战中掉链子的情况?欢迎回帖吐槽!
