蚂蚁集团(Ant Group / InclusionAI)最近在 Hugging Face 上线了其旗舰模型 Ling-2.5-1T(又称 Ring-2.5-1T)。这款具备 1 万亿参数(激活参数 63B)的大模型,凭借独特的混合线性注意力架构(MLA + Lightning Linear Attention),在深度推理和事实准确性上展现出了令人惊叹的统治力。
核心评测亮点:极致的“理科生”
与其说是全能助手,Ling-2.5-1T 更像是一个专门为高难度逻辑设计的“思考引擎”。
- 奥数级推理(Reasoning):
- 在 AIME26 测试中取得 87.08 分,大幅领先 GPT-5.2 (66.20) 和 Kimi-K2.5 (66.98)。
- 展现了极强的“System 2”慢思考能力,适合处理极其复杂的数理推演和算法设计。
- 抗幻觉天花板(Accuracy):
- SimpleQA 得分高达 78.97(作为参考,GPT-5.2 为 67.77)。
- 这意味着它“不乱说话”,在事实核查、高可信度咨询场景中非常有优势。
- 原生 Agent 能力:
- 在 BFCL-v4 (工具调用) 评测中列第一梯队(69.87),原生 Agent RL 训练让它非常擅长 API 编排。
优缺点直评
强项:复杂 STEM 科研、数理逻辑、高精度知识库问答、API 驱动的 Agent 后端。
短板:在 Terminal 操作(命令行交互)表现一般;纯粹的长文搜索(大海捞针)效率略逊于 Gemini 3 Pro 这种全能长文本选手。
技术架构
Ling-2.5-1T 采用了 MLA (多头潜在注意力) 配合 线性注意力机制,仅用 1/4 的 Token 消耗就达到了顶尖思考模型的推理水平,实现了智能与成本的平衡。
项目主页/模型权重: Hugging Face - inclusionAI/Ling-2.5-1T
观点总结:
如果你的业务场景需要“严谨”和“深度推导”,Ling-2.5-1T 可能是目前开源/半开源领域最值得尝试的选择。它标志着国产模型在万亿级 MoE 架构上不仅能做“大”,还能做“精”。
大家对这类“思考型模型”怎么看?欢迎实测交流!
