Muse Glimmer 智能体评测落后,但工具调用与幻觉控制优于同级

ArtificialAnlys · x · 2026-08-11

据 Artificial Analysis 的基准测试,Muse Glimmer 模型在同类竞品中的短板主要集中在智能体评估上:其在 GDPval-AA v2 的得分为 953 Elo,落后于 Qwen3.6 27B (1141)、Gemini 3.5 Flash-Lite (1141) 和 Kimi K2.5 (1004);在 Terminal-Bench v2.1 上(52%)也不及 Qwen3.6 27B(61%)。

然而,该模型在幻觉控制上表现较好,AA-Omniscience 得分为 82%,优于 Qwen3.6 27B(49%)和 Flash-Lite(34%,越低越好)。此外,在智能体工具调用方面,Muse Glimmer 在 Tau3-Banking 测试中得分达到 24%,明显领先于 Gemini 3.5 Flash-Lite(18%)和 Qwen3.6 27B(17%)。整体表现均优于同等规模的 Gemma 4 31B。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →