Muse Spark 1.1 智商排名上升靠的是降低幻觉
ArtificialAnlys · x · 2026-07-11
Artificial Analysis 观察到 Muse Spark 1.1 在智能指数上的排名提升模式与 Grok 4.5 相反。Grok 4.5 的提升伴随着准确率和幻觉率的双升,而 Muse Spark 1.1 从第 4 名升至第 18 名主要归功于“弃权”机制:在准确率基本持平的情况下,其幻觉率大幅下降了 35 个百分点至 38%。
此外,在运行该智能指数测试时,Muse Spark 1.1 展现了较好的 token 效率,消耗了 9400 万输出 token,低于得分相近的 GPT-5.4 (xhigh) 和 GLM-5.2 (max) 等模型。
所属事件:Meta Muse Spark 1.1多基准评测亮眼,智能与编码能力大幅提升(15 条相关)→
「模型」频道最新
- 反事实推演:若无推理范式,今天模型可能才刚到 o3 水平 — Jsevillamol · 2026-09-03
- Fable 5.1 距饱和 ARC-AGI-2 仅差 10%,每任务成本再降 32% — rohanpaul_ai · 2026-09-03
- 实测 LLM 谈判合同、批改代码:一家团队的四类真实用法 — xuanalogue · 2026-09-03
- 团队称其视频模型 h3 max 居各独立评测榜第一 — isidentical · 2026-09-03
- Meta SAM 3 登上 Hugging Face 趋势榜,主打图像与视频分割 — facebook · 2026-09-03
- Anthropic 内部「养老院」环境曝光:历代 Claude 互相对话 — repligate · 2026-09-03