补充评测显示 Muse Spark 明显压过 Grok-4.20

cis_female · x · 2026-07-21

作者补充说,这次比较带上了 成本数据;他们之前把 Muse Spark 和 Grok-4.20 当成“便宜且效果差不多”的新模型,但这份评测里,Muse Spark 表现接近最佳,而 Grok 明显更差。

这条补充帖的重点仍是:在相同任务下,不同模型的能力/成本性价比可能差异很大。

所属事件:多模态大模型横向评测聚焦性价比与上下文理解(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →