Muse Spark 1.1基准表现领先

alexandr_wang · x · 2026-07-13

Alexandr Wang 转述了一项新的理论计算机科学/有限模型理论评测结果:Muse Spark 1.1 在该基准上表现优于 Opus、Grok 4.5 和 Gemini。

被引的 benchmark 说明里提到:模型会拿到若干小图,需输出能够同时描述多个图中指定节点性质的一阶逻辑公式;该套评测共有 64 道题,重点考察归纳推理与形式化表达能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →