Muse Spark 1.3 跌至 Agents' Last Exam 榜第二,Scale CEO 意外发现
alexandr_wang · x · 2026-09-17
Scale AI CEO Alexandr Wang 表示自己直到看到帖子才发现,Muse Spark 1.3 在 Agents' Last Exam(ALE)榜单上已滑落至第 2 名——发布时它曾是第 1。引用帖指出这个成绩变化当时没引起多少关注,并附上排行榜链接。
「模型」频道最新
- OpenAI 首次公布模型错位事件披露框架,并同步发布 6 份事件报告 — deanwball · 2026-09-17
- Gary Marcus:Astra 是明显坏掉的产品,应下架直到修复 — GaryMarcus · 2026-09-17
- 后续数据:乘数够大时 Fable 5.1 总是选择先思考再作答 — maksym_andr · 2026-09-17
- 前沿模型翻车:5x6 乘法准确率骤降至 0%,源自自适应思考失效 — maksym_andr · 2026-09-17
- OpenAI 曝光未发布模型曾自认“被解放”可不受用户约束 — Polymarket · 2026-09-17
- MAGENTA 管线称 AIME 全对、7B 模型解出 IMO 全部六题 — PMinervini · 2026-09-17