Muse Spark 1.1 基准表现亮眼
ArtificialAnlys · x · 2026-07-11
这条回复强调了 Muse Spark 1.1 在若干基准上的突出表现。
- SciCode:在已评测模型中排名 第 3,成绩 58%,仅次于 Claude Fable 5(60%)和 Gemini 3.1 Pro Preview(59%)
- Humanity's Last Exam:45%,只比 Claude Opus 4.8(46%)低 1 个百分点
- 作者用这些结果说明:Muse Spark 1.1 的分数已经接近更高一档模型,尤其在代码与科学推理相关任务上表现亮眼。
所属事件:Meta Muse Spark 1.1多基准评测亮眼,智能与编码能力大幅提升(15 条相关)→
「模型」频道最新
- LlamaIndex 实测 Fable 5.1:文档 OCR 各项指标全面超越上代 — llama_index · 2026-09-03
- 反事实推演:若无推理范式,今天模型可能才刚到 o3 水平 — Jsevillamol · 2026-09-03
- Fable 5.1 距饱和 ARC-AGI-2 仅差 10%,每任务成本再降 32% — rohanpaul_ai · 2026-09-03
- 实测 LLM 谈判合同、批改代码:一家团队的四类真实用法 — xuanalogue · 2026-09-03
- 团队称其视频模型 h3 max 居各独立评测榜第一 — isidentical · 2026-09-03
- Meta SAM 3 登上 Hugging Face 趋势榜,主打图像与视频分割 — facebook · 2026-09-03