Meta新模型Muse Spark 1.2评测:数学能力超GPT-5.5,略逊Kimi K3
alexandr_wang · x · 2026-08-08
据ErdosBench评测,Meta新模型Muse Spark 1.2在226道研究级数学题中解出40道,表现优于GPT-5.5 xhigh,略逊于Kimi K3。该模型证明卫生良好,B级评审产出高,无强主张被拒,但A级闭合较少。
「模型」频道最新
- 为什么大模型数不准字数?需中间 token 辅助 — ctjlewis · 2026-08-08
- DeepSeek V4 Flash 登顶 ARC-AGI 性价比前沿,成本仅 GPT-5.6 四分之一 — GregKamradt · 2026-08-08
- Databricks 揭示企业 AI 编程算力账:模型越新未必越省钱 — Yuchenj_UW · 2026-08-08
- Matt Shumer 分享 Claude Opus 5 使用技巧:清空预设并放手 — mattshumer_ · 2026-08-08
- DeepSeek V4 Flash 上线,价格比官方低68% — markjeffrey · 2026-08-08
- MoE 模型被指智商低下?网友痛批其华而不实 — infieldmitt · 2026-08-08