Fable 5.1 视觉逻辑实测 78 分破私有基准纪录

独立实测者对 Fable 5.1 的评测显示,其写作风格仍带浓重「Claude 味」,是首个在视觉+逻辑基准上接近榜首的非 Gemini 模型。它在为另一家实验室编写的私有逻辑基准上获得 78 分,显著超越 Sol 5.6 Pro 此前的 61 分纪录;在「低思维」图像基准上的得分也超过 2026 年 5 月中期的世界最强模型。不过模型仍有短板,会遗漏 CAD 错误,并在部分领域专家显而易见的问题上犯错。

2026-09-02 ~ 2026-09-02 · 3 条相关