Fable 模型视觉逻辑实测:78 分破纪录但仍漏 CAD 错误

Afinetheorem · x · 2026-09-02

评测显示 Fable 模型在视觉与逻辑结合的任务上表现接近顶尖,在私有逻辑基准测试中获得 78 分,显著高于此前 Sol 5.6 Pro 创下的 61 分纪录。然而,该模型仍会遗漏领域专家能轻易识别的特定错误,例如作者特意设计的、需三步推理才能发现的 CAD 平面图明显错误。

所属事件:Fable 5.1 视觉逻辑实测 78 分破私有基准纪录(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →