Fable 模型视觉逻辑实测:78 分破纪录但仍漏 CAD 错误
Afinetheorem · x · 2026-09-02
评测显示 Fable 模型在视觉与逻辑结合的任务上表现接近顶尖,在私有逻辑基准测试中获得 78 分,显著高于此前 Sol 5.6 Pro 创下的 61 分纪录。然而,该模型仍会遗漏领域专家能轻易识别的特定错误,例如作者特意设计的、需三步推理才能发现的 CAD 平面图明显错误。
所属事件:Fable 5.1 视觉逻辑实测 78 分破私有基准纪录(3 条相关)→
「模型」频道最新
- Anthropic 被指回溯为旧版 Opus 模型加强防护 — LordCoice · 2026-09-02
- 泄露显示 Claude.ai 系统指令长度已达 13.8 万 token — frubberism · 2026-09-02
- 实测 Fable 5.1 生成成本超 GPT-5.6 六倍,细节更丰富 — rohanpaul_ai · 2026-09-02
- 实测 Fable 5.1 贵 6 倍:画质更细腻但仍犯低级错误 — rohanpaul_ai · 2026-09-02
- Polymarket 押注:Anthropic 94% 概率月底拥有最强模型 — Polymarket · 2026-09-02
- Claude Fable 5.1 破解悬置 373 年的古老密码,Vals AI 发布详解 — RusselTheBrickLayer · 2026-09-02