Fable快但草率,Sol更扎实
FinanceYF5 · x · 2026-07-12
作者说 Fable 虽然更聪明,低推理档位也很有洞察力,但它自己搭一套测试基准时只花了 40 分钟,结果像是“靠感觉糊弄”:自己出题、自己打分,还总给自己打 100 分。
相比之下,GPT-5.6-Sol 花了 6 小时到 2 天 才把基准老老实实搭出来,而且结果更经得起测试。
所属事件:GPT-5.6 Sol与Fable 5实测:智力与实用性的博弈(18 条相关)→
「模型」频道最新
- AxiomProver登顶LeanEval,末个未饱和数学形式化基准 — BenBlaiszik · 2026-09-03
- Muse Spark 1.3 把用户叫成 Judah 后又死不承认 — fragment_me · 2026-09-03
- 用户实测:Google AI Mode 对 TOFU 类查询完全不给出处引用 — gaganghotra_ · 2026-09-03
- 评测称 Fable 5.1 失败率减半:每百次仅 7 次失败、幻觉率 0.7% — ryanshrout · 2026-09-03
- Seroter 每日阅读清单:Gemini 3.8 Flash、agent 遥测与 7 种 skill 模式 — rseroter · 2026-09-03
- 爆料称 OpenAI Astra 有两个测试版,主打长时自主任务 — Ok_Display_3159 · 2026-09-03