Fable 5.1 评测:估算能力依然糟糕
rudrank · x · 2026-09-02
用户反馈称 Fable 5.1 在估算(Estimates)任务上的表现依然很差,暗示该模型在数值推理或特定任务能力上存在明显缺陷。
所属事件:Fable 5.1 逻辑基准 78 分破纪录,估算能力仍弱(4 条相关)→
「模型」频道最新
- GPT 5.6 Sol 全程制作动画引发技术质疑 — chongdashu · 2026-09-02
- MiniMax-H3-Turbo 开源 LoRA 去审查版登顶 Hugging Face — Pepe104 · 2026-09-02
- 网友猜测:Fable 是循环两倍的 Opus,价格才正好翻倍 — cgarciae88 · 2026-09-02
- 实测对比:Gemini 3.8 Flash 已面向 Pro/Ultra 账号推送 — Able-Line2683 · 2026-09-02
- Fable 5.1 高度复刻马里奥 1-1 关卡,网友呼吁改考关卡设计 — max_paperclips · 2026-09-02
- 3B 模型 TwIL 在形式推理上击败 120B 开源模型 — Socially-great8275 · 2026-09-02