前 OpenAI 政策总监吐槽:Fable 5.1 在实际工作流中极度费 token
Miles_Brundage · x · 2026-09-03
Miles Brundage 指出,虽然某模型(Fable 5.1)在定义清晰的评测任务上很省 token,但它在真实工作流中的默认行为却比上一代 5 多产出数百万 token——评测表现与实际使用开销存在明显落差。这是对模型评测与真实使用差距的具体观察。
「模型」频道最新
- AI 模型发布潮不止 24 小时,密集窗口已延长到一周以上 — eyishazyer · 2026-09-03
- Meta 首席 AI 官称 Muse Spark 1.3 拿 GPT-5.6 Sol 直接对标 — eyishazyer · 2026-09-03
- NVIDIA 75B 混合 MoE 本地可跑:Mamba+注意力交错,参数量砍至 9.3B 激活 — jacek2023 · 2026-09-03
- 开发者称 GPT 电脑操作能力领先,Anthropic 远远落后 — CtrlAltDwayne · 2026-09-03
- 疑似 GPT-6 曝光:分支命名现踪迹,主攻 computer use 能力 — scaling01 · 2026-09-03
- GPT-5.6 会学你说话的腔调,被赞比 Claude 更有人味 — CtrlAltDwayne · 2026-09-03