实测:Fable 只在 320 字符以上才思考,数短句仍频出错
maksym_andr · x · 2026-09-18
maksymandr 数字母评测线程第 2 条:统计各模型答题前是否思考的调用比例。Fable 5.1 仅当输入达到约 320 字符才启用思考 token,而即使 20 字符的短句也常数错——不用思考本可提升准确率,暴露其自适应思考机制的失效。
所属事件:数字母实测翻车:Fable 护栏误触、token 低效(5 条相关)→
「模型」频道最新
- 105 个植入 bug 实测:Pareto 以 4.81 美元成本逼近顶级模型 — PawelHuryn · 2026-09-18
- Jason Wei 演讲:智能正商品化,自适应计算是关键转折 — dotey · 2026-09-18
- GPT-6-Astra 三小时通关《过山车大亨2》,对手花 5 倍 token 仍未达标 — scaling01 · 2026-09-18
- RL 模型自创诊断渲染手段理解代码,研究者称更大规模 RL 会现奇招 — teortaxesTex · 2026-09-18
- 开发者曝 Codex 安全加固后改单条消息实例,破坏 agent 记忆连续性 — RileyRalmuto · 2026-09-18
- Astra for Law 在法律研究基准大涨,Ethan Mollick 提问实验室会否吞掉所有 AI 垂直 — emollick · 2026-09-18