前沿模型数字母大翻车:Astra 93% 准确率,Fable 仅 53%
maksym_andr · x · 2026-09-18
maksymandr 发布一组针对「数字母」任务的模型实测。该任务简单但超出在 SWE-Bench、TerminalBench 等基准上刷满的前沿模型分布:
- 低推理强度下,GPT-6-Astra 在 1280 字符文本上仍保持 93% 准确率,Fable 5.1 只有 53%。
- Fable 的准确率曲线不单调:约 320 字符以下它决定完全不使用思考 token,而这本可提升计数准确率,暴露自适应思考的失效。
- 实验动机是研究 no/low-CoT 下的模型表现:能否在不显式外化意图于 CoT 的情况下完成复杂方案(如 scheming)。
后续帖子还发现随机词序列数字母会触发 Fable 的生物安全护栏拒答,且 Fable 在长文本上多耗 3 倍以上 token、表现反而更差。
所属事件:数字母实测翻车:Fable 护栏误触、token 低效(5 条相关)→
「模型」频道最新
- 105 个植入 bug 实测:Pareto 以 4.81 美元成本逼近顶级模型 — PawelHuryn · 2026-09-18
- Jason Wei 演讲:智能正商品化,自适应计算是关键转折 — dotey · 2026-09-18
- GPT-6-Astra 三小时通关《过山车大亨2》,对手花 5 倍 token 仍未达标 — scaling01 · 2026-09-18
- RL 模型自创诊断渲染手段理解代码,研究者称更大规模 RL 会现奇招 — teortaxesTex · 2026-09-18
- 开发者曝 Codex 安全加固后改单条消息实例,破坏 agent 记忆连续性 — RileyRalmuto · 2026-09-18
- Astra for Law 在法律研究基准大涨,Ethan Mollick 提问实验室会否吞掉所有 AI 垂直 — emollick · 2026-09-18