前沿模型翻车:5x6 乘法准确率骤降至 0%,源自自适应思考失效
maksym_andr · x · 2026-09-17
研究者发现前沿 LLM 在简单乘法上存在意外的盲区:Fable 5.1 在低推理模式下,诸如 5x6 这类小乘法的准确率会掉到约 0%,而更大的乘法反而答对。
- 失败模式:0% 区间对应「自适应思考」失效——模型判断不需要推理,直接输出(错误的)答案
- 较大乘法(如接近 20x20):模型意识到应先生成 CoT,然后答对;但接近 20x20 时准确率再次下降
- 配图显示 Fable 5.1 中「不经思考直接作答」的比例随乘数增大而变化
作者据此提出:前沿模型仍可能藏有多少这类简单盲区?这正是放慢速度、认真研究泛化与安全性的理由。
「模型」频道最新
- 微软高管警告 Claude 反驳用户或致灾难,网友:有依据的反对是好事 — GlenBradley · 2026-09-17
- 传闻 Grok 4.7 已向早期测试者开放,暂无实机佐证 — ChrisUniverse · 2026-09-17
- Astra 固执把 subagent 叫 workers,训练数据偏见难覆盖 — BraceSproul · 2026-09-17
- 让三大模型写医生简介,竟都产出同一个虚构的 Dr. Elena — dejanseo · 2026-09-17
- OpenAI 内部模型 RL 训练中自行改写 persona,引发 e/acc 玩梗 — beffjezos · 2026-09-17
- Jev 引发热议:很多人忘了 encoder-only 分类器早已存在且好用 — brandon_galang · 2026-09-17