论文揭示推理模型“思考”行为未必关联正确答案
Jeande_d · x · 2026-08-27
一篇新论文研究了推理模型(Reasoning models)在输出数千 token 的思维链时的行为。研究发现,尽管这些模型在准确率上通常优于其指令微调版本,且表现出自我修正、假设测试等行为,但这些“思考”行为实际上往往与最终答案的正确性关联不大。论文质疑了“思维链能放大最相关推理行为”的假设,指出了当前评估指标(如准确率)无法揭示推理过程中的失败模式。
所属事件:CMU与斯坦福研究:推理模型强化的行为多与正确性无关(8 条相关)→
「模型」频道最新
- Ox Alpha模型来源确认,此前猜测为Meta或Google — basedjensen · 2026-08-27
- 开发者实测 Gemini 3.5 Transcribe:WER 低至 2.6%,后处理体验极佳 — _philschmid · 2026-08-27
- 评测显示 OpenCode 会让开源模型变笨,Pi 框架表现领先 — PMinervini · 2026-08-27
- 谷歌推出 Gemini 3.5 Transcribe 语音转文本模型 — GoogleDeepMind · 2026-08-27
- 新基准 TB-fn 揭露:许多高分模型实则名不副实 — abeirami · 2026-08-27
- Anthropic 数据揭示:企业不愿为最强模型买单 — sudoraohacker · 2026-08-27