研究称推理模型常强化无效行为,成功关联度低
Jeande_d · x · 2026-08-26
这项研究分析了思维链中哪些行为真正与任务成功相关,发现推理模型往往在错误的维度上进行了强化。
主要发现
- 无效行为被放大:自我纠正、假设检验和承认不确定性等行为在推理模型中被大量展示,但研究表明这些行为与任务成功的关联度很低。
- 关键行为被忽略:真正与成功高度相关的是“信心校准”、“知识对齐”和“自我意识”,但这些行为在推理过程中几乎没有得到强化。
- 跨模型一致性:在 DeepSeek-R1/V3、Kimi-K2-Think、Grok-4/4.1 等 7 个大模型上的测试显示,行为的 Lift 排名高度一致,说明这是一种普遍现象而非偶然。
建议
- 在训练推理模型或进行数据筛选时,应减少对表面无效行为的奖励,转而强化那些具有实质意义的行为。
所属事件:CMU与斯坦福论文:推理模型强化的行为多与正确性无关(5 条相关)→
「研究」频道最新
- SkildAI 发布 S1 模型,单示例免训练执行十分钟长任务 — deepakpathak · 2026-08-26
- Pangram 检测准确率极高,几乎无误判人类写作 — ivan_bezdomny · 2026-08-26
- NVIDIA 展示如何用 AI 编码智能体解锁材料模拟工作流 — PyTorch · 2026-08-26
- Foveated Diffusion:仿人眼视觉的高效图像视频生成 — CSProfKGD · 2026-08-26
- AI 天气模型 Zeus 上线能源感知功能,优先欧洲 — const_reborn · 2026-08-26
- 直接在 Prompt 中运球绕过 AI 水印 — JulianHabekost · 2026-08-26