实证打脸自我反思:36次对比全无胜绩,模型自检反降10%

omarsar0 · x · 2026-08-05

一篇最新论文对 LLM 的「自我反思」机制进行了严格的实证测试。研究选取了 7 种主流方法,在 1.5B、3B 和 7B 参数的开源模型上进行数学基准测试,并严格计算了反思、批评等环节消耗的所有 token。

结果显示,在控制计算成本的前提下,所有 36 次对比测试中,没有任何一种反思方法带来可靠的性能提升。更糟的是,其中 10 次测试结果明显低于基线,且全部属于「模型自检输出」的方法。例如,在 7B 模型上,强制反思反而使准确率下降了 3.6 到 10.1 个百分点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →