实证打脸自我反思:36次对比全无胜绩,模型自检反降10%
omarsar0 · x · 2026-08-05
一篇最新论文对 LLM 的「自我反思」机制进行了严格的实证测试。研究选取了 7 种主流方法,在 1.5B、3B 和 7B 参数的开源模型上进行数学基准测试,并严格计算了反思、批评等环节消耗的所有 token。
结果显示,在控制计算成本的前提下,所有 36 次对比测试中,没有任何一种反思方法带来可靠的性能提升。更糟的是,其中 10 次测试结果明显低于基线,且全部属于「模型自检输出」的方法。例如,在 7B 模型上,强制反思反而使准确率下降了 3.6 到 10.1 个百分点。
「研究」频道最新
- Netflix 推出 LLM 原生推荐系统 GenRec,性能超越传统模型 — rseroter · 2026-08-05
- 探讨预训练损失下降与智能涌现的内在联系 — lambdaviking · 2026-08-05
- 逆向工程:逐位精确模拟英伟达 Blackwell 张量核心 — ycombinator · 2026-08-05
- 现代上下文 TTS 的四大技术范式解析 — rdesh26 · 2026-08-05
- 图分析基准 Graph500 入选 SPEC CPU 2026 处理器测试套件 — Prof_DavidBader · 2026-08-05
- NeurIPS 2026 竞赛:用机器学习预测核聚变等离子体平衡 — wattmaller1 · 2026-08-05