研究:重复采样比让 LLM 自我反思更高效

rohanpaul_ai · x · 2026-08-15

一项新研究对比了 7 种测试时推理方法,发现在相同 token 预算下,简单的重复采样(解多次数学题并选最多结果)在大多数情况下优于让模型自我反思或修正。在 36 次对比中,复杂方法无一能稳定击败重复采样基线,其中 10 个甚至显著更差。这表明对于可验证的推理任务,多花 token 生成独立尝试比要求模型自我检视可能更有效。研究基于 Qwen2.5 (1.5B-7B) 在数学任务上的测试。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →