研究:重复采样比让 LLM 自我反思更高效
rohanpaul_ai · x · 2026-08-15
一项新研究对比了 7 种测试时推理方法,发现在相同 token 预算下,简单的重复采样(解多次数学题并选最多结果)在大多数情况下优于让模型自我反思或修正。在 36 次对比中,复杂方法无一能稳定击败重复采样基线,其中 10 个甚至显著更差。这表明对于可验证的推理任务,多花 token 生成独立尝试比要求模型自我检视可能更有效。研究基于 Qwen2.5 (1.5B-7B) 在数学任务上的测试。
「研究」频道最新
- DiG-bench 揭示:顶尖模型在简单发现游戏中仅胜 20% — misovalko · 2026-08-15
- Anthropic将推文本水印以符合欧盟AI法案 — maksym_andr · 2026-08-15
- 新书《不平衡数据》揭穿分类模型误区 — Al_Grigor · 2026-08-15
- Meta新论文揭示Chinchilla缩放定律盲点,预测误差大减 — rohanpaul_ai · 2026-08-15
- 大学研究团队招募ComfyUI用户与创作者参与访谈 — Lopsided_State_8621 · 2026-08-15
- 编码智能体记忆新思路:用因果历史而非文本检索 — jonah_omninode · 2026-08-15