Hill Sampling:让冻结 LLM 沿最优解爬坡,胜过重复采样与进化训练

burny_tech · x · 2026-09-29

arXiv 新论文(Jacob Beck、Philip V. Ogren、Ari Kobren)提出 Hill Sampling 作为 test-time scaling 的更简替代方案,替代重复采样、进化方法和测试时权重训练。

核心思路: 把一个冻结的 LLM 条件化在它目前找到的最优程序上,通过简单的提示条件化爬山循环迭代改进。

结论: 这种简单做法在效果上可媲美甚至超过复杂的测试时权重训练与进化搜索方法。对在代码生成与科学发现上投入大量算力做进化循环、微调或复杂搜索架构的实践者,可能用同样甚至更少算力获得相等或更好的结果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →