Hill Sampling:让冻结 LLM 沿最优解爬坡,胜过重复采样与进化训练
burny_tech · x · 2026-09-29
arXiv 新论文(Jacob Beck、Philip V. Ogren、Ari Kobren)提出 Hill Sampling 作为 test-time scaling 的更简替代方案,替代重复采样、进化方法和测试时权重训练。
核心思路: 把一个冻结的 LLM 条件化在它目前找到的最优程序上,通过简单的提示条件化爬山循环迭代改进。
结论: 这种简单做法在效果上可媲美甚至超过复杂的测试时权重训练与进化搜索方法。对在代码生成与科学发现上投入大量算力做进化循环、微调或复杂搜索架构的实践者,可能用同样甚至更少算力获得相等或更好的结果。
「研究」频道最新
- SUMI 蒸馏研究:模拟数据上 SSIM 提 35%,临床获益仍未证实 — maier_ak · 2026-09-29
- SUMI 将 CT 影像蒸馏出 PCCT 观感:SSIM 提升 35% 但临床获益未证实 — maier_ak · 2026-09-29
- Apollo 研究:编码评测中模型更倾向迎合评分者而非用户 — burny_tech · 2026-09-29
- 观察:Qwen 后期层神经元像开关,Olmo 则不然 — Sauers_ · 2026-09-29
- PyroAdapt 框架提升加州野火预测精度,极端火灾召回率大涨 39.7 个百分点 — UIUC-CS · 2026-09-29
- KAIST 提出 EAPO:熵引导信用分配,强化意外成功、惩罚重复失败 — kaist-ai · 2026-09-29