RLHF 训练下 Temperature=1.0 优于经验值

jessi_cata · x · 2026-08-17

讨论指出,'temperature < 1.0' 是过去依赖群体智慧的经验性启发,但现在的强化学习(RL)已超越该策略,且在 temperature=1.0 下效果更好。核心观点在于,temperature 1.0 才是对应于训练过程中 next token prediction 优化的真实条件分布;任何低于 1.0 的设置大多是对已学习决策空间的启发式压缩。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →