摩根士丹利提出并行回火采样 PPT,推理期替代 RL 后训练追平前沿模型
morganstanley · hf · 2026-10-02
Morgan Stanley 团队提出 Parallel Power Tempering(PPT),一种无需参数更新与外部奖励的推理期采样方法,作为 RL 后训练的替代来增强 LLM 推理能力。
- 原理:power-sharpened 采样放大基础模型下的高概率序列,但面临探索-利用权衡:强锐化会把采样困在貌似正确的错误推理轨迹,弱锐化则分布过于发散。
- 方法:并行运行多个处于不同锐化强度的交互副本,低强度副本负责探索多样推理路径,高强度链进一步利用高似然回答;同时修正了以往 power 采样器的截断偏差,并研究有限显存/算力预算下的交换策略。
- 结论:PPT 显著优于单链 power 采样,超过 RL 后训练模型,产出更高质量推理轨迹,甚至达到可比肩前沿模型的性能。
「模型」频道最新
- 把江户参勤交代动画交给 Claude 改造,设计效果惊艳 — tkasasagi · 2026-10-02
- 马斯克转评:AI 已在会计测试中碾压人类,18 个月前还不及格 — elonmusk · 2026-10-02
- Mirostat 还有人用吗?新一代模型是否已不需要采样控制 — ParvusNumero · 2026-10-02
- 本地实测:9B 微调模型延迟降至 1/4,RTX 5070 跑分惊艳 — Storge2 · 2026-10-02
- Bindu Reddy 预告 Fable 5.5 最早下周发布,称将是最强可用模型 — bindureddy · 2026-10-02
- 开源本地模型「够用论」:日常任务不需要前沿智商 — Dan_Jeffries1 · 2026-10-02