摩根士丹利提出并行回火采样 PPT,推理期替代 RL 后训练追平前沿模型

morganstanley · hf · 2026-10-02

Morgan Stanley 团队提出 Parallel Power Tempering(PPT),一种无需参数更新与外部奖励的推理期采样方法,作为 RL 后训练的替代来增强 LLM 推理能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →