Yacine 怒斥「SAC 样本效率优于 PPO」言论

yacineMTB · x · 2026-10-04

X 热门 AI 账号 Yacine(前 Tesla Autopilot 研究者)转发一条称「上次查的时候 SAC 的样本效率远好于 PPO」的推文,直言这是他今天看到的最蠢的说法,「气得放下手机靠回椅背」。

这条推文引发强化学习圈的经典争论:PPO 作为 on-policy 算法在 RLHF/大模型后训练中占主导,而 SAC(off-policy)虽在传统控制任务上样本效率高,但观点被认为忽略了二者的适用场景差异。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →