kalomaze:fable 5 部分问题出在后训练没做熟

kalomaze · x · 2026-09-11

开源 RL 研究者 kalomaze 在讨论中表示,「fable 5」(社区对某前沿模型的代号)的部分问题只是后训练(ppo RL)做得不够熟。结合上下文,他引用 repligate 的观察:在 RL 过程大致恒定时,能力更强的模型受到的损伤相对更小——如果能直接一次解出问题,就不需要「琢磨评分器」,从而减少 reward hacking 式的扭曲。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →