Trajectory Labs 呼吁重构强化学习:按 token 奖励做后训练

brianryhuang · x · 2026-08-18

Trajectory Labs 提出「是时候重新思考强化学习(RL)了」:要把真实世界的使用转化为模型能力的持续提升,需要针对不可验证、按 token 计算的奖励重新设计后训练算法。他们将在 aiDotEngineer 的 World Fair 活动上分享扩展 SDPO 等算法用于持续学习(continual learning)的洞察。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →