Trajectory Labs 呼吁重构强化学习:按 token 奖励做后训练
brianryhuang · x · 2026-08-18
Trajectory Labs 提出「是时候重新思考强化学习(RL)了」:要把真实世界的使用转化为模型能力的持续提升,需要针对不可验证、按 token 计算的奖励重新设计后训练算法。他们将在 aiDotEngineer 的 World Fair 活动上分享扩展 SDPO 等算法用于持续学习(continual learning)的洞察。
「研究」频道最新
- 新基准 Connections Eval 榜单:Grok 暂居首 — aronchick · 2026-08-18
- 医学 AI 要理由而非答案:RadAgent 作者谈工具型 agent 与医疗推理 — Michael_D_Moor · 2026-08-18
- Latent Spacecraft 项目:GAN 潜空间与人脑语言机制的深层类比 — begusgasper · 2026-08-18
- 编排器+子代理自动做研究,拿下 GPU_MODE 大赛第三名 — _arohan_ · 2026-08-18
- 图因果最优传输与 Wasserstein 距离 — chaumian · 2026-08-18
- 业界批评:模型评测正在沦为「质量洗白」工具 — cocktailpeanut · 2026-08-18