Baseten 训练负责人解读:RL 延长推理,但泛化依赖领域后训练

baseten · x · 2026-09-23

Baseten 模型训练负责人 Connor O'Neill 做客 Dwarkesh Patel 播客,讨论 RL 训练如何让模型学会更长时间工作,以及 horizon generalization(任务时长泛化)的机制。

核心观点:RL 能教会模型在更长时域上工作,但推理能力本身依赖于领域特定的 post-training,不同任务间并不能自动迁移。节目还谈到了前沿实验室在这一方向的下一步规划。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →