Baseten 训练负责人解读:RL 延长推理,但泛化依赖领域后训练
baseten · x · 2026-09-23
Baseten 模型训练负责人 Connor O'Neill 做客 Dwarkesh Patel 播客,讨论 RL 训练如何让模型学会更长时间工作,以及 horizon generalization(任务时长泛化)的机制。
核心观点:RL 能教会模型在更长时域上工作,但推理能力本身依赖于领域特定的 post-training,不同任务间并不能自动迁移。节目还谈到了前沿实验室在这一方向的下一步规划。
「模型」频道最新
- 代码评测多是夹带私货的糊分数,开发者呼吁按领域细分 benchmark — almmaasoglu · 2026-09-23
- 信封上画草图,Grok 4.7 几分钟内做出可玩解谜游戏 Lightweave — luismbat · 2026-09-23
- Databricks 上线三款前沿模型,GPT-6 Sol/Luna 与 Opus 5.5 进 Unity Gateway — matei_zaharia · 2026-09-23
- Grok 4.7 跑分接近 Opus 5.5,价格仅 1/2 到 1/7 — elonmusk · 2026-09-23
- 用户实测称 Opus 5.5 在真实工作场景仍落后 — BLUECOW009 · 2026-09-23
- 内部人士初体验疑似 Opus 5.5:能力强但「不像 Opus 的感觉」 — repligate · 2026-09-23