100 个规则验证器加 300 项任务,团队为视频模型打造可验证 RL 训练配方

DanielKhashabi · x · 2026-09-09

DengHokin 团队提出给视频模型开启「验证时代」(Verification Age),认为视频模型仍处于 GPT-3 阶段——只靠堆百万小时视频数据,而编码模型靠代码/Lean 验证器的合成 RL 环境已获得超人类数学与编程能力。其做法:

项目由 50 名科学家历时 6 个月完成,主张规则式可验证奖励是把 RL 范式从代码迁移到视频的关键路径。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →