研究团队为视频模型构建百个验证器开启可验证 RL 时代
DengHokin 团队提出为视频/视觉推理模型开启「验证时代」,认为视频模型仍处于 GPT-3 阶段,仅靠堆砌海量视频数据难以进步。团队投入 50 位科学家、耗时 6 个月,构建了 100 个规则型验证器,每个验证器可生成 1 万多个多样样本,并配套 300 项任务,为视频模型打造可验证的强化学习训练配方。
2026-09-09 ~ 2026-09-09 · 2 条相关
- 100 个规则验证器加 300 项任务,团队为视频模型打造可验证 RL 训练配方 — DanielKhashabi · 2026-09-09
- 为视频模型建 100 个规则验证器,开启视觉「可验证时代」 — DanielKhashabi · 2026-09-09