100 个规则验证器加 300 项任务,团队为视频模型打造可验证 RL 训练配方
DanielKhashabi · x · 2026-09-09
DengHokin 团队提出给视频模型开启「验证时代」(Verification Age),认为视频模型仍处于 GPT-3 阶段——只靠堆百万小时视频数据,而编码模型靠代码/Lean 验证器的合成 RL 环境已获得超人类数学与编程能力。其做法:
- 构建 100 个基于规则的验证器,每个配套合成数据生成器,可在任务域内产出 1 万+ 多样样本
- 另做 300 个任务生成器(含 Snake、Gold Miner、Mario 等经典游戏),扩展训练数据分布,百万级渲染样本已发布在 HuggingFace
- 通过约 60 组实验摸索出对视频模态有效的 RL 训练配方
项目由 50 名科学家历时 6 个月完成,主张规则式可验证奖励是把 RL 范式从代码迁移到视频的关键路径。
「多模态」频道最新
- HeyGen 对比同一人两个 AI 数字人:一个像,一个诡异谷 — HeyGen · 2026-09-09
- 64x64 小模型 + 200 万参数,在 2012 年 CPU 上实时跑 pix2pix — NoenD_i0 · 2026-09-09
- Weaviate 教程:不动原文件,把混乱创意素材库变成语义可搜索库 — philipvollet · 2026-09-09
- 斯坦福 BulletTime:视频生成应把帧序号与世界时间分离 — GordonWetzstein · 2026-09-09
- MiniMax 视频模型文字渲染时好时坏,用户求稳定出字方案 — bluetimejt · 2026-09-09
- RTX 5060 Ti 本地 TTS 做完整本有声书,Higgs Audio 成作者最爱 — HoodWinked69 · 2026-09-09