Trace 为 11 类视觉推理构建可复现的 RLVR 环境
Md Tanvirul Alam · hf · 2026-07-23
Trace 是一个面向多领域视觉推理的taxonomy-guided 环境,目标是让可验证强化学习(RLVR)也能稳定用于视觉语言模型。
- 它把任务拆成两部分:scene grammar 和 可执行任务程序,从而把“视觉呈现”和“答案计算”分离开。
- 通过共享的语义状态,系统可以同时生成图像、提示词、类型化答案、验证器状态以及可回放的实例轨迹,保证任务可精确验证、可复现。
- 这个环境包含 1,000 个任务、277 种 scene grammars、11 个视觉领域,并控制语义与视觉变化。
- 在 64,000 个 Trace 实例上做 RLVR 后,Qwen2.5-VL-3B 和 Qwen2.5-VL-7B 在 24 个外部基准上的 macro-average 分别提升 3.51 和 4.06 个百分点。
项目页:https://maveryn.github.io/trace/
「研究」频道最新
- 牛津研究称 AI 写作工具会悄然影响公众意见 — SandraWachter5 · 2026-07-23
- 可学习新颖性让多项强化学习任务更快收敛、回报更高 — menhguin · 2026-07-23
- USC 基准显示 GPT-5.5 主动视觉观察仅得 10.6% — UniversityofSouthernCalifornia · 2026-07-23
- RECAP 让探针核验可解释性,重构分数不再能作假 — Hiskias Dingeto · 2026-07-23
- 论文提出用 Gated DeltaNet 线性化 Softmax Attention — bronzeagepapi · 2026-07-23
- 突破 RGB 仿真瓶颈:高斯泼溅实现机器人零样本迁移 — ZeYanjie · 2026-07-23