Hugging Face 工程师公开 Blender+GRPO 训练 rollouts,调试 VLM 裁判踩坑

mervenoyann · x · 2026-09-06

HF 工程师 Merve 分享其 Blender 3D 场景 GRPO 强化学习实验的中间问题:VLM 裁判的结构化响应(structured responses)存在异常;此外喂给裁判的倾斜视角图片过曝且分辨率偏低,她决定下次运行前先自行修复图像质量,而不是交给 agent 处理。完整的 rollouts 数据(含 reward、judge 截图、trace、scene 文件等 646 个文件)已公开在 Hugging Face bucket 上,可复现查看。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →