Hugging Face 工程师公开 Blender+GRPO 训练 rollouts,调试 VLM 裁判踩坑
mervenoyann · x · 2026-09-06
HF 工程师 Merve 分享其 Blender 3D 场景 GRPO 强化学习实验的中间问题:VLM 裁判的结构化响应(structured responses)存在异常;此外喂给裁判的倾斜视角图片过曝且分辨率偏低,她决定下次运行前先自行修复图像质量,而不是交给 agent 处理。完整的 rollouts 数据(含 reward、judge 截图、trace、scene 文件等 646 个文件)已公开在 Hugging Face bucket 上,可复现查看。
「研究」频道最新
- 1958 年感知机被双向误读:NYT 吹捧意识机器,11 年后被打入冷宫 — techNmak · 2026-09-06
- dair-ai 本周 AI 论文榜:Declarative Attention 居首 — dair_ai · 2026-09-06
- 长文反驳功能主义:仅保留模式并不能免费换来意识 — pwlot · 2026-09-06
- 意识争论:数字模拟无法实例化因果属性,丘奇-图灵论题救不了 — pwlot · 2026-09-06
- OpenAI 首次公开模型加速内部研究的数据,呼吁行业透明 — kliu128 · 2026-09-06
- 经济学者提议用 AI 改革同行评审:编辑部先出 AI 报告再送人工 — _akpiper · 2026-09-06