用GRPO教9B小模型写Blender代码造低多边形房间,踩坑全记录
TheMoonMidas · x · 2026-09-08
开发者用 Hugging Face OpenEnv 搭建 Blender RL 环境训练小模型,让策略模型接收房间 prompt 后通过工具调用写 bpy 代码,从空白几何体搭建完整低多边形等距房间(地板、墙、家具、材质)。
实验配置:策略模型为 Qwen3.5-9B,覆盖工作室/卧室/厨房/客厅四类房间;训练集为 256 条确定性生成 prompt,评估集 64 条;裁判用 GLM-5.3-Flash(经 HF Inference Providers 调用);baseline 为每类房间 1 个 prompt × 4 个候选 × 16 次 rollout,之后计划跑 200 步 GRPO。
关键经验:
- 几何合法性要对齐确定性奖励 + VLM-as-a-judge;
- 先试 GEPA 加各种奖励,模型只能学会做出合法房间,仅此而已;
- 几何过关后让模型加细节非常难;
- 奖励函数越严格优势越稀薄(任务太难),GRPO 帮不上;
- 给策略和裁判都传图像引导也没用;「flowers can be abstract, a house can't」。
环境与数据已开源在 Hugging Face(merve/blender-grpo-gepa,含脚本与运行文档)。
所属事件:HF工程师用GRPO训练9B小模型写Blender代码搭3D房间(3 条相关)→
「编程与Agent」频道最新
- 斯坦福免费上线「自我改进 AI 智能体」完整课程 — Saboo_Shubham_ · 2026-09-08
- Claude 做出黏土风 3D 儿童探索游戏,代码与做法全开源 — dotey · 2026-09-08
- Stanford 免费开放「自我改进 AI Agent」完整课程 — Saboo_Shubham_ · 2026-09-08
- Steve Yegge 晒多智能体协作实录:Fable 5.1 重写 30% 代码救场 — Steve_Yegge · 2026-09-08
- Steve Yegge:Fable 5 过后工厂翻车,5.1 烧掉 30% 重写才变快 — Steve_Yegge · 2026-09-08
- 开源 Kwipu:把 Markdown 笔记变成本地 Graph RAG 知识图谱 — tom_doerr · 2026-09-08