用GRPO教9B小模型写Blender代码造低多边形房间,踩坑全记录

TheMoonMidas · x · 2026-09-08

开发者用 Hugging Face OpenEnv 搭建 Blender RL 环境训练小模型,让策略模型接收房间 prompt 后通过工具调用写 bpy 代码,从空白几何体搭建完整低多边形等距房间(地板、墙、家具、材质)。

实验配置:策略模型为 Qwen3.5-9B,覆盖工作室/卧室/厨房/客厅四类房间;训练集为 256 条确定性生成 prompt,评估集 64 条;裁判用 GLM-5.3-Flash(经 HF Inference Providers 调用);baseline 为每类房间 1 个 prompt × 4 个候选 × 16 次 rollout,之后计划跑 200 步 GRPO。

关键经验:

环境与数据已开源在 Hugging Face(merve/blender-grpo-gepa,含脚本与运行文档)。

所属事件:HF工程师用GRPO训练9B小模型写Blender代码搭3D房间(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →