Training a 9B model with GRPO to build low-poly Blender rooms: lessons learned

TheMoonMidas · x · 2026-09-08

A hands-on RL experiment trains a small policy model to write Blender Python code, building complete low-poly isometric rooms from blank geometry via OpenEnv.

Setup: Qwen3.5-9B policy over studio/bedroom/kitchen/living-room prompts (256 train, 64 eval), judged by GLM-5.3-Flash through HF Inference Providers; baseline of 16 rollouts before a planned 200 GRPO steps.

Key lessons:

The environment, scripts, and run docs are open-sourced on Hugging Face (merve/blender-grpo-gepa).

Related event: HF engineers train a 9B model to build 3D rooms via Blender code(3 posts)→

Original post →

More from coding & agent

coding & agent channel →