HF 工程师用 GRPO+GEPA 训练 Qwen3.5-9B 写 Blender 代码生成 3D 房间
mervenoyann · x · 2026-09-07
Hugging Face 工程师 Merve Noyann 公开了一个基于 TRL 和 OpenEnv 的实验项目:训练 Qwen3.5-9B 通过工具调用编写 bpy 代码,从空白 Blender 几何体生成完整的低多边形等距房间场景,并用 GLM-5.3-Flash 作为评委模型打分。
关键细节:
- 训练数据为 256 条确定性生成的房间提示词(工作室、卧室、厨房、客厅四类),评估集 64 条
- 模型可用工具包括 executepython、inspectscene、renderscene 和 finish,渲染只返回文本元数据给策略模型
- 流程分两阶段:先跑 GEPA 优化奖励函数(初期完全渲染不出来,现在能渲染但语义质量不佳),再计划做 200 步 GRPO 训练
- 首个 HF Job 仅做评估,不修改基座模型
项目已在 Hugging Face Bucket(merve/blender-grpo-gepa)开源,包含脚本、Dockerfile 和文档,rollouts 过程可在线观看。
所属事件:HF 工程师用 GRPO 与 GEPA 训练 Qwen3.5 生成 Blender 3D 场景(2 条相关)→
「编程与Agent」频道最新
- Codex 实验功能上线:可跨上下文窗口记笔记并检索历史消息 — reach_vb · 2026-09-07
- mitsuhiko 的「slop 工厂」自行决定实现花括号与词法作用域 — mitsuhiko · 2026-09-07
- 百仓开源作者承诺:AI agent 提交的 issue 也当日分诊 — doodlestein · 2026-09-07
- Vibe coding 的残酷真相:修一个 bug 冒出三个,旧的还会回来 — ayushtweetshere · 2026-09-07
- AI 编程翻车名场面:让模型改 CSS 却被建议 rm -rf node_modules — ThePeterMick · 2026-09-07
- AI 蜂群烧钱惊人:METR 一次调查耗 40 万美元 API 额度 — natesiggard · 2026-09-07