Code4Scene: Benchmarking Coding Agents for Constructing and Editing 3D Scenes
Xiaokang Ye, Siddhant Hitesh Mantri, Zimeng Chen, Edward Zhang, Zhaoxu Zheng, Yuanheng Li, Yizhao Chen, Tianyang Huang, Lianhui Qin
cs.AI
2026-09-29
190 个 Unreal Engine 场景实测 14 个编码 agent 配置:构建与编辑强相关但不互换,最佳 Repair F1 仅 0.527,35.8% 的完全恢复编辑仍误改场景别处。
编码 agent 已经能写代码、跑代码,在 Unreal Engine 里把一个 3D 场景搭出来。问题是,场景「看起来对」和「真的对」是两回事:生成出来的场景是一份持久的、可执行的产物,一张有说服力的渲染图背后,可能藏着错误的空间关系、互相穿插的物体,或者 prompt 里根本没让动的改动。
现有评测习惯恰好漏掉这一点。常见做法是给生成代码或渲染视角打分,两者都绕开了引擎里真正的场景状态。Code4Scene 冲的就是这个空档:不看代码,不看渲染图,直接查引擎里的场景。
基准包含 190 个 Unreal Engine 案例,底子是人工搭建的场景,两个互补设定共用一套执行接口:
评分对象是引擎原生场景状态,查三件事:任务完成度(task fulfillment)、产物完整性(artifact integrity,资产引用与对象结构没坏)、静态物理合法性(摘要明确点名了物体穿插这类失败)。这个设计的分量在评测入口:代码写得像不像、图渲染得好不好都说明不了空间正确性,直接读引擎里的对象清单和变换才行。
14 个编码 agent 配置跑 95 例公开集,关键数字:
| 发现 | 数值 |
| 构建与编辑成绩的 Spearman 秩相关 | ρ = 0.78 |
| 编辑任务最佳 Repair F1 | 0.527 |
| 完全恢复目标却仍引入误改的编辑占比 | 35.8% |
| 公开集 / 总案例数 | 95 / 190 |
三个模型各占一头:Claude Fable 5.1 构建第一,Gemini 3.8 Flash 编辑第一,GPT-6 Astra 以微弱优势综合领先。Spatial Composition(空间组合)是所有 agent 共同最弱的构建类目,说明短板是共性的,不是某家模型的个体问题。
0.78 的秩相关说明两种能力高度相关但不能互相替代。编辑侧的天花板更能说明问题:最好的配置 Repair F1 也只有一半出头,超过三分之一的「改对了」的编辑同时在别处动了不该动的东西。摘要没有给出各模型绝对分数、计分公式和 14 个配置的构成,这些在正文里,本次未取到全文,待核。
对拿 agent 做 3D 内容生产的人,这是第一手能力地图。游戏关卡搭建、仿真环境生成、具身智能的训练数据生产都会撞上同一堵墙,现阶段结论很清楚:构建勉强能用,编辑还不能托付,选型时构建和编辑要分开挑,没有全能选手。
方法论上更值钱的是「评引擎原生状态」这个入口。任何用 LLM 生成 3D 内容的流水线都能抄:渲染质量评估补不上空间正确性这一课,直接查场景状态才行。
论文自己的结论就在泼冷水:可信的 3D 生成与可靠的空间推理、状态控制之间有实质差距。从摘要能看出的边界还有两条:物理合法性只查静态,不涉及动力学;场景靠人工搭建,规模和多样性受限于人力投入。
摘要没回答的问题同样要紧:编辑靠参考图传达目标,读图的失误和空间推理的失误有没有拆开归因;95 例之外留存的那一半案例上成绩是否一致;14 个配置上的秩相关只有 14 个样本点,「相关但不互换」这个结论有多稳要看正文分解。这些都需要全文确认。