4DCodeBench 评测编程 Agent 用代码重建动态 3D 场景的能力
CSProfKGD · x · 2026-10-06
斯坦福、JHU 等机构研究者(作者含 Jiajun Wu、Joshua Tenenbaum、Alan Yuille 等)推出 4DCodeBench,考察一个核心问题:编程 Agent 看完一段物理事件的视频后,能否从零写出图形程序,重建场景的 3D 几何、随时间变化的运动,并渲染回视频。
- 规模:200 个任务(100 个真实视频 + 100 个模拟视频),对 18 个 Agent 排名。
- 评测维度:外观、几何、运动三大方面,总分为五个指标族的平均值;用 VLM-as-judge 做两两偏好,聚合成 Elo 分。
- 排行榜:GPT-6 Astra [Max] 领先,Claude Opus 5.5 [High] 紧随其后;开源模型总体落后于闭源模型。
- 算力发现:跨模型看,更多 token 消耗并不一致地带来更高 Elo;但在 GPT-6 Astra 内部,提高推理努力确实能以更多 token 为代价提升重建质量。
所属事件:4DCodeBench 发布:GPT-6 Astra 领跑动态 3D 重建基准(4 条相关)→
「编程与Agent」频道最新
- TanStack 推出 MCP Server,AI 助手可检索文档并脚手架新项目 — modelcontextprotocol · 2026-10-06
- SnapRender 发布 MCP,让 AI 助手直接抓取任意网页截图 — modelcontextprotocol · 2026-10-06
- SFT再RL仍会死循环:29%跑满轮次上限,on-policy数据才是关键 — VikParuchuri · 2026-10-06
- 纯 RL 后训练消灭智能体工具调用死循环:SFT 循环率 92% 降至 0 — VikParuchuri · 2026-10-06
- Datalab 实测:纯 RL 训练让 Agent 零死循环,SFT 循环率高达 92% — VikParuchuri · 2026-10-06
- 编码 agent 让研究范围失控,学者警惕"研究垃圾"副作用 — rishabh16_ · 2026-10-06