3DHarnessBench:前沿 VLM 的 agentic 3D 转代码能力参差不齐
ftm_guney · x · 2026-09-09
巴黎理工等机构发布 3DHarnessBench,评测前沿视觉语言模型的 agentic 3D-to-code 重建能力——从多种输入恢复 3D 几何并输出 Blender Python 代码。基准设四级 harness:S1 单视图、S2 多视图、S3 主动视觉(任意视角访问)、S4 完整 3D 交互(借助 Blender MCP 进行函数调用、主动探索与自我修正)。
- 核心发现:所有前沿模型的几何恢复能力都随函数调用权限增加而显著提升,但提升幅度高度依赖具体模型,显示 agentic 3D-to-code 能力极不均衡
- 基准将连同代码、输出与 agent 轨迹一并开源,保证可复现
- 附带结果画廊,可切换对比 7 个 agent 在 4 种设置下对同一目标的重建效果
「编程与Agent」频道最新
- 树莓派 60 秒装好 agentgateway,实时查看 OpenAI 日志与 token 花费 — bibryam · 2026-09-09
- 豆包、千问国内外分头卷办公与个人助理,长期记忆或成胜负手 — sujingshen · 2026-09-09
- 开源新语言 With:经 LLVM 编译的系统级编程语言 — QuixiAI · 2026-09-09
- NVIDIA 官宣 CUDA Rust:用 Rust 写 GPU 内核的两条路线 — ducha_aiki · 2026-09-09
- AI 智能体 Astra 自建存档、远程配流并在 3D 游戏中实时试玩 — IridiumEagle · 2026-09-09
- pstack 0.15.0 发布:省 3-11% token 并新增两条 agent 原则 — RachelVT42 · 2026-09-09