LuxoBench:用「把渲染图造出来」考核 AI 硬件工程能力
vincent_koc · x · 2026-09-12
Kyle(@pronouncedkyle)正在为 AI 模型打造一个硬件工程基准 LuxoBench(以皮克斯台灯命名)。
- 初版方案是让模型设计「交互式台灯」,结果模型给出的只是零件清单和过于简单的拼装说明,难以衡量真实工程能力
- 新方法改为:给出一个较复杂设备的渲染图,要求每个模型输出可落地、可制造的完整方案——包含电子元件、软件与机械结构,以此评判
- 评判维度拟包括成本、交期、搭建难度与成品是否真的能工作
- 作者公开征集合作者,并愿意分享零件清单与拼装说明,欢迎他人复现
「编程与Agent」频道最新
- 公司 Code Review 变成 AI 互审闭环,人只负责复制粘贴 — dotey · 2026-09-12
- 宝玉回击「程序员无用论」:工程能力仍是 AI 时代的元能力 — dotey · 2026-09-12
- Notion MCP 一天狂开 50 个认证标签页,直接把用户 Mac 搞崩 — menhguin · 2026-09-12
- Matt Pocock 的 skills 仓库星数已超过 React 本人仓库 — mattpocockuk · 2026-09-12
- Codex 写出比人更快的代码:G-buffer 从 24 字节/像素优化到 16 字节 — ducha_aiki · 2026-09-12
- 为什么纯文本完胜专有格式:AI Agent 只能操作纯文件 — dSebastien · 2026-09-12