卡帕西推「指环王」新基准:Opus 5耗百万Token搓3D世界
量子位 · wechat · 2026-08-03
随着大模型能力提升,曾经风靡的“鹈鹕骑自行车”SVG测试已逐渐摸到天花板。AI 大神卡帕西近日提出了一套更严苛的“指环王”基准,以测试模型的长程规划与空间理解能力。
新测试要求模型读取《指环王》小说开头,并使用 Three.js 代码构建一个可实时运行的 3D 世界。Claude Opus 5 在该任务中耗时 2 小时、消耗 100 万 Token 并生成 5500 行代码,最终搭建出粗糙但具备空间结构的场景。卡帕西指出,这暴露了当前模型“能写代码搭场景,却无法真正‘看懂’视频或亲自体验游戏”的短板。
该测试引发了社区的广泛跟进与探讨:
- 工作流畅想:卡帕西认为,未来可用程序化代码控制分镜骨架,再结合视频生成模型(如 Seedance)和音频 API 补足高保真细节。
- 硬核玩家实测:有网友用 Agent 搭建低多边形风格的旧金山,有人构建接入实时数据的纽约 3D 模型,甚至有人用纯代码为自己生成了一场专属的 Kanye West 演唱会。
- 基准有效性争议:部分人质疑这只是在测试 Three.js 代码能力且算力消耗过大;但支持者认为,将抽象文本转化为 3D 动画,需要模型同时处理空间、物理与数学推理,这或许证明了大语言模型的通用推理能力正自然延伸至三维领域。
所属事件:Karpathy实测大模型:2小时烧10美元写5500行代码渲染3D魔戒(6 条相关)→
「编程与Agent」频道最新
- Mysti:在VS Code中编排12个AI编码智能体协作 — tom_doerr · 2026-08-03
- AI 自动化 PCB 走线:省时是假,优化 Token 消耗是真 — MarvinTBaumann · 2026-08-03
- 巧妙提取 AI 思维链:让模型主动提出系统级优化建议 — burny_tech · 2026-08-03
- MIT等提出LILO框架:让大模型自动重构代码并生成可读文档 — burny_tech · 2026-08-03
- 提示词架构即文学:为大模型上下文设计的可执行文本 — lnsip9reg · 2026-08-03
- 用Claude构建Devin克隆:5款Agent沙箱横评 — 23kunal · 2026-08-03