Karpathy实测大模型长任务编码生成3D版魔戒
Andrej Karpathy 近期进行了一项大模型长任务执行与编码能力的极限测试。他向模型提供《魔戒》的开篇文本以及约 100 万 token(折合约 10 美元)的预算,要求其使用 Three.js 将文本内容渲染为 3D 场景。模型最终耗时约 2 小时自主编写了 5500 行代码,生成了一个可交互的粗糙 3D 游戏。该实验表明大模型在复杂空间理解与生成方面具备惊人潜力,但也暴露了当前的技术瓶颈。
已确认
- 测试条件:模型获得《魔戒》首段文本与约 100 万 token(约 10 美元)的执行预算。
- 执行结果:模型连续自主工作近 2 小时,写出了 5500 行 Three.js 代码。
- 生成效果:成功将文本渲染为可交互的 3D 场景,展现出惊艳的空间生成能力。
尚未确认
- 模型版本号:由于各信息源转述存在差异,部分提及使用的是 Claude 3 Opus,另有信源称为 Opus 5,具体测试所用的确切模型版本尚存争议。
为什么重要
- 评测方式演进:Karpathy 指出,业界正在超越过去“生成一个骑自行车的鹈鹕 SVG”这类简单的静态测试,开始探索模型在长耗时、高 token 消耗下的自主任务执行能力。
- 暴露核心短板:实验揭示了 LLM 当前的一个关键瓶颈,即模型在生成代码后缺乏视觉反馈机制,导致其无法进行有效的自我验证与纠错。
2026-08-02 ~ 2026-08-03 · 5 条相关
一手来源
- Karpathy实测Opus生成3D世界:LLM空间能力惊艳,但缺视觉短板明显 — AI寒武纪 ·
- Karpathy用Opus 5生成3D版指环王,揭示LLM无法自我验证瓶颈 — 新智元 ·
- Karpathy实测 Claude Opus:2小时写5500行代码渲染3D版魔戒 — andrewchen · 2026-08-02
- Karpathy实测Opus:2小时写5500行Three.js渲染魔戒 — TAbrodi · 2026-08-02
- 【源头】Karpathy实测Opus生成3D世界:LLM空间能力惊艳,但缺视觉短板明显 — AI寒武纪 · 2026-08-02
- 【源头】Karpathy用Opus 5生成3D版指环王,揭示LLM无法自我验证瓶颈 — 新智元 · 2026-08-03
另有 1 条近重复转述:TAbrodi