专题 · FULL STORY
Karpathy实测Claude Opus生成3D电影
Andrej Karpathy近期发起了一项极限编程测试,以《指环王》开篇文本为提示,消耗约10美元算力,实测Claude Opus模型的长任务3D生成能力。
2026-08-02 ~ 2026-08-05 · 2 集 · 9 条
第 1 集 · Karpathy用《指环王》测模型3D生成(2026-08-02,7 条)
多条帖子转述称,Andrej Karpathy 做了一次可视为“指环王”基准的长任务测试:给模型《指环王》开篇文本、约 100 万 token(约 10 美元)预算,并要求它用 Three.js 渲染成 3D 场景。按这些转述,模型自主工作约 2 小时,写出约 5500 行代码,最终生成了一个可交互但较粗糙的 3D 场景/游戏。这个案例之所以受关注,在于它同时展示了模型的长程规划与空间生成潜力,也暴露出其难以自我验证视觉结果的短板。
已确认
- TAbrodi、机器之心、AI寒武纪等帖文对测试条件的描述基本一致:输入是《指环王》首段文本,预算约 100 万 token,任务是用 Three.js 完成 3D 渲染。
- 多条转述都提到,模型连续自主执行约 2 小时,产出约 5500 行 Three.js 代码。
- 机器之心与新智元称,最终结果是一个可交互但仍较粗糙的 3D 场景或游戏化演示。
尚未确认
- 具体模型版本在帖文间存在差异。TAbrodi 与 AI寒武纪写作 Claude 3 Opus,量子位和新智元则写作 Opus 5。仅据当前材料,无法确认准确版本号。
为什么重要
- andrewchen 转述 Karpathy 的看法称,这类实验说明模型评测正在从“生成一个骑自行车的鹈鹕 SVG”这类静态小任务,转向更强调长时执行与自主完成度的测试。
- AI寒武纪与新智元都强调,这次实验揭示的关键瓶颈不是“能不能写代码”,而是模型缺少稳定的视觉反馈与自检能力,因此难以可靠地发现并修正自己生成结果中的问题。
- Karpathy实测 Claude Opus:2小时写5500行代码渲染3D版魔戒 — andrewchen · 2026-08-02
- Karpathy实测Opus:2小时写5500行Three.js渲染魔戒 — TAbrodi · 2026-08-02
- Karpathy实测Opus生成3D世界:LLM空间能力惊艳,但缺视觉短板明显 — AI寒武纪 · 2026-08-02
- Karpathy 实测 Claude 3 Opus:2小时烧10美元写出5500行3D渲染代码 — TAbrodi · 2026-08-02
- Karpathy用Opus 5生成3D版指环王,揭示LLM无法自我验证瓶颈 — 新智元 · 2026-08-03
- 卡帕西推「指环王」新基准:Opus 5耗百万Token搓3D世界 — 量子位 · 2026-08-03
- Karpathy 测试 Opus 生成 3D 世界:10 美元写出 5500 行代码 — 机器之心 · 2026-08-03
第 2 集 · Karpathy 实测 Claude Opus 生成 3D 电影(2026-08-04,2 条)
前特斯拉 AI 总监 Andrej Karpathy 近期对 Claude Opus 进行了一项极限编程测试。他以《指环王》开篇文本为提示,并给予大模型约 100 万 token(10 美元)的预算。在短短 2 小时内,Claude Opus 成功生成了 5500 行 Three.js 代码,并顺利渲染出复杂的 3D 场景与电影世界,充分展现了当前大模型在自动化编程与创意生成方面的巨大潜力。
- Karpathy实测Claude Opus:2小时写5500行代码生成3D电影 — iamrobotbear · 2026-08-04
- Karpathy 实测 Claude Opus:2小时写5500行代码渲染3D世界 — jon_barron · 2026-08-05