Karpathy实测Opus生成3D世界:LLM空间能力惊艳,但缺视觉短板明显

AI寒武纪 · wechat · 2026-08-02

Andrej Karpathy 近期测试了模型的空间理解与生成能力。他给模型约 100 万 token 上下文(折合花费约 10 美元),让其用 Three.js 将《魔戒》开篇渲染成 3D 场景。模型耗时近两小时写出 5500 行代码,成功在三维坐标中调度资产并生成动画。

Karpathy 认为,尽管成品略显粗糙,但 AI 凭借“无限的耐心”,将许多原本因成本高而“没人愿做”的定制化任务变成了“为什么不做”。他设想未来甚至能按需生成高度定制化的世界,让玩家以 NPC 身份进入小说剧情。

然而,实验也暴露了当前大模型的明显短板:模型无法高效感知视频或在生成的场景中“试玩”,只能靠极其缓慢的节点截图来验证结果,导致最终存在瑕疵。多模态感知与交互能力的缺失依然是 LLM 的痛点。

文章作者也进行了类似测试,对比了 DeepSeek 与 Kimi 的 3D 模拟生成能力。结果显示 DeepSeek 生成速度极快且基础逻辑扎实,但因缺乏原生的视觉反馈能力,无法在生成过程中自我纠错,导致最终效果逊于具备视觉能力的模型。作者指出,若 DeepSeek 补齐视觉能力,将极具竞争力。

所属事件:Karpathy实测大模型:2小时烧10美元写5500行代码渲染3D魔戒(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →