Karpathy实测Opus生成3D世界:LLM空间能力惊艳,但缺视觉短板明显
AI寒武纪 · wechat · 2026-08-02
Andrej Karpathy 近期测试了模型的空间理解与生成能力。他给模型约 100 万 token 上下文(折合花费约 10 美元),让其用 Three.js 将《魔戒》开篇渲染成 3D 场景。模型耗时近两小时写出 5500 行代码,成功在三维坐标中调度资产并生成动画。
Karpathy 认为,尽管成品略显粗糙,但 AI 凭借“无限的耐心”,将许多原本因成本高而“没人愿做”的定制化任务变成了“为什么不做”。他设想未来甚至能按需生成高度定制化的世界,让玩家以 NPC 身份进入小说剧情。
然而,实验也暴露了当前大模型的明显短板:模型无法高效感知视频或在生成的场景中“试玩”,只能靠极其缓慢的节点截图来验证结果,导致最终存在瑕疵。多模态感知与交互能力的缺失依然是 LLM 的痛点。
文章作者也进行了类似测试,对比了 DeepSeek 与 Kimi 的 3D 模拟生成能力。结果显示 DeepSeek 生成速度极快且基础逻辑扎实,但因缺乏原生的视觉反馈能力,无法在生成过程中自我纠错,导致最终效果逊于具备视觉能力的模型。作者指出,若 DeepSeek 补齐视觉能力,将极具竞争力。
所属事件:Karpathy实测大模型:2小时烧10美元写5500行代码渲染3D魔戒(6 条相关)→
「编程与Agent」频道最新
- Grok Build 更新:扩展 Bash 权限与 Auto 模式 — elonmusk · 2026-08-03
- 开源项目 OpenClaw-Termux:在 Android 上运行 AI 网关,一键部署 — tom_doerr · 2026-08-03
- 别给 Agent 乱加工具:用 Bitter Lesson 指导智能体设计 — willccbb · 2026-08-03
- AI编程体验比肩编译器革命:开发者将不再看源码 — jamesdouma · 2026-08-03
- 图存文本省 Token:开发者用 PNG 压缩 Fable 5 上下文成本 — rohanpaul_ai · 2026-08-03
- 让 Agent 在 VPS 上自主折腾几小时配置环境 — djcows · 2026-08-03