Karpathy 实验揭示:程序化生成的瓶颈在视觉反馈

MediumCulture6537 · reddit · 2026-08-07

Andrej Karpathy 近期分享了一项实验,他给 Opus 5 提供 100 万 Token 的预算,生成了 5500 行 Three.js 代码来程序化渲染《指环王》开场。他得出的结论是:虽然模型有能力编写超长代码,但最大的弱点是无法有效审计自身的视觉输出。

作者通过运行类似的 WebGL 生成实验验证了这一点。在 3D 场景生成中,初始代码通常充满模型悬空或几何穿插等视觉错误。为了修复这些问题,必须运行无头浏览器捕获截图,并将其传回视觉模型进行检查。

实验发现,编写数千行代码反而是容易的部分,真正的成本和延迟飙升来自于迭代的视觉反馈循环(往往需要 30 多次截图周期)。在模型能够原生感知视频帧之前,这种视觉验证循环仍将是最昂贵的步骤。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →