img2threejs 爆火解析:一张照片靠 LLM 写代码生成可编辑 3D 模型
maier_ak · x · 2026-09-04
2026 年夏天走红、数周拿下 1.3 万 star 的 img2threejs 并非传统 image-to-3D 深度学习方案,而是一套纯代码流水线:
- 原理:不训练网络预测几何,而是让多模态编程模型(Claude Code / Codex / OpenCode)读图后输出 JSON 规格与 TypeScript 代码,在浏览器中渲染,再与原图并排对比迭代修正,直到看起来一致。
- 成本:每个物体仅消耗 8 万–18 万模型 token,远低于完整的 image-to-mesh 流水线;产出是人类可读代码,可 diff、可版本管理、可直接做动画。
- 本质:整个系统是模型 skill 目录里的一个 skill,Python 脚本只用标准库,不处理像素,只打包对比截图;真正的 backbone 是宿主编程模型。
- 局限:作者不做定量宣称,保真度完全依赖语言模型的先验知识;在模型熟悉的硬表面物体(武器皮肤、卡通道具)上表现好,有机形态则会失败,更换宿主模型输出的代码也会不同。
「编程与Agent」频道最新
- OpenAI 发布 GPT-6 Astra:电脑上能做的事它都能替你做 — astralmatrix · 2026-09-04
- Reddit 讨论:你真的在日常依赖哪些 AI 写的应用? — LocustKitten · 2026-09-04
- Chromium 老兵驳「内联样式慢」论:共享样式表才是性能关键 — mohamedmansour · 2026-09-04
- 拆解 Ollama 代码:一个 LlamaServer 接口如何驯服 LLM 服务复杂度 — Mahmoud_Zalt · 2026-09-04
- Codex 上下文压缩思路获验证:不做破坏性摘要+让模型检索旧上下文 — lateinteraction · 2026-09-04
- Grok Bot 实用技巧:把电脑变主机,手机远程指挥它干活 — dean_rie · 2026-09-04