12GB 显存单图转 Gaussian Splat 完整教程:5 步出 3D
akatash23 · reddit · 2026-09-24
作者在 12GB 显存上复现"单图→Gaussian Splat"的完整流程,并扩展了前人的方法:
- 图像编辑:主体贴墙等不适合 360° 环绕的图,先用 Qwen Image 2.1 换背景(如红毯棕榈树场景)
- 分辨率:输入图建议 1440×1920 等常见比例,中心高分辨率图后续可替换低清帧
- 视频生成:用 ComfyUI 的 Minimax H3 默认 FL2VA 工作流(首尾帧转视频),12GB 卡可跑 768×1024、20 步(约 35 分钟);8 步 lightning LoRA 更快但降质
- 不要视频超分:SeedVR 2.5 太慢,时间花在生成高质量视频更划算
- 视频提示词:"角色完全静止如雕像,摄像机匀速 360° 连续环绕,无动作/切镜/眨眼"
- 抽帧:ffmpeg -i video.mp4 frame%04d.png,删掉首尾大量重复帧后用高分辨率原图替换第一帧
- 相机位姿:COLMAP 用 SIMPLEPINHOLE 模型 + Exhaustive matching 重建,对焦距相当宽容
- 训练:用 Rust 写的 Brush 训练 splat(需把 frames/ 移进 model/ 目录)
- 质检:视频模型只保证观感不保证几何一致,背景颜色渗到主体或伪影不可接受就换 seed 重来
「多模态」频道最新
- ECCV 2026 论文:x0-prediction 破解 RAE 高维潜空间扩散难题 — serrjoa · 2026-09-24
- 开源视频克隆 Skill:参考片变可编辑工程,本地渲染保留素材复用 — oran_ge · 2026-09-24
- AI 视频「克隆」实测:3 分钟爆款宣发片可 oneshot 完整复刻改细节 — oran_ge · 2026-09-24
- BFL 视频模型与 MiniMax H3 Max 权重迟迟未开源,社区追问原因 — krigeta1 · 2026-09-24
- RecCAR 正则化弥合联合视频生成的跨模态注意力差距 — barilan · 2026-09-24
- ComfyUI Prompt Composer 更新:支持 RefMod 与 LoRA 的可视化提示词编排 — Francky_B · 2026-09-24