班加罗尔学生单干训练 1B 世界模型:RTX 5090 实时跑、支持文字换景
lucidml_lover · reddit · 2026-10-07
一位来自班加罗尔的大四学生(部分休学、学生孵化器资助、独立开发)发布了其本地实时世界模型第二版:约 960M 参数的纯 Transformer,采用块因果掩码按 LLM 方式训练,并用 diffusion forcing 对每帧独立加噪。推理时每帧跑 2-5 步扩散,去噪后写入 KV cache,并用滑动窗口只保留约 80 帧上下文。相比上一版 MMDiT(文字与帧 KV 在 softmax 里竞争、无法可靠跟随文字),新模型恢复文本交叉注意力并做了大量文本-视频预训练,可实时接收键盘动作(通过 adaLN 引导 WASD),并支持运行中切换提示词,如「在沙漠里加个池塘」「换成红色卫衣」「环境变冰原」。模型在 RTX 5090 上峰值 50-60 fps(作者主动限到 12fps,GPU 仅 30% 利用率),预计可兼容 30/40 系;在 M5 MacBook 上跑出 30fps(MLX 移植尚未完成)。训练用了 8x H100 SXM 约 3-4 周。作者承诺所有模型只面向本地推理,不做数据中心版,希望年底发布让人人可试。
「多模态」频道最新
- 论文:扩散 Transformer 生成早期即可读出大量图像信息 — kwangmoo_yi · 2026-10-07
- Claude Fable 生成克拉尼板音乐可视化:金砂随歌声起舞 — creatoroff · 2026-10-07
- Image Edit Arena 上线多图编辑榜:gpt-image-2.5 包揽前二 — arena · 2026-10-07
- 用低模 previz + 参考图生成完整赛车追逐成片的 Prompt 工作流 — Ror_Fly · 2026-10-07
- 腾讯混元图像3.0(80B)单卡跑通ComfyUI,12GB显存约30秒出图 — LatentSpacer · 2026-10-07
- 本地 Qwen 27B 复刻 Opus 代码渲染视频:离线产出 2 分钟讲解片 — yzjJosh · 2026-10-07