班加罗尔学生单干训练 1B 世界模型:RTX 5090 实时跑、支持文字换景

lucidml_lover · reddit · 2026-10-07

一位来自班加罗尔的大四学生(部分休学、学生孵化器资助、独立开发)发布了其本地实时世界模型第二版:约 960M 参数的纯 Transformer,采用块因果掩码按 LLM 方式训练,并用 diffusion forcing 对每帧独立加噪。推理时每帧跑 2-5 步扩散,去噪后写入 KV cache,并用滑动窗口只保留约 80 帧上下文。相比上一版 MMDiT(文字与帧 KV 在 softmax 里竞争、无法可靠跟随文字),新模型恢复文本交叉注意力并做了大量文本-视频预训练,可实时接收键盘动作(通过 adaLN 引导 WASD),并支持运行中切换提示词,如「在沙漠里加个池塘」「换成红色卫衣」「环境变冰原」。模型在 RTX 5090 上峰值 50-60 fps(作者主动限到 12fps,GPU 仅 30% 利用率),预计可兼容 30/40 系;在 M5 MacBook 上跑出 30fps(MLX 移植尚未完成)。训练用了 8x H100 SXM 约 3-4 周。作者承诺所有模型只面向本地推理,不做数据中心版,希望年底发布让人人可试。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →