单卡 RTX 6000 Pro 训 24 小时:AR+扩散混合图像模型进展曝光

ostrisai · x · 2026-09-20

AI Toolkit 作者 ostrisai 继续其周末实验:用 Qwen3-VL-4B 作自回归 LLM、冻结的 BFL Klein 4B 作扩散解码器构建 AR/扩散混合图像模型。最新进展显示 DiT 从 code 重建图像的能力是准确生成的前提,当前复现质量仍有差距,理想状态是两者完全一致。

所属事件:AI Toolkit 作者单卡24小时训出AR+扩散混合图像模型(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →