开源实践:把 Qwen3-VL-4B 训成自回归图像生成器
ostrisai · x · 2026-10-01
ostrisai 分享了一个进行中的实验:用 Nvidia 的 Cosmos-0.1-Tokenizer-DI16x16 作为图像 tokenizer,将 Qwen3-VL-4B-Instruct 训练成自回归(AR)图像生成器。目前 256 分辨率下已能用默认 AI Toolkit 提示词出图,作者展示了当前训练状态的效果图,表明方向可行但仍处早期阶段。
「多模态」频道最新
- 用 Nano Banana Pro + h3 做短片的工作流分享,求 LTX 2.5 对应方案 — No_Reference_7678 · 2026-10-01
- Ideogram 4.5 曝光,图像生成赛道再迎新版本 — aziz4ai · 2026-10-01
- MiniMax-H3 被低估:在 ComfyUI 里当图像生成器意外好用 — solomars3 · 2026-10-01
- LEAP 分块检索证据,让小时级音视频问答性能提升最高 16.8% — Juyi Lin · 2026-10-01
- Mac 端 AI 视频剪辑工具 Video Genie 开放早期体验:自然语言直接出成片 — realmeetjames · 2026-10-01
- 谁说高斯泼溅不能做动画?PlayCanvas 放出小恐龙演示 — willeastcott · 2026-10-01