普林斯顿发布 i1:首个完全可复现的开源文生图配方
jiqizhixin · x · 2026-08-28
普林斯顿大学 Zhuang Liu 团队发布 i1,一个 3B 参数、基于 flow matching 训练的 DiT 文生图模型,试图填补「强文生图模型要么闭源、要么只放权重」的空白——此前没有任何完全开源、可复现的训练配方。
核心贡献是消耗 70 万 TPU v6e 小时、覆盖 300+ 项受控实验的系统性消融,隔离出真正影响效果的因素:
- 更大的单个 text encoder adapter 优于多 encoder 组合,且成本更低
- dual-stream > single-stream > cross-attention
- U-ViT 跳跃连接稳定有效
- 长字幕训练出更强的模型,但会损害短提示效果
模型架构上采用冻结 text encoder 与浅融合的简单基线。i1 在 GenEval、DPG-Bench、PRISM-Bench、CVTG-2K 等基准上平均超越此前最佳全开源模型 29.5 个百分点。
「多模态」频道最新
- 接入 SillyTavern:MiniMax H3 让角色扮演秒变视频 — PrinceCaspian1 · 2026-08-28
- MiniMax H3 提示词技巧:如何打造手持镜头感 — Jimmm90 · 2026-08-28
- Google AI Studio 演示如何用 Gemini 模拟血月全食 — AI_Andrew · 2026-08-28
- 《如何穿越奇点》预告片:AI 猩猩与落魄主播的 IRL 影像 — VoidStateKate · 2026-08-28
- Minimax H3 变身测试视频展示多模态能力 — Lutha · 2026-08-28
- 阿里 Wan 3.0 登顶视频编辑竞技场,超 MiniMax 22 分 — arena · 2026-08-28