Iris-3B 开源:不用 VAE 的像素空间文生图模型,3B 参数 Apache 2.0

zhenjun_zhao · x · 2026-10-09

Sperid Labs 发布 Iris-3B:一个直接在像素空间生成每个像素的文生图模型与通用视觉学习器,无需 VAE。模型从零开始预训练,参数量 3B,权重开放(Apache 2.0)。

团队还探索了其生成先验在对细节敏感的视觉任务上的应用,包括深度估计和图像修复。代码、权重与 demo 全部开源。

所属事件:Sperid Labs 开源 Iris-3B:像素空间文生图实证不优于潜在空间(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →