260M 参数逼近 SD 1.5:开源图像模型 Agate-001 采用 thinker-renderer 混合架构
incorporo · reddit · 2026-09-26
Logolabs 发布 Agate-001-preview:仅 260M 参数(含文本编码器)的图像生成模型,MIT 协议开放权重,号称达到接近 SD 1.5(总参数约 3 倍)的表现,处于同尺寸 Pareto 前沿。
架构要点:
- 采用「思考者-渲染器」两段式混合架构,绕开纯 DiT 或 FDCM 的局限:一个小型循环 transformer「thinker」读取 prompt 并规划 16×16 区域布局,交叉注意文本编码器(基于 Ettin-68M,冻结 10 epoch 后联合训练);FDCM 卷积渲染器负责将 latent thinking tokens 转为图像。
- 在 Flux-Reason-6M 上训练约 26 epoch,尚未收敛,继续训练可期提升;目前限制在 256×256 分辨率,使用 SD-1.5 的 VAE。
适用场景:廉价合成数据生成(可改造为生成式去噪/编辑)、在专有小数据集上训练小模型、缩略图/搜索等低算力用途、移动端生成。
权重与 WebGPU 在线试用均已上线 Hugging Face。
「多模态」频道最新
- Opus 5.5 产出近四分钟手绘风动画,角色自白「他们把担忧写进了我的创制文档」 — EricBuess · 2026-09-26
- Falcon Perception 用 GRPO 升级,可一次检测 500 个目标 — HildeKuehne · 2026-09-26
- Dreamina 首月 1.5 美元促销:限 12 国且仅限从未付费的新用户 — azed_ai · 2026-09-26
- Opus 5.5 一次生成手绘白板动画:配解说和音乐讲透莱顿弗罗斯特效应 — EricBuess · 2026-09-26
- ComfyUI 时间线插件实测:MiniMax H3 视频无缝续接生成 — smereces · 2026-09-26
- invideo 推出对话式视频特效:描述即生成,还可自定义参数微调 — LudovicCreator · 2026-09-26