仅 5000 欧训练出 <300M 参数图像模型,号称同级 SoTA 达 SD1.5 水平
incorporo · reddit · 2026-09-29
Logolabs 团队在 Reddit 发布 Agate-003-preview:一个参数量不足 300M(含文本编码器与 VAE)的图像生成模型,宣称以少 3 倍的参数达到 SD 1.5 级别的性能,且训练全流程(含 R&D)成本仅约 5000 欧元、630 个 GH-200 GPU 小时,其中主体训练仅 319 GPU 小时。
关键技术路线:
- 规划器+渲染器架构:transformer 规划器在低分辨率上规划并对文本 token 做交叉注意力,再交给全卷积的「渲染器」出图,后者具备很强的图像先验
- 加权损失:基于 P-Dino/LPIPS 与显著性检测加权,优先人脸/文字等视觉重点区域
版本演进:Agate-001 → 002(256×256) → 003(原生 512×512,通过学习式上/下采样器保持规划分辨率不变)。模型支持 LoRA 微调,小体量下训练门槛很低;团队计划将其用于 Logolabs 的字体/符号生成。资源:HF 模型页、WebGPU 在线体验(含 thinker preview)、ComfyUI 节点均已开放。
所属事件:Logolabs 发布超小型文生图模型 Agate,260M 参数比肩 SD1.5(2 条相关)→
「多模态」频道最新
- 涂鸦生成物体:Qwen-Image 2.1 Doodle-in LoRA 上线 ZeroGPU 试玩 — Gradio · 2026-09-29
- Gradio 开源 Qwen-Image 2.1 涂鸦生成 LoRA,数据与脚本全公开 — Gradio · 2026-09-29
- 6 步涂鸦改图:Qwen-Image 2.1「Doodle In」LoRA 保风格改画面 — Gradio · 2026-09-29
- 一条命令生成《兔子简史》:Opus 5.5 加 Runway MCP 一次成片 — tlakomy · 2026-09-29
- 「穿越时空的飞鹰」AI 视频演示引围观 — bilawalsidhu · 2026-09-29
- Hyper3D 推出 Agentic 模式:3D 模型可生成、编辑、加材质还能动画 — SarahAnnabels · 2026-09-29