Boogu-Image-0.1 用 2.08 亿图像和 40 万美元冲到开源前列
机器之心 · wechat · 2026-07-28
华为香港莱布尼茨研究所联合港大、港科大、港中文等团队发布 Boogu-Image-0.1,号称只用 2.08 亿张独立图像、约 40 万美元训练成本,就做到开源第一并逼近闭源水平。
团队认为图像生成正在从 Text-to-Image 走向 Requirement-to-Image,因此把“理解”放到与数据、配方同等重要的位置:更强的文本编码器、Agentic 提示重写、模型路由都被纳入系统设计。报告里还给出不少工程经验:公开基准已经不太可靠,结构化数据比单纯堆量更有效,部分带噪图像不必丢弃,只要 caption 说清缺陷就能帮助模型学习,而过强的美学 RL 会压缩多样性。模型、代码和训练配方已按 Apache 2.0 开源,并支持原生 2K 和昇腾 NPU。
「多模态」频道最新
- Netflix 的 ID-V2V 从单段视频保持身份并重风格化 — netflix · 2026-07-28
- dRAE 将视觉离散化扩到 13.1 万 token,避免 codebook 崩塌 — burny_tech · 2026-07-28
- 新论文给出原生多模态预训练的最优缩放规律 — burny_tech · 2026-07-28
- 新 ComfyUI 节点可把音频转成 MIDI — MuziqueComfyUI · 2026-07-28
- ComfyUI 基础概念探讨:为何工作流要拆分 Checkpoint 与 KSampler? — DavidThi303 · 2026-07-28
- RTX 4060 跑 Z Image Turbo 出图:如何突破画质上限? — Dangerous_Ring_435 · 2026-07-28