Boogu-Image-0.1 用 2.08 亿图像和 40 万美元冲到开源前列

机器之心 · wechat · 2026-07-28

华为香港莱布尼茨研究所联合港大、港科大、港中文等团队发布 Boogu-Image-0.1,号称只用 2.08 亿张独立图像、约 40 万美元训练成本,就做到开源第一并逼近闭源水平。

团队认为图像生成正在从 Text-to-Image 走向 Requirement-to-Image,因此把“理解”放到与数据、配方同等重要的位置:更强的文本编码器、Agentic 提示重写、模型路由都被纳入系统设计。报告里还给出不少工程经验:公开基准已经不太可靠,结构化数据比单纯堆量更有效,部分带噪图像不必丢弃,只要 caption 说清缺陷就能帮助模型学习,而过强的美学 RL 会压缩多样性。模型、代码和训练配方已按 Apache 2.0 开源,并支持原生 2K 和昇腾 NPU。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →