Boogu 团队发布开源多模态模型,40万美元成本媲美闭源系统

jiqizhixin · x · 2026-08-08

Boogu 团队发布了开源多模态模型 Boogu-Image-0.1,该模型能够同时进行图像理解和生成,支持双语文字渲染及指令引导的图像编辑。

其核心思路是通过强化模型的图像理解能力(采用更优的编码器、智能提示词重写及高质量训练数据),从而大幅提升生成质量。尽管算力预算极其有限,该模型不仅匹配或超越了主流开源模型,甚至接近 Nano-Banana Pro 和 GPT-Image-2 等闭源系统的表现。

训练细节:

目前,模型的权重、代码及训练方案已基于 Apache 2.0 协议开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →