Boogu 团队发布开源多模态模型,40万美元成本媲美闭源系统
jiqizhixin · x · 2026-08-08
Boogu 团队发布了开源多模态模型 Boogu-Image-0.1,该模型能够同时进行图像理解和生成,支持双语文字渲染及指令引导的图像编辑。
其核心思路是通过强化模型的图像理解能力(采用更优的编码器、智能提示词重写及高质量训练数据),从而大幅提升生成质量。尽管算力预算极其有限,该模型不仅匹配或超越了主流开源模型,甚至接近 Nano-Banana Pro 和 GPT-Image-2 等闭源系统的表现。
训练细节:
- 仅使用 2.08 亿张图像进行训练。
- 总训练成本约 40 万美元。
目前,模型的权重、代码及训练方案已基于 Apache 2.0 协议开源。
「多模态」频道最新
- MiniMax H3 本地生成 Pudgy Penguins 音乐视频 — cocktailpeanut · 2026-08-24
- Thrixel 一小时生成可玩 3D 森林与 BOSS — RanaHanocka · 2026-08-24
- 30 年动画人用 AI 赋予角色生命,作品 The Latent Stroke — Paferkas-71 · 2026-08-24
- 用 Minimax H3 制作风世界开场动画,含完整工作流 — Routine_Ad_3391 · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- 寻找不模糊底图的动漫风格 Ref2V 工作流 — undrNourishdEgo · 2026-08-24