开源统一多模态模型Boogu-Image-0.1
Boogu · hf · 2026-07-16
Boogu 团队发布了 Boogu-Image-0.1,一个开源的统一多模态理解与生成模型家族,包含 Base、Turbo、Edit 和 Edit-Turbo 版本。
项目主打高质量文生图、快速推理、指令编辑以及中英双语文字渲染;作者表示,这套方案并不是依赖单一模型,而是通过更好的模型理解、数据质量、训练流水线和 agentic inference-time scaling,在受限算力下也能显著提升生成与编辑效果。论文声称其在多项标准基准上可与其他开源模型持平或更优,并接近领先闭源系统。
作者还给出了一个很有冲击力的成本信息:只使用了 2.0862 亿张唯一图像,基础模型理论训练成本约 40 万美元。代码、权重和训练 recipe 已按 Apache 2.0 开源。
所属事件:Boogu-Image多模态模型家族开源(2 条相关)→
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11