开源统一多模态模型Boogu-Image-0.1
Boogu · hf · 2026-07-16
Boogu 团队发布了 **Boogu-Image-0.1**,一个开源的统一多模态理解与生成模型家族,包含 Base、Turbo、Edit 和 Edit-Turbo 版本。 项目主打高质量文生图、快速推理、指令编辑以及中英双语文字渲染;作者表示,这套方案并不是依赖单一模型,而是通过更好的模型理解、数据质量、训练流水线和 **agentic inference-time scaling**,在受限算力下也能显著提升生成与编辑效果。论文声称其在多项标准基准上可与其他开源模型持平或更优,并接近领先闭源系统。 作者还给出了一个很有冲击力的成本信息:只使用了 **2.0862 亿张唯一图像**,基础模型理论训练成本约 **40 万美元**。代码、权重和训练 recipe 已按 Apache 2.0 开源。
所属事件:Boogu-Image多模态模型家族开源(2 条相关)→
「多模态」频道最新
- Midjourney 新风格出图,附完整参数 — azed_ai · 2026-07-21
- Grok Imagine 的 Agent mode 新增裁切功能,方便做视频转场 — elonmusk · 2026-07-21
- Fable 生成歌曲时会自动检查 dB,防止听感过炸 — Sauers_ · 2026-07-21
- Gaussian splat 把旧金山大教堂做成 3D 场景 — ciguleva · 2026-07-21
- ComfyUI 基准显示 NVFP4 可加速 Flux 和 Qwen-Image 等模型 — Certain-Will-2769 · 2026-07-21
- Midjourney 发出一组超现实时尚生成图 — ciguleva · 2026-07-21