# Boogu-Image-0.1 开源：一个模型搞定看图、生图、改图，训练费只花了 40 万美元

> 原标题：Boogu-Image-0.1 发布：开源统一多模态理解与生成模型，训练成本仅约 40 万美元

- 来源：AI HOT 精选
- 发布时间：2026-07-14T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44691
- 原文：https://arxiv.org/abs/2607.13125

## 摘要

Boogu-Image-0.1 是一个开源的多模态模型家族，把图像理解、文生图、指令改图和双语文字渲染都塞进了一个模型里，分了 Base、Turbo、Edit、Edit-Turbo 四个版本。团队只用了 2.0862 亿张不重复的图片，基础模型的理论训练成本大概 40 万美元。论文的核心观点是，就算算力预算很紧，把模型理解能力、数据质量、训练流程做好，...

## 推荐理由

开源统一多模态模型，40万美元训练成本是个不错的钩子，四个版本拆得也清楚，信息量够。但团队没名气，论文刚发，没经过社区检验，所以分数卡在featured门槛上，先别太激动。

## 锐评

Boogu-Image-0.1 把图像理解和生成塞进了一个模型里，分了四个版本，主打的是“算力预算很紧也能做出能打的模型”。团队只用了约2.09亿张不重复图片，基础模型的理论训练成本大概40万美元，这个数字在同类模型里确实算低。跑分上看，它跟其他开源模型打平甚至更好，部分指标接近 Nano-Banana Pro 和 GPT-Image-2 这类闭源系统。

不过，论文的对比对象是闭源系统的“系统级整合”表现，而不是单模型直接对打，这点要先打个折。另外，40万美元是理论训练成本，实际研发过程中的试错、数据清洗、人力投入都没算进去。模型权重和代码用 Apache 2.0 协议开源了，这点对想复现或者做二次开发的团队比较友好。

目前还缺几个关键信息：生成一张图的实际推理延迟和成本是多少，Turbo 版到底快了多少，以及中文文字渲染在复杂排版下的翻车率有多高。这些直接决定了它能不能真用在产品里。
