返回信息流
新闻事件
机器之心
1 个来源

华为联合6校发布Boogu-Image-0.1:40万美元训出2K开源文生图模型

华为香港莱布尼茨研究所与香港大学、香港科技大学等六所高校联合发布了Boogu-Image-0.1,一个仅用2.08亿张图像和约40万美元训练成本的开源文生图模型。该模型在多个基准上达到开源第一,性能逼近闭源模型如GPT-Image-2,并支持原生2K分辨率。团队还公开了模型权重、代码和训练配方,已在ModelScope和ComfyUI上线。

SynthePulse Insight · AI 深度解读

40万美元训出开源第一:Boogu-Image-0.1如何用“理解”撬动2K生成

版本 1 · 1 个来源

华为联合6校仅用2.08亿张图像、40万美元训练成本,在多个基准上做到开源第一、逼近闭源水平,并公开了大量工业界试错经验。

  • Boogu-Image-0.1仅用2.08亿张独立图像、理论训练成本约40万美元,在自建Arena盲测中以Elo 1048位列开源第一,仅次于GPT-Image-2和Nano-Banana-Pro。
  • 团队核心判断:图像生成正从Text-to-Image走向Requirement-to-Image,将“理解”提升为与数据质量、训练配方同等重要的一等公民。
  • 技术报告公开多项量化结论:汉字稳定渲染需约300次曝光,记住从未见过的人物身份需约4500次语言匹配曝光。
  • 团队指出公开基准正在失效,LMArena人类偏好排名与GenEval、DPG-Bench分数出现明显倒挂,宣布不再将其作为主要评估。
  • 模型支持原生2K分辨率,权重、代码与训练配方已全部以Apache 2.0协议开源,并适配华为昇腾Ascend NPU。
展开章节目录从“文生图”到“需求生图”:理解成为核心

从“文生图”到“需求生图”:理解成为核心

Boogu团队认为,用户需求已从简单描述性prompt转向复杂意图、隐含约束和跨模态上下文。为此,他们将“理解”拆解到系统每个环节:采用更强的指令编码器(Qwen3-VL-8B),实验证实冻结编码器规模从1.7B扩到14B时生成质量单调提升且未见饱和;引入Agentic提示重写,以恒等变换为下界,只在意图模糊时介入,重写模型越强收益越大(0.8B到397B呈近似对数线性提升);并通过模型路由,根据请求难度动态分发,将重型模型留给复杂任务。

在自建Arena盲测中(与公开LMArena排名的Spearman相关系数达1.0,Pearson相关系数0.986),Boogu-Image-0.1-Turbo-Thinking以1048的Elo位列开源第一,仅次于GPT-Image-2和Nano-Banana-Pro。在新发布的Qwen-Image-Bench上,其Base-Thinking变体在中英文双语下均取得开源模型最佳总分;编辑模型Boogu-Image-0.1-Edit-Thinking更在ImgEdit-Bench上拿下全场最高的4.64分。

数据策略:结构化“质”优于朴素堆“量”

团队发现,用1.87亿开源数据训练的模型明显撞上性能天花板;而利用少量按人类先验组织的“Boogu Syllabus”教学大纲式数据(仅2162万独立样本)进行后训练,反而能全面提升性能。原则是系统性细粒度拆解、能力全覆盖、每个类别数据量充足——“如果模型训练时没见过猫,就默认它画不出猫”。

团队还公开了多个可复用的量化结论:一个汉字稳定渲染需约300次曝光,覆盖3500个现代常用字即可满足日常中文渲染需求;让模型记住一个从未见过的人物身份,需约4500次语言匹配曝光(用一位论文作者的170张日常照片做了完整消融)。此外,水印、过曝、运动模糊等“坏数据”不必丢弃,只要在caption中详细描述缺陷,反而能让模型学会可控地规避或复现这些视觉元素。

公开基准失效与RL慎用

团队用6个近期模型对比LMArena人类偏好排名与GenEval、DPG-Bench分数,发现明显排名倒挂:人类偏好最强的GPT-Image-2在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估,并呼吁社区重新审视其适用性——甚至坦率指出自家模型在ImgEdit-Bench上分数虽高,但人评中仍不如Nano-Banana-Pro。

在强化学习方面,团队发现重度美学RL会导致输出分布坍缩,例如让模型画“一位六十岁的中国女性”时,重RL模型倾向输出精致妆容的理想化形象。Boogu选择把人类偏好放进理解系统而非烙进生成器,只在肢体结构、文字渲染等不损害多样性的问题上使用RL。

原生2K训练与工程细节

作为最早的原生2K训练的开源模型之一,团队发现标准的动态时间偏移策略在2K分辨率会产生“过度挤压”效应导致收敛变慢,并给出了简单有效的截断修正方案。附录还提出了免训练的推理增强方法BOG(Boosted Orthogonal Guidance),把DiT预测视为二维矩阵做结构化归一化,强化垂直于flow流场的信息,一定程度提升照片摄影艺术质感。

模型权重、代码与训练配方已全部以Apache 2.0协议开源,支持华为昇腾Ascend NPU、vLLM-Omni框架等,ModelScope和ComfyUI均已上线。

可信度边界

本文信息主要来自机器之心对华为联合6校发布Boogu-Image-0.1的报道,报道中引用了论文和团队声明。所有性能数据、成本数字和实验结论均来自该报道,未经过独立第三方验证。团队对基准失效的批评属于自身观点。

核心结论

Boogu-Image-0.1以极低预算证明了“理解驱动”路线的有效性,并公开了大量工业界试错经验,为开源文生图模型提供了可复现的路径。

主报道

机器之心

主报道来源