普林斯顿团队发布全开放文生图模型i1,基于300余组控制实验
普林斯顿大学刘壮团队发布了全开放文生图模型i1,该模型基于300多组控制实验和70万余TPU小时的研究,系统分析了模型与数据设计的影响。i1在多项基准上平均领先此前最好的全公开模型29.5个百分点,并接近部分更大规模的仅开放权重模型。该工作提供了从训练代码到数据的完全公开配方,有助于研究者进行可复现的消融实验。
普林斯顿大学刘壮团队发布了全开放文生图模型i1,该模型基于300多组控制实验和70万余TPU小时的研究,系统分析了模型与数据设计的影响。i1在多项基准上平均领先此前最好的全公开模型29.5个百分点,并接近部分更大规模的仅开放权重模型。该工作提供了从训练代码到数据的完全公开配方,有助于研究者进行可复现的消融实验。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
普林斯顿大学刘壮团队发布全开放文生图模型i1,通过300多组控制实验和70万TPU小时,系统验证了模型与数据设计,在五项基准上平均领先此前最佳全公开模型29.5个百分点,并接近20B的Qwen-Image。
当前文生图模型发展迅速,但多数工作独立引入整套模型、数据和训练设计,使用私有数据训练,缺乏充分的消融实验和可复现配方,研究者难以判断优异表现源于数据还是设计。
普林斯顿大学刘壮团队发布的i1模型回应了这一需求,提供从训练代码到训练数据完全公开可复现的模型,为研究者提供统一起点进行控制实验。
团队基于统一基线(浅层融合、冻结文本编码器、flow matching训练的DiT网络,组合12个公开数据集并用VLM生成长caption)进行控制实验,每次只改变一项设计。
模型方面发现:多个文本编码器可提升表现,但增大单个adapter也能类似效果且成本更低;AdaLN参数多但额外收益有限;相同参数量下dual-stream优于single-stream优于cross-attention,U-ViT长跳跃连接稳定提升性能。
数据方面发现:短caption训练削弱表现,长caption训练在短prompt上欠佳,可用prompt rewriter弥补;数据多样时小规模重复训练影响不大;高分辨率训练不需广泛数据覆盖,仍能保留文字渲染能力。
基于控制实验结论,团队融合简单设计训练出3B参数的i1,在GenEval、DPG-Bench、PRISM-Bench、CVTG-2K和LongText-Bench五项基准上平均领先此前最佳全公开模型29.5个百分点。
i1综合表现接近部分参数量更大、仅开放权重的模型,如20B的Qwen-Image。
i1是第一个能做到较准确文字渲染的全公开模型,在CVTG-2K和LongText-Bench上分别得到0.8531和0.922的分数。
i1表明训练有竞争力的文生图模型不一定依赖私有数据或不透明配方,仅用公开数据集和系统验证的设计即可达到较强水平。
i1的可复现配方为文生图研究提供统一起始点,使研究者能在受控条件下评估新设计。
但i1仍接近而非超越仅开放权重的模型,且评测集中于提示词遵循和文字渲染,通用图像质量未充分覆盖。
本文信息主要来自机器之心对普林斯顿团队i1模型的报道,属于二手来源。所有具体数字和结论均以该报道为准,未经独立验证。
i1通过系统控制实验验证了简单设计组合的有效性,证明全开放模型也能接近闭源模型性能,为文生图研究提供了可复现的基准。
主报道
主报道来源