300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1
创始人
2026-08-23 15:27:35
0

(来源:机器之心)

近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。

由于缺少充分的消融实验、可复现的训练配方和可以复用的数据配方,研究者往往很难判断优异的模型表现究竟是来源于哪里:是更优质的训练数据,还是某个特定的模型或训练设计?

如果存在一个性能出色,同时从训练代码到训练数据完全公开可复现的模型的话,研究者们就可以在统一起点上做更多拓展和控制消融实验,从而更准确地分析、理解不同设计带来的实际影响。

最近,普林斯顿大学刘壮团队发布的 i1 模型就回应了这一需求。

  • 论文标题:i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models

  • 论文链接:https://arxiv.org/abs/2606.11289 

  • 项目主页:https://zlab-princeton.github.io/i1/ 

  • 代码:https://github.com/zlab-princeton/i1 

  • 模型:https://huggingface.co/zlab-princeton/i1-3B 

  • 数据集:https://huggingface.co/datasets/zlab-princeton/i1-captions 

团队开展了 300 多组控制实验,总计使用超过 70 万 TPU v6e 小时,系统研究了文生图扩散模型中的模型与数据设计。基于这些实验结论,他们最终训练出一个参数量为 3B 的文生图模型 i1。

在 GenEval、DPG-Bench、PRISM-Bench、CVTG-2K 和 LongText-Bench 五项基准上,i1 平均领先此前最好的全公开模型 29.5 个百分点。在这些主要关注提示词遵循和文字渲染能力的自动评测中,i1 的综合表现也接近部分参数量更大、仅开放权重的模型,如 20B 的 Qwen-Image。

五项文生图基准上的平均表现。i1 平均领先此前表现最好的全公开模型 29.5 个百分点,并接近多款仅开放权重的领先模型i1 在通用图像生成任务上的精选示例i1 在文字渲染任务上的精选示例

控制实验

团队的探索基于一个简单且具有代表性的文生图基线:在模型方面,用浅层融合的方式由冻结的文本编码器提取特征,并输入到一个从头用 flow matching 训练的 DiT 网络;在数据方面,组合 12 个公开的图片数据集,并重新用 VLM 生成长 caption。

所有控制实验都从这个相同的 256×256 分辨率预训练基线出发,每次只改变一项设计,来评估不同模型和数据设计的影响。

i1 从一个统一基线出发,对一系列模型和数据设计开展控制实验

在模型方面,团队的发现包括:

(1)同时使用多个文本编码器可以提升模型表现,但增大单个文本编码器的 adapter 也能获得类似效果,而且计算成本更低。

稍微增大文本编码器的 adapter 大小就能够在不同 backbone 上稳定提升表现

(2)AdaLN 占有大量参数,但用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益有限。

用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益十分有限

(3)在主干网络设计方面,相同参数量下,dual-stream 模型优于 single-stream 模型,single-stream 模型优于 cross-attention 模型。U-ViT 式的长跳跃连接在控制参数量或 FLOPs 时都能稳定提升性能。

控制参数的情况下,加入 U-ViT 式长跳跃连接能稳定提升表现控制参数的情况下,dual-stream 优于 single-stream 优于 cross-attention

在数据方面,团队的发现包括:

(1)在短 caption 上训练会整体削弱模型表现;而虽然长 caption 可以训出更强的模型,但这样的模型在短 prompt 上表现欠佳。推理时使用 prompt rewriter 扩写 prompt 可以弥补这一问题。

使用不同比例的长、短 caption 训练后,模型在不同类型的 prompt 上的表现

(2)数据集足够多样时,在较小规模的数据上重复训练不会严重影响文生图表现。

在数据集 subsample 到不同规模后,模型的表现

(3)高分辨率训练不需要广泛的 data coverage,也能保留甚至提升低分辨率训练阶段学到的能力(如文字渲染)。

仅保留特定数据子集进行 512×512 分辨率训练时的模型表现。即使不使用专门的文字渲染数据,模型的文字渲染能力仍能得到显著提升

最终的 i1 模型

i1 的整体模型框架。i1 没有引入复杂的新模块,而是组合了多项经过控制实验验证的简单设计

基于控制实验的结论,团队融合多项简单有效的设计,训练出 3B 参数的 i1。它在五项主流文生图基准上的综合表现接近多款参数量更大、仅开放权重的模型。i1 也是第一个能做到较准确的生成文字渲染的全公开模型,在 CVTG-2K 和 LongText-Bench 上分别得到了 0.8531 和 0.922 的分数。

i1 在文生图评测上的表现

总结

i1 表明,训练一个有竞争力的文生图模型并不一定依赖难以获取的私有数据、不透明的训练配方或复杂的模型组件:仅使用公开数据集,并基于经过系统控制实验验证的设计构建一个简洁的配方,同样可以在提示词遵循和文字渲染等能力上达到较强水平。

同时,i1 可复现的训练配方也给文生图研究提供了一个统一的起始点,使研究者能够在受控条件下评估新的模型或数据设计,更准确地理解不同改动真正带来的影响。

作者介绍

i1 第一作者曾博亚是普林斯顿大学一年级博士生,本科毕业于宾夕法尼亚大学,研究方向为视觉生成模型。

通讯作者刘壮是普林斯顿大学助理教授。他的研究致力于构建能够更好地感知和理解世界的 AI 系统,分析模型的工作原理,并使用 AI 加速科学研究。代表作包括 DenseNet、ConvNeXt,曾获 CVPR 最佳论文奖。

相关内容

今天起,穿衣吃饭请调整一下...
(来源:河北青年报)转自:河北青年报“处,止也,暑气至此而止矣。”...
2026-08-23 16:23:00
拟融资800亿,股价下跌8...
  来源:大江南证券  阿里又要融资了,这次是800亿港元,周五美...
2026-08-23 16:22:55
滴滴专车配可口可乐:这瓶“...
财联社8月23日讯(记者 沈娇娇)一瓶300毫升的无糖可口可乐,正...
2026-08-23 16:22:49
石榴花开 籽籽同心——多彩...
来源:天山网-新疆日报天山网-新疆日报记者 甘兴华8月19日,素有...
2026-08-23 16:22:42
金价大涨,创3个月新高
8月21日,国际贵金属收涨。现货黄金站上4600美元,盘中一度突破...
2026-08-23 16:21:44
下周重磅日程:全市场最关注...
08月24日 - 08月30日当周重磅财经事件一览,以下均为北京时...
2026-08-23 16:21:27
原创 ...
自人类航空器突破音障至今已经过去七十余年,全球航空技术竞争的重心,...
2026-08-23 16:21:24
大连重工:上半年净利润3....
大连重工披露半年报,2026年上半年,公司实现营业总收入80.21...
2026-08-23 16:18:19

热门资讯

今天起,穿衣吃饭请调整一下! (来源:河北青年报)转自:河北青年报“处,止也,暑气至此而止矣。”8月23日(今天),我们迎来处暑节...
拟融资800亿,股价下跌8%:...   来源:大江南证券  阿里又要融资了,这次是800亿港元,周五美股应声大跌超过8%。盘面剧烈下挫的...
滴滴专车配可口可乐:这瓶“无糖... 财联社8月23日讯(记者 沈娇娇)一瓶300毫升的无糖可口可乐,正在滴滴专车的车厢内掀起一场关于成本...
石榴花开 籽籽同心——多彩民族... 来源:天山网-新疆日报天山网-新疆日报记者 甘兴华8月19日,素有“西部明珠”之称的奎屯市绿意盎然,...
原创 4... 自人类航空器突破音障至今已经过去七十余年,全球航空技术竞争的重心,正从传统1‑2马赫的超音速,向着5...
大连重工:上半年净利润3.71... 大连重工披露半年报,2026年上半年,公司实现营业总收入80.21亿元,同比增长7.63%;归属于上...
从《汉密尔顿》到《狮子王》:百... 不妨畅想一番:试想你是2015年斥资1250万美元、助力《汉密尔顿》(Hamilton)搬上舞台的投...
水晶光电A股股东户数增加736... 8月23日消息,数据显示,截至2026年6月30日,水晶光电A股股东总户数为12.12万户,较上期(...
嘉欣丝绸A股股东户数增加303... 8月23日消息,数据显示,截至2026年6月30日,嘉欣丝绸A股股东总户数为2.73万户,较上期(2...
依米康A股股东户数减少1036... 8月23日消息,数据显示,截至2026年6月30日,依米康A股股东总户数为4.81万户,较上期(20...