尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

一张图能不能既学会画画,又学会修图,还认得出埃菲尔铁塔?

一张图能不能既学会画画,又学会修图,还认得出埃菲尔铁塔? 你有没有想过一个问题AI画图模型学怎么画一只猫和学怎么把这只猫的颜色改成白色这两件事之间到底有没有关系按照过去几年大部分团队的做法,答案是没关系。文生图T2I也就是文字生成图片的数据是一套班子在弄图像编辑的数据是另一套班子在弄两边各自优化,各自堆数据,谁也不理谁。这就好比一个厨师专门练切菜另一个厨师专门练炒菜两人从来不交流,结果炒菜的师傅炒到红烧肉的时候,才发现自己根本不知道那块肉该切成什么形状最合适,因为切菜的经验从来没传给他。阿里巴巴的这篇论文,恰恰是从这个被忽略的缝隙里,挖出了一个大问题数据不应该按照任务来组织而应该按照能力来组织。而能力之间是有依赖关系的,就像小孩先学会走路才能学跑步。这篇论文没有做出一个惊艳的新模型架构,它做的事情更基础也更笨重重新设计整套数据基建,让不同能力之间能够传帮带。问题出在哪儿任务导向的数据组织方式,正在悄悄浪费数据先说清楚困难在哪。现在训练一个图像生成大模型,通常需要好几种数据给文字生成图片用的图文对,给图像编辑用的改前改后配对图,还有让模型认识具体人物、地标、动植物的知识类数据。传统做法是,每一类数据独立构建、独立优化、独立评估,谁也不管谁。这套逻辑听起来没什么问题直到你意识到一件事这些能力之间不是并列关系,而是有先后依赖的。论文里举了个例子文生图数据里学到的文字渲染能力比如让AI画出一张写着大甩卖的海报文字清晰可读本可以直接迁移到图像编辑任务里去让编辑模型也能处理带文字的图片。但如果两套数据各自为战、互不相通,编辑那边就得从零开始重新学一遍怎么写好文字这不是重复劳动是什么这就好比一个连锁餐厅,总部研发出了一套完美的番茄酱配方结果每个分店的厨师因为互相不通气各自又花了三个月去调配一套自己的番茄酱味道还不如总部的。信息本来是可以共享的,但组织架构没打通导致了大量重复投入。这不是一个小问题。论文观察到不同的生成能力不是同时从零长出来的,它们有明确的先后顺序,这个顺序还恰好和模型训练的课程阶段高度吻合。生成模型的能力发展有点像人学语言,先认字再组词再造句最后才能写文章。如果一开始就让模型啃高难度的复杂结构图,它连基本的猫是什么样子都没搞明白学习效率会非常低。于是研究团队提出了两条并行的解决路径。第一条是能力专属数据管线把数据构建按目标能力拆成三个独立又互通的引擎。第二条是能力对齐的课程调度按照能力习得的先后顺序,动态调整训练数据的构成。这两条线拧在一起,就是这篇论文的核心贡献。三个引擎各管一块,但共用一套翻译语言论文把数据构建拆成三个专门的引擎T2I数据引擎、图像编辑数据引擎、知识关联数据引擎。**T2I数据引擎负责建立文字和图像之间的对应关系**从一个数十亿规模的图片池子里,筛出4.4亿张高质量、语义均衡的训练图片。这个引擎干的活不只是收集图片更重要的是填补空白。比如,团队特意去抓取那些专业设计师做的海报、网页截图、社交媒体图文、电商产品图这些内容天然带有复杂的排版和文字信息普通网络爬取的图文对里很少见。为什么要专门抓这些因为这类结构复杂、信息密集的图像是模型学会排版能力和文字渲染能力的关键素材如果放任自然分布这类图片占比太少模型学不到。更有意思的是一个反直觉的决定团队没有把所有画质不好的照片都筛掉,而是刻意保留了一部分带瑕疵的图片,比如老照片、轻微失焦的图同时在文字描述里明确写出它的缺陷比如画面有轻微噪点。这个做法乍一听有点浪费,过去的直觉是垂直的糙照片就该扔掉。但反过来想如果模型从来没见过瑕疵长什么样,它怎么知道生成的时候要避开这些瑕疵这就像教一个新手厨师做菜,如果你只让他看完美摆盘的菜品照片,他永远不知道糊了是什么样子,更谈不上避免把菜炒糊。只有让他见过失败案例,并且明确指出这是糊了他才能在自己操作时主动避开。**图像编辑数据引擎负责构造改前改后的配对样本**这块最难因为天然存在的编辑配对图特别稀缺大部分团队的做法是靠合成生成也就是用AI自己造训练数据。但合成数据有个天生的缺陷编辑效果容易显得贴上去的不像真实世界里那种自然、混合式的变化。论文提出了三条并行的补充路径。第一条叫操作特定的配对构造简单说就是找一张已经完成的高质量图片用VLM视觉语言模型,一种能同时理解图片和文字的AI模型和SAM3一种能精确抠出图中物体轮廓的分割模型识别出图中可编辑的对象,然后把这个对象删掉或替换这样就得到了改前和改后两张图。反过来看,这个过程天然产生了添加、删除、替换、属性修改这四种编辑类型的配对样本。第二条是挖掘自然存在的关联图片这是整篇论文我觉得最巧妙的一处设计。团队没有满足于合成数据转而去网上、电商平台、社交媒体上找那些天然就是一组的图片。比如同一个人的不同状态照片、产品使用前后对比图、化妆前后的对照图、多图拼版里的不同区域。这些图片是真实世界里自然产生的不是AI编出来的所以编辑关系更真实、更复杂。举个例子,电商平台上经常有那种多宫格拼图一张图分成四块分别展示产品的正面、侧面、使用中、使用后。VLM可以把这张拼图拆开,识别出每一块之间的关系直接变成一组高质量的编辑配对样本完全不需要人工合成。这个思路等于是说既然真实世界本身就在不停地编辑和记录变化那为什么不直接从这些自然发生的记录里挖数据而非要费劲去合成假的如果只依赖合成数据模型学到的编辑逻辑会偏向套路化遇到真实世界里那种自然、混合、不规则的变化要求时容易翻车。第三条是专家自蒸馏针对特别稀缺的任务比如虚拟试穿、美妆编辑团队先用少量领域数据微调出一个专家模型再让这个专家模型批量生成候选样本经过过滤后转化成大规模训练数据。这里还用到了视频生成模型如Wan 2.2来生成一些高难度编辑任务的可控样本。整个编辑引擎最后攒出了1.2亿组编辑对,横跨单图编辑和多图编辑两大类任务具体又细分成加减替换、风格转换、视角调整、文字排版编辑、修复复原等十几个子类。**知识关联数据引擎负责让模型认得具体的人事物**这个引擎的思路是从维基数据Wikidata,一个开放的结构化知识库出发,先用PageRank算法一种衡量网络节点重要性的算法最早用于谷歌网页排名从超过一亿个实体里筛出概念上足够有名的候选再让VLM进一步判断这个实体是否值得学、公众认知度够不够高最终留下约300万个高显著度实体名称。针对每个实体去网上抓配图,再用VLM做视觉核验,确保图片确实对应这个实体而不是张冠李戴。最终整理出超过2700万组图像实体配对覆盖名人、地标、动植物、知名IP这五大类。这一步解决的是一个容易被忽视的问题模型光会画一只猫是不够的如果它连大熊猫和埃菲尔铁塔都认不出来,遇到需要具体知识的生成任务比如画一张巴黎埃菲尔铁塔前的野餐场景就会露怯。**三个引擎共用一套语言**这是整篇论文设计上最值得说的一点三个引擎各自独立运作,但它们统一使用同一种描述语言,由一套专门的图注模型来生成。论文管这个叫caption作为跨任务和跨粒度的桥梁。具体来说团队训练了一套VLM图注专家把编辑指令的用词和描述结构硬生生对齐到T2I图注的风格上去。举个例子,如果T2I的图注习惯用一位穿白色连衣裙的女性靠在木门前这种描述方式,那编辑指令也会被改写成同样的用词习惯,而不是各写各的。这样一来模型学到的白色连衣裙这个概念,在文生图任务里练出来的经验就能直接复用到编辑任务里不需要重新学一遍。这就好比公司里所有部门统一用一套术语手册,财务部门说的营收和销售部门说的营收是同一个概念,不会因为部门不同就变成两种理解。如果没有这套统一语言不同任务学到的知识就是碎片化的互相之间无法迁移等于白白浪费了本可以共享的经验。图注系统本身也做得挺细,针对同一张图,会生成从实体标签、无序关键词、简短描述到中长篇描述、超详细密集描述的多种粒度版本,还有中英双语版本。这样模型在训练时接触到的提示词风格更丰富泛化能力更强。对于编辑任务团队还专门设计了一套对齐流程先让图注模型不看原图,单独给目标图生成一份详尽描述再对比原图和目标图找出差异把目标图描述中和原图重复的部分替换成[图1]这种引用标记只保留真正发生变化的部分作为文字描述。这样编辑指令就变得又准确又简洁,不会啰嗦地重复描述那些没有变化的内容。训练顺序不是一锅炖是五道菜依次上光有好数据还不够,论文的第二个核心贡献是怎么喂这些数据,也就是课程调度策略。团队设计了五个训练阶段从256像素的低分辨率一路走到1024像素的高清训练。**第一阶段256像素文生图预训练**目标是最大化语义覆盖面保留真实世界长尾分布的原始样貌。这里团队特意采用了比较宽松的过滤策略不做激进的美学筛选宁可留着一些不完美的图片只要标注清楚它的缺陷即可。**第二阶段256到512像素的复杂内容预训练**引入那些在低分辨率下根本学不明白的内容,比如密集文字排版、知识关联的图片。分辨率提升和内容复杂度提升是同步进行的这个设计逻辑是低分辨率下模型连基本轮廓都画不清楚硬塞给它复杂结构等于白费功夫。**第三阶段512像素的文生图与编辑联合预训练**这一步是关键节点。等文生图能力稳定之后才开始引入编辑数据让模型在已经积累的视觉概念基础上学习保留参考内容和受控变换这两项编辑核心能力。这个顺序安排背后的逻辑值得琢磨如果编辑数据太早介入,模型连基本的视觉概念都没建立起来编辑任务要求的保留原图特征、只改变指定部分这种精细控制根本无从谈起。这就像教小孩临摹画之前,总得先让他认得笔怎么拿、颜料怎么调如果直接让他去修改别人的画作,他连基本的绘画语言都不懂,改出来的东西只会是一团糟。**第四阶段512到1024像素的持续训练**分辨率继续爬升,数据分布也从广而杂转向干净且视觉质量更高。这一步会把质量较差的网络爬取来源剔除增加高保真度和专业视觉领域的采样比例。**第五阶段1024像素监督微调**这是最后的精修阶段用小规模但极度精选的数据集引导模型走向一个视觉质量和指令遵循能力都更强的子空间。这里用到了VLM初筛加人工复核的双重把关确保每一张进入最终训练集的图片都经得起挑剔的眼光。整套课程设计还有个活的反馈机制,论文称之为能力差距驱动的主动反馈闭环。具体流程是每训练到一个阶段,就用AI生成图像模型自己去做能力评估测试它在美学、文字渲染、指令遵循、空间准确性等各个维度上的表现。表现不达标的样本会被丢进失败池标注上具体的任务类型、语义标签和失败原因。然后系统会拿这些失败案例当作检索种子去找相似的补充数据或者直接调用专家模型生成针对性样本。新补充进来的数据经过VLM初筛加人工复核才会进入下一轮训练的采样池。持续失败的类别会被提高采样权重已经解决的问题类别则会被降低权重那些还没彻底解决的会被打回数据挖掘队列继续处理。这套机制的价值在于它把评估从一次性的考试打分变成了持续运转的训练指挥棒。如果没有这个闭环,团队只能凭经验或者固定配方去猜测下一阶段该喂什么数据很可能在模型已经学会的地方继续浪费资源却在真正薄弱的地方投入不足。结果说话数据组织方式真的能带来能力上的提升吗论文用两个规模的模型验证了这套方法分别是30亿参数和60亿参数的多模态DiT模型MM-DiT一种基于扩散模型和Transformer结合的图像生成架构。在CPI-Bench一个专门评测图像编辑能力的基准测试集的两个子集上模型表现如下。| 模型 | 参数量 | CPI-General得分 | CPI-Practical得分 | 综合得分 ||---|---|---|---|---|| 60亿参数版本 | 6B | 3.96 | 3.92 | **3.94** || 30亿参数版本 | 3B | 3.95 | 3.91 | 3.93 |分数是1到5分制由VLM从多个维度打分。两个规模的模型表现都相当接近说明这套数据基建方法本身的收益不完全依赖堆参数量。定性案例上论文展示了几类比较刁钻的测试混合式编辑同时调整视角、材质、光照多个属性、推理式编辑比如把这个场景恢复成四个月前的样子这需要模型理解时间推理而不是简单的像素修改、图像分割任务、老照片修复。团队还给出了和几个业界竞品Qwen-Image-Edit、FireRed-Image-Edit、Flux.2-klein、JoyAI-Image-Edit的直接对比图从视觉效果上看团队自己的模型在这几类复杂任务上表现更自然编辑痕迹更不明显。多图编辑的案例更有意思比如把三张图里的人物、服装、场景元素组合成一张新图模型需要准确识别每个图N引用对应的是哪个物体并把对应属性绑定到正确位置。这背后依赖的正是前面提到的那套统一语言设计,如果图注和编辑指令没有对齐模型很容易把不同来源的属性搞混。写在后面这篇论文让我意外的地方是,它没有去卷模型架构,也没有去卷参数规模反而回头去啃一个大家都觉得脏活累活的问题数据到底该怎么组织。真正让我停下来想了想的是那个故意保留瑕疵图片的决定。这违反了一个我以为是常识的直觉过滤数据不就该把差的都扔掉吗但仔细想想,如果模型从没见过糟糕是什么样子它连避免糟糕这个能力都学不会。这其实是个更普遍的道理一个系统要学会不做什么前提是它得先见过什么是不该做的。这可能不止适用于图像生成,任何需要判断力的AI系统,大概都需要负样本的滋养。另一个让我反复琢磨的点是能力有先后依赖这个判断本身。论文没有直接证明这一点更多是基于观察和课程设计的实践结果反过来印证。但这提出了一个挺有意思的问题如果能力之间真的存在类似人类学习的依赖链条那我们是不是低估了训练顺序这个变量现在大部分论文关注的是数据量和数据质量训练的顺序这件事讨论得远远不够。这套方法目前还没有解决一个问题能力依赖的顺序,到底是模型架构决定的还是数据本身的性质决定的如果换一个完全不同的架构,这个五阶段课程是不是还成立这个问题留着,可能得等下一篇论文来回答。QAQ1这篇论文提出的能力驱动数据基建具体解决了什么问题A解决的是传统数据管线里文生图、图像编辑、知识关联三类任务各自独立构建数据、互不共享的问题导致同样的视觉概念要在每个任务里重复学一遍浪费了本可以迁移的能力。Q2论文里的三个数据引擎分别是做什么的AT2I数据引擎负责建立文字和图像的对应关系构建了4.4亿图片的训练语料图像编辑数据引擎通过操作构造、自然关联挖掘、专家蒸馏三条路径构建了1.2亿组编辑配对知识关联数据引擎通过维基数据和PageRank筛选出高显著度实体整理了超过2700万组图像实体配对。Q3为什么训练要分五个阶段进行不能一次性把所有数据混在一起训练吗A因为不同生成能力有先后依赖顺序模型要先建立基本的视觉语义理解才能学习复杂结构、知识关联和文字渲染最后才适合引入图像编辑这种需要精细控制的任务直接混在一起训练会导致模型在基础都不牢的情况下被迫学习高难度内容效果反而更差。
返回列表