尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

文生图Scaling新变量,被字节Seed团队发现了

文生图Scaling新变量,被字节Seed团队发现了 团队提出 Structured Prompt并从 Diffusability 与 Promptability 两侧共同提升文本条件最终在复杂组合、推理和世界知识生成任务上取得显著提升。文生图模型一直在扩展模型、数据和算力但训练图像所配 Caption 的信息量却很少被作为一个独立变量系统研究。ByteDance Seed 团队发现自然语言 Caption 变长并不意味着模型获得了更多可用的视觉监督相比长度Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。基于这一发现团队提出 Structured Prompt并从 Diffusability 与 Promptability 两侧共同提升文本条件最终在复杂组合、推理和世界知识生成任务上取得显著提升。论文 Figure 1自然语言长度很快饱和结构化条件持续增加图像信息并沿统一关系降低扩散训练损失过去几年文生图模型的进步几乎沿着一条熟悉的路线展开更大的模型、更多的数据以及更高的训练算力。但文生图与语言模型之间存在一个容易被忽略的差异。语言模型可以直接从文本序列中进行自监督学习文生图模型则依赖图像与 Caption 的配对学习 “什么样的文字对应什么样的视觉内容”。图像中可能包含大量物体、属性、位置、动作和关系但只有被 Caption 准确描述并清晰绑定的部分才能作为文本条件监督传递给模型。于是一个基础问题出现了除了继续扩大模型、数据和算力我们能否通过增加 Caption 所携带的图像信息让生成模型学得更好在这项新工作中ByteDance Seed 团队研究了这一问题。核心结论可以概括为一句话真正随文本条件扩展的不是 Caption 的 token 数量而是其中可被模型利用的图像信息。论文标题 Scaling Properties of Text Conditioning in Visual Generation作者 Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan 机构 ByteDance Seed论文https://arxiv.org/abs/2607.29679项目主页https://heheyas.github.io/context-scaling代码https://github.com/heheyas/context-scaling模型https://huggingface.co/collections/heheyas/context-scaling在线 Demohttps://heheyas-context-scaling.hf.space/Hugging Face Paperhttps://huggingface.co/papers/2607.29679Prompt 变长了为什么模型没有变强一个直觉做法是把训练 Caption 或用户 Prompt 写得更长、更详细。更多 token 看起来应该意味着更多监督也应该帮助模型生成更复杂的图像。实验却给出了不同答案。在多种现有开源文生图系统上自然语言 Prompt 随长度增加很快饱和最终输出甚至低于各自最短 Prompt 的表现。即使专门在同一套长文本 Caption 上训练扩散模型收益也十分有限。为了把这个现象看得更清楚团队设计了一个固定骨干网络的图像重建实验。对于同一张参考图像团队从同一份完整标注出发生成四个详细程度逐渐增加的自然语言 Caption再使用相同的 Qwen-Image 模型和随机种子尝试还原该图像。这些 Caption 描述相同的实体和关系后续版本主要通过补充和展开自然语言表达来增加长度。令人意外的是Caption 虽然显著变长图像重建质量却几乎不再提高。新增的 prose 更多是在解释、改写或连接已经出现的内容并没有持续增加新的、可稳定使用的视觉变量。论文 Figure 3固定骨干重建实验NL Caption 继续变长后重建趋于饱和逐步恢复 SP 字段则持续改善这说明Caption 长度只是一个很弱的代理变量。一个文本可以写得很长却仍然没有清楚说明某个属性属于哪个物体、两个物体是什么关系、各自位于哪里以及它们在画面中的前后层次。如何衡量 Caption 里真正的图像信息如果 token 数量不足以衡量监督强弱就需要直接测量 Caption 中与图像绑定的信息。为此团队从已有工作中改造了两个互补指标Grounded Perplexity GainGPG和 Effective DetailnessED。GPG图像让 Caption 变得 “更可预测” 多少。GPG 是一个需要读取模型 token 概率的白盒指标。对于同一句 Caption团队分别让一个冻结的视觉语言模型看到和看不到配对图像并计算图像出现后 Caption 内容 token 的对数似然提升。若 Caption 中包含大量与该图像紧密绑定的信息看到图像应当显著提高模型对这些 token 的预测能力。EDCaption 覆盖了多少可靠的图像属性。ED 是一个不依赖 token 概率的黑盒语义指标。它分别从图像和 Caption 中提取带有实体上下文的属性再计算 Caption 属性的准确率与图像属性的召回率。最终采用更重视准确率的 F0.5对 Caption 中没有图像依据的描述施加更强惩罚。两个指标从不同角度刻画同一个问题GPG 关注图像与文本之间的统计依赖ED 关注 Caption 是否准确覆盖了可验证的视觉内容。论文 Figure 6GPG 与 ED 的定义及测量趋势Caption 信息量可以预测扩散模型的训练损失接下来团队固定图像、模型架构、初始化方式、优化配置和训练预算只改变训练 Caption。整个实验包含 15 种 Caption 配置三个不同长度的自然语言版本、六个逐步恢复字段的 Structured Prompt 版本以及六个空间表达或字段遮蔽变体。每种配置都从同一个 BAGEL continued-training checkpoint 出发独立训练一个扩散模型。结果显示自然语言 Caption 的 token 数与训练结果并不存在统一关系但当横轴换成 Caption 信息量后不同格式和详细程度的配置落在了高度规律的曲线上收敛后的 diffusion loss 与 GPG 近似呈线性关系Pearson r -0.984收敛后的 diffusion loss 与 ED 呈幂律趋势log-log 空间中的 Pearson r -0.971GPG 与 ED 对不同 Caption 配置的排序也高度一致Spearman ρ 0.96。团队将其称为 text conditioning 的 scaling properties。它不是一个对所有模型都成立的理论定律而是在固定架构与训练 recipe 下得到的经验标定。但它带来了两个直接价值。第一它把 Caption 信息量从一个模糊的 “数据质量” 概念变成了可以控制和测量的训练变量在模型、图像和算力不变时信息量能够预测模型最终达到的训练损失。第二完成一次标定后可以在同一训练 recipe 下先用 GPG 或 ED 比较候选 Caption 方案再决定是否投入昂贵的扩散模型训练。对未参与拟合的六个 Caption 变体两个指标仍能较准确地预测其收敛损失。论文 Figure 7在固定训练 recipe 下收敛损失随 Caption 信息量呈现稳定关系Structured Prompt让信息不仅更多而且更容易被模型使用前面的实验揭示了一个关键点仅仅增加自然语言 prose 并不够新增信息还需要以稳定、明确的方式组织起来。因此团队提出 Structured PromptSP用结构化 JSON 表示一张图像中的视觉变量。它包含三个层次全局层画面意图、场景、氛围、风格、光照和摄影信息元素层每个主体的身份、属性、动作、位置、可选深度和局部摄影信息关系层不同元素之间的位置、遮挡、交互和语义关系。与自由文本相比SP 的关键不只是 “JSON” 这一外观而是让不同视觉变量进入稳定的命名字段减少属性归属、空间关系和对象绑定上的歧义。在固定骨干重建实验中随着 SP 字段逐步恢复重建质量持续提高在完整训练 sweep 中字段覆盖增加也同步提高 GPG、ED并降低收敛后的 diffusion loss。论文 Figure 5Structured Prompt 将全局、元素级和跨元素视觉变量组织到命名字段中为了在大规模训练数据上生成完整 SP团队构建了一套 image-to-SP 标注流水线。通用 VLM 负责全局语义和局部内容Sapiens 补充人体姿态证据DepthAnything V2 提供相对深度SAM 2.1 提供掩码与遮挡线索最后再由 VLM 将这些信息统一整理为一致的完整 SP。论文 Figure 8VLM 与姿态、深度、分割专家共同构建完整 Structured Prompt团队将一个 Caption 表示能够向扩散模型暴露并组织图像监督的能力称为 Diffusability。SP 提升的正是这一侧在不改变扩散模型架构的情况下让模型从文本条件中学到更多、更明确的视觉变量。Promptability有了好的结构还需要 LLM 把它填好训练时可以从配对图像中提取完整 SP但实际生成时只有用户的一句话没有参考图像或 oracle 标注。系统还需要一个 LLM prompter把用户请求扩展成详细、连贯、且不违反原始约束的 SP。团队把这种从用户请求实例化结构化条件的能力称为 Promptability。端到端生成质量取决于两侧共同作用Generation Quality Diffusability × Promptability这里的乘号是一种组织视角而不是拟合得到的数学乘法公式Diffusability 描述扩散模型能够从 Caption 表示中学到什么Promptability 描述 LLM 在推理时能否真正填出高质量的 Caption 实例。论文 Figure 4Structured Prompt 连接标注、测量、diffuser 训练、prompter 训练与最终生成首先团队固定 SP schema 和 Qwen-Image diffuser只替换零样本 LLM prompter。随着 Qwen3.5 从 0.8B 扩展到 397Bthinking 模式下的 GenEval 从 46.4% 提升到 86.8%。除最小模型容易在思考过程中重复并无法输出有效 JSON 外chain-of-thought 在其他尺度上都带来进一步提升。这说明通用 LLM 的模型能力和推理能力可以通过 Caption 接口直接转化为更好的图像生成结果。但零样本 LLM 仍然倾向于生成信息不足、构图较简单的 SP。为进一步提高 Promptability团队采用三阶段训练SFT 学习扩散模型所期望的 SP 内容分布而不只是 JSON 格式Cold-start 从带有配对图像的 privileged reasoning traces 中蒸馏 “如何仅根据用户请求推导 SP”RFT 在 prompter 自己生成并渲染的 rollout 上继续优化由 verifier 筛选高置信轨迹再通过 image-conditioned teacher 的 on-policy self-distillation 提供稠密 token 监督。消融实验表明三阶段承担不同作用SFT 带来最大的单阶段结构提升cold-start 加强从用户请求到 SP 的推导而 verifier-gated OPSD 在 prompter 自身分布上取得最强结果。论文 Figure 9固定 schema 与 diffuser 后生成质量随 LLM prompter 尺度和 reasoning mode 提升论文 Figure 10SFT、cold-start 与 verifier-gated RFT 三阶段 prompter 训练结构化表示也让生成过程更容易迭代修正SP 的字段化表示还有一个自然优势当生成图像出现错误时系统可以定位并修改相应的对象、属性、关系或布局字段而不是重新改写整段自然语言 Prompt。基于此团队构建了 refine-render-judge 循环。每一轮中prompter 根据用户请求和历史反馈生成或修订 SP固定 diffuser 渲染图像在线 judge 再针对 Prompt 遵循、结构和视觉质量给出 PASS/FAIL 与具体问题。若失败下一轮只需围绕相关字段进行调整。实验显示增加迭代预算能够继续提高结构、对齐和 GSB 表现但有效推理长度并不长。对于训练后的 prompter即使允许最多 8 轮平均也只使用 2.31 轮从 Tmax 4 增加到 8收益已经很小。这表明文生图确实受益于迭代纠错但在当前设置下并不需要很长的 prompt-side reasoning trajectory修复主要规格错误后额外轮次会迅速饱和。论文 Figure 14Refine-render-judge 的 agentic 推理循环论文 Figure 15循环能够修正对象拆分、关系和整体布局问题同一套 Qwen-Image结构化接口带来了多大提升最终系统由 SP-trained diffuser 与训练后的 LLM prompter 组成。它在几乎所有报告指标上领先所比较的开源权重模型并在大多数评测上达到或超过所比较的闭源系统优势在组合、推理和世界知识任务上尤其明显。更关键的是 matched control。为了排除 “只是多训练了一些” 的解释团队使用完全相同的 Qwen-Image 架构、训练图像、训练阶段和预算额外训练了一套始终使用自由自然语言 Caption 的系统。结果如下论文 Table 2与代表性文生图系统的完整对比。截图保留论文中的评测定义、加粗与脚注Matched NL 的额外训练确实带来了一些提升但远不足以复现 SP 系统的结果。这说明收益不能简单归因于更大的 backbone 或更多训练而与 prompter 和 diffuser 之间所使用的结构化 Caption 接口密切相关。论文 Figure 11复杂空间关系、数量和属性绑定的定性对比下一步不只是 scale 模型也要 scale 条件本身这项工作的出发点很简单对于文生图模型Caption 不是无关紧要的元数据而是图像内容进入文本条件学习的主要接口。当 Caption 只是变长时新增 token 可能只是改写和铺陈当图像信息被准确提取、清晰绑定并稳定组织时同一个生成模型才能从中学习更多。GPG 和 ED 让这种信息成为可测量的变量Structured Prompt 提高 DiffusabilityLLM scaling、post-training 和短程 agentic refinement 则提高 Promptability。因此文生图的下一步 scaling 不应只关注 “负责渲染的模型有多大”还应关注传递给模型的文本条件究竟携带了多少它真正能够学习和使用的图像信息
返回列表