尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

谷歌DeepMind如何将一台“逐字打稿机“改造成“整段喷墨机“?

谷歌DeepMind如何将一台“逐字打稿机“改造成“整段喷墨机“? 这项由谷歌DeepMind研究团队主导完成的工作以技术报告的形式于2026年8月4日正式发布论文编号为arXiv:2608.00146v1挂载于计算机科学·计算与语言cs.CL分类下。有兴趣深入了解原始细节的读者可以通过该编号在arXiv平台检索完整报告。**当你在手机屏幕前等待AI回复时究竟发生了什么**每一次你向AI助手提问模型就像一台老式打字机逐个字母、逐个词汇地往屏幕上敲。它必须先敲出第一个字才能决定第二个字敲完第二个字才能考虑第三个字。这种串行工作方式在技术上被称为自回归生成是当前几乎所有主流大语言模型的核心机制。这种机制在学术上十分严谨但它有一个无法回避的物理瓶颈无论你的手机有多好、服务器有多贵每次生成一个词都需要把整个模型从内存里唤醒一遍然后算出这一个词然后再唤醒一遍算出下一个词如此循环往复。这就像让一位厨师每炒一粒米就要打开冰箱门取一次调料——冰箱开关的时间远比炒那粒米的时间长。AI芯片大部分时间都在等待内存把数据传过来而不是在真正思考。谷歌DeepMind的工程师们看着这台不停开冰箱的厨师决定彻底改变烹饪方式。DiffusionGemma就是他们的答案。这个模型不再一个词一个词地往外吐而是一次性规划256个词的完整草稿然后像雕刻师打磨石块一样反复修改这块草稿直到它变成流畅、准确的回答。这种工作方式借鉴了另一个领域的成熟技术——扩散模型diffusion model这种技术此前主要用于生成图片比如让AI从一团噪点中逐渐显影出一张人脸。现在谷歌DeepMind把同样的思路搬到了文字生成上。测试结果显示在单张NVIDIA H100 GPU上DiffusionGemma每秒可以生成约1500个词——是同等规模传统自回归模型的7倍有余即便与配备了专业加速技术的竞争模型相比仍有近5倍的领先优势。更关键的是这一速度并非以牺牲智能为代价换来的在涵盖数学推理、编程、常识问答、多模态理解等多个维度的综合评测中DiffusionGemma的得分依然处于同类文字扩散模型的最前列与部分顶级闭源商业模型形成了真实意义上的竞争关系。---**一、从打字机到雕刻师扩散模型如何处理文字**要理解DiffusionGemma的工作原理先要理解它所依赖的数学基础而这个基础其实可以用一个非常直觉化的比喻来描述——从噪点中显影出答案。传统语言模型在生成文字时遵循一条严格的因果链已知前面所有的词预测下一个词。这条链从左到右不可逆转。如果第三个词说错了后面的词只能将错就错或者靠额外的逻辑绕回来修补就像那位先提交了错误答案、事后发现等等我算错了的学生。扩散模型则完全不同。它的训练过程是这样的给模型看一句完整的好句子然后随机地把其中一些词替换成乱码让模型猜原来是什么词。替换的比例从0%到100%不等模型要学会在不同程度的损坏下重建原始信息。用雕刻的比喻来说扩散模型在训练时看的不是从零开始雕刻而是一块已经七八成成形、但某些地方被人随机凿掉的雕塑请你把缺口补全。在推理即实际使用时模型从一块完全随机的石头——256个毫无意义的随机词——出发一轮又一轮地修改这块石头哪些词已经很确定了就把它们锁定下来哪些词还不确定就让它们继续接受修改。经过平均12轮左右的打磨这256个词就变成了一段连贯、有意义的文字。这里有一个非常关键的技术细节在每一轮修改中模型对256个词的判断是同时进行的而不是一个接一个。这就是为什么它可以这么快——相当于打字机换成了喷墨打印机一次性把整行字喷出来再校对再喷一遍。谷歌DeepMind团队在这个框架下选择了多项式扩散而非掩码扩散。两者的区别在于掩码扩散会把不确定的词位置变成一个特殊的占位符而多项式扩散则是把那个位置换成词汇表里的任意一个词。后者的好处在于即便是已经被锁定的词在后续轮次里依然可以被修改——这让模型拥有了真正意义上的自我纠错能力而不只是从空白处慢慢填满。---**二、站在巨人肩膀上为什么不从零开始训练**创造一个强大的AI模型通常需要用海量文本数据预训练——这个过程代价极其高昂往往需要消耗数百万乃至数千万美元的算力。谷歌DeepMind的工程师们选择了一条更聪明的路从一个已经训练好的优秀模型出发再做针对性改造。他们的起点是Gemma 4一个混合专家架构Mixture-of-Experts简称MoE的语言模型。这个模型总参数量为252亿但每次实际工作时只激活约38.5亿个参数。混合专家架构可以理解为模型内部有128组不同的专家团队每次处理一个词时只有最适合的8组专家会被调用其余的继续休息。这让模型在保持高能力的同时控制了实际计算量。从这样一个已经具备强大语言理解和生成能力的模型出发改造成扩散模型只需要解决一个核心问题原来的模型用的是因果注意力也就是每个词只能看到它前面的词而扩散模型需要双向注意力即一个词可以同时参考它左边和右边的词。这就像把一个只能向前看路的司机改造成可以同时看前方和后视镜的司机。这种改造意味着不能把预训练完全抛掉但也不能完全不动。谷歌DeepMind的解决方案是保留所有原始权重通过后续的微调让模型同时掌握两种注意力模式。编码上下文用户输入的问题时用因果注意力生成回答256个词的画布时用双向注意力。整个训练过程消耗的数据量不到原始预训练的10%大幅节省了计算资源。除此之外DiffusionGemma还继承了Gemma 4的一个特殊组件自我条件化self-conditioning。这个机制让模型在每一轮修改时除了参考当前的噪点草稿还能参考上一轮自己的预测结果。这就像雕刻师除了看眼前的石头还能参考上一刀下去之前自己的设计草图从而做出更连贯的决策。为此模型额外增加了780万个参数专门用于处理这个自我条件化信号。---**三、两阶段训练先学会雕刻再学会快速雕刻**改造完架构之后谷歌DeepMind设计了一套两阶段训练流程每个阶段针对不同的目标。第一阶段叫做监督微调SFT。这一阶段的目标很简单让模型学会扩散的基本功——接收一块部分损坏的石头把它修复成有意义的文字。训练数据从各类文字语料中抽取对每一段文字随机做不同程度的词汇替换然后让模型预测原始词汇。模型输出的预测与真实答案之间的差距被用来调整模型的权重。从实验曲线来看非思考模式的性能提升非常迅速只需完成整个SFT阶段前四分之一的训练量就能达到相当不错的水平而思考模式的学习曲线则要慢得多起步时模型会频繁陷入循环、重复生成同样的词就像一个新手演讲者上台第一次说着说着就卡壳了然后不停重复最后一个词。只有坚持完成完整的SFT训练模型才能稳定地生成连贯的推理链。此后随着训练时间的拉长两种模式的性能均呈现出近似对数线性的稳步提升——投入越多训练效果越好但增速逐渐放缓。第二阶段叫做采样器蒸馏与强化学习SD·RL这才是真正让DiffusionGemma脱颖而出的关键步骤。仅完成SFT的模型在用大量修改轮次比如192轮的情况下效果尚可但如果把轮次压缩到实用的48轮以内生成质量会急剧下降甚至出现严重的重复循环。更糟糕的是一旦模型陷入重复循环它的预测熵衡量不确定性的指标会急剧下降触发自适应停止机制提前结束生成导致模型给出一个空白的答案。这就是在质量和速度之间无法兼顾的困境。SD·RL阶段的设计目标正是同时解决这两个问题。这个阶段让模型用较高的修改轮次生成高质量草稿作为在线教师同时引入强化学习用外部奖励信号比如数学题答对得分、代码通过测试得分来引导模型生成更正确的内容。最关键的是这两个目标被整合进同一个训练目标一次梯度更新同时优化两个方向。训练过程中出现了一个非常有趣的自动加速效应随着强化学习的推进模型的预测越来越有把握每个词位置的预测熵越来越低熵越低自适应停止机制就越早触发停止越早意味着需要的修改轮次越少需要的轮次越少训练数据中就会出现越来越多的短轨迹样本短轨迹样本反过来进一步训练模型快速完成任务。这形成了一个正向飞轮——模型越聪明就越省力越省力就能接受更多训练反馈就变得更聪明。谷歌DeepMind的工程师们发现即使在平均奖励分数不再提升之后继续进行SD·RL训练仍然有价值因为它还在持续压缩每次生成所需的修改轮次。SD·RL完成后模型在GPQA-Diamond研究生级科学题和LiveCodeBench-v6编程题两项测试上的综合得分比SFT完成时提升了10个百分点每次前向传播产出的词数TPF指标从5个提升到近20个速度翻了四倍。此外SD·RL还带来了一个意外的副作用模型变得更加简洁。与SFT模型相比最终版本的输出长度缩短了约一半。这与传统强化学习训练的语言模型相反——传统方法往往鼓励模型写更长的推理链条因为更长的思考链通常意味着更高的得分。谷歌DeepMind认为这种简洁性来源于扩散模型的特殊机制减少总词数直接等于减少修改轮次的工作量而减少工作量是熵降低的自然结果。简洁即速度。---**四、智能采样器如何决定这个词锁定**256个词同时推进修改并不意味着每次修改都对所有词进行同等力度的处理。DiffusionGemma使用了一套精心设计的采样器决定每一轮修改中哪些词可以毕业、哪些词还要继续接受修改。这套采样器的核心思路是按熵排序。熵在这里衡量的是模型对某个词位置的不确定程度——如果模型对位置7的词极其有把握这个位置的熵就很低如果模型对位置23的词拿不定主意这个位置的熵就很高。采样器会把所有词按熵从低到高排序然后从最有把握的词开始逐个锁定直到这一批词的累计熵超过预设阈值0.1为止。超出阈值的那些词会被重新随机化在下一轮重新接受修改。这种机制类似于考试时的答题策略先把最确定的题答上把不确定的题留到后面反复斟酌而不是花一样多时间在每道题上。被重新随机化的词位置相当于被重置为最大不确定性强迫模型在下一轮从更开阔的角度重新考量这些位置避免陷入局部最优解。与此同时采样器还引入了温度退火机制。温度是一个控制生成多样性的参数——温度高模型就更大胆会给低概率词更多机会温度低模型就更保守倾向于选最确定的词。在扩散的早期阶段石头还很粗糙温度设为0.8鼓励模型探索更多可能性随着修改轮次推进温度线性降低到0.4让模型逐渐收敛到最确定的答案。最后采样器还设有自适应停止机制。当连续两轮修改中模型对所有词位置的预测都几乎没有变化平均熵低于0.005且最可能的词序列完全相同就认为这块石头已经雕刻完成不必再等待凑够48轮的上限。这一机制让实际平均修改轮次降至12轮左右等于最大预算的四分之一。不同任务类型在这个维度上表现出了明显差异。简单的数学算术题比如GSM8K平均只需要8到9轮就能停止中等难度的编程题HumanEval需要9到10轮涉及深度推理的研究级科学题GPQA-Diamond需要14到15轮而复杂的竞赛级编程题Codeforces则需要17到18轮。模型自动根据任务难度分配计算量难题多用几轮简单题少用几轮从不偷懒也不浪费。---**五、硬件层面的速度解析每次修改为何只慢3.2倍**DiffusionGemma每次修改要同时处理256个词而传统语言模型每次只处理1个词。按直觉前者应该慢256倍才对。但实际测量显示每次修改只慢了3.2倍。这个数字背后藏着精细的工程优化逻辑。慢下来的主要原因集中在三个环节。第一是混合专家层MoE。传统语言模型每次只激活8个专家而DiffusionGemma处理256个词时平均会激活约84个不同的专家导致这一层的运算时间增加了4.3倍。这并非设计失误而是混合专家架构在高并行度场景下的固有特性——处理的词越多需要请教的专家就越多加载这些专家权重的时间也就越长。如果换成密集架构非混合专家这部分额外开销会减少到不足2倍。第二是采样计算本身。扩散采样需要做256个词的完整概率分布计算、自我条件化向量的矩阵乘法以及在262000个词的词汇表上做softmax操作。这些步骤加起来耗时3.06毫秒而传统语言模型只需0.56毫秒差距约5.5倍。第三是注意力机制。传统语言模型因为一次只处理一个词可以用高度优化的单词注意力核心DiffusionGemma需要在256个词上做完整的双向注意力只能使用普通的FlashAttention-4核心速度慢了约4倍。但另一方面DiffusionGemma每次修改处理256个词同样大幅节省了某些环节的时间。其中最显著的是KV缓存Key-Value Cache的传输——这是AI推理中一个重要的内存带宽消耗来源传统模型每生成一个词都要从内存里读一遍所有历史上下文而DiffusionGemma每生成256个词才需要读一遍节省了大量内存带宽开销。综合计算每次修改比传统语言模型慢3.2倍但每次修改生成约20个词净效率提升约6倍。加上GPU内核的精细调优和CPU-GPU通信的异步化处理最终在单张H100上实现了1456词/秒的实测吞吐量。在多用户并发场景下DiffusionGemma在低并发1到16个并发用户时对每位用户的生成速度以及总体吞吐量均优于配备了多词预测加速技术的Gemma 4。只有在并发用户数超过约32个时传统语言模型才开始在总吞吐量上追赶上来——这是因为高并发时批次越大传统模型的计算效率越高而DiffusionGemma在高批次场景的优化工作尚未完成。---**六、双向注意力的实际价值能反悔的语言模型**除了速度扩散机制还带来了一个传统语言模型天然缺失的能力在生成一段文字时可以根据后面的内容修改前面的词。传统语言模型必须在说出答案的第一个词时就已经押注了答案的大致方向。以一道数学题为例题目要求先给出答案再写推导过程。传统语言模型必须先输出一个答案词然后才开始推导。如果这个答案词猜错了后面的推导过程就会努力自圆其说或者在末尾尴尬地补一句等等我重新算一下。在报告提供的例子中面对题目7×(√(11110)-3)-9?先给答案再推导Gemma 4的传统版本第一个词就输出了-1错误答案整个推导过程在正确计算到-25之后不得不在末尾写道等等重新计算56-81-25。正确答案是-25。整个回答内部自相矛盾。DiffusionGemma面对同样的问题则在第一轮修改时对-1赋予了较高概率但在随后几轮中随着推导过程的词汇逐渐确定位置靠前的答案词也被同步修正为-25。最终输出从第一个词开始就是正确答案推导过程与答案完全吻合没有任何自相矛盾。同样的自我修正能力也体现在逻辑陷阱题目上。面对一个关于青蛙过河的谜题青蛙每次跳5英尺但第20英尺处的荷叶会把它传送回5英尺处问是否能到达25英尺传统语言模型第一个词就输出了是然后在推导中意识到会陷入无限循环最终给出了前后矛盾的回答。DiffusionGemma则在早期修改轮次中赋予是较高概率但随着推导逻辑无限循环在后续词汇中逐渐成形最终修正为不干净利落地给出了正确答案。这种能力在结构化输出任务比如生成符合特定格式的JSON数据上尤为突出。当输出格式被明确规定时大部分词的内容几乎是确定的模型在第一轮修改时就能以83%以上的平均置信度完成大部分词的填写第二轮就能以100%的置信度全部锁定——整个任务只需两轮修改相当于在一秒内完成了传统语言模型需要数十次串行预测才能完成的工作量。---**七、不仅仅快评测成绩究竟如何**速度只是故事的一半。真正有价值的问题是快了之后还够聪明吗谷歌DeepMind在一套覆盖二十个标准评测集的测试体系上对DiffusionGemma进行了全面评估涵盖数学推理AIME 2026竞赛数学题、GSM8K小学数学题、MGSM多语言数学题、Putnam大学数学竞赛题、代码生成LiveCodeBench-v6实时编程题、HumanEval基础编程题、BigCodeBench复杂编程题、科学知识GPQA-Diamond研究生级科学题、多语言理解MMMLU、MMLU-Pro、多模态推理MMMU-Pro涉及图片文字的综合理解以及指令遵循和智能体任务IFEval格式遵循题、Tau-bench模拟真实场景的工具使用题。在开启思考模式即允许模型先做内部推理再输出答案的前提下DiffusionGemma在AIME 2026数学竞赛题上得分69.1分GPQA-Diamond科学题上73.2分LiveCodeBench-v6编程题上69.1分GSM8K基础数学题上96.3分HumanEval基础编程题上94.5分IFEval格式遵循题上97.4分。与其起点——Gemma 4 26B A4B的传统自回归版本——相比DiffusionGemma在大多数项目上有一定的性能损耗。例如Gemma 4传统版本在AIME 2026上得分84.2在GPQA-Diamond上得分79.8在LiveCodeBench-v6上得分71.4。DiffusionGemma付出了约5到15个百分点的性能代价换取了速度上的巨大提升。与同类开源文字扩散模型相比DiffusionGemma的优势则非常明显。LLaDA 2.1 Flash 100B——一个参数量是DiffusionGemma四倍的开源扩散模型——在AIME 2026上得分80分在GPQA-Diamond上得分68.7分在LiveCodeBench-v6上仅得39.4分且需要8张NVIDIA B200 GPU同时工作每秒只能生成375个词。Nemotron Diffusion 14B在GPQA-Diamond上得47分每秒仅能生成49个词差距相当悬殊。与闭源商业扩散模型Mercury 2相比DiffusionGemma的综合评测成绩相当Mercury 2在推理知识类测试上的综合均分约为80分DiffusionGemma约为75.3分在编程类测试上Mercury 2约82.4分DiffusionGemma约76.9分。但在速度上DiffusionGemma达到约1479词/秒而Mercury 2通过公开API估测约为489至600词/秒DiffusionGemma大约快了2.5倍。一个值得特别关注的指标是DiffusionGemma的保留自回归能力。因为它的架构与Gemma 4完全相同训练后的权重可以直接以传统自回归模式加载使用不需要做任何额外改动。以自回归模式运行时DiffusionGemma的性能介于其扩散模式和原始Gemma 4之间——比如AIME 2026得84.2Gemma 4、自回归模式的DiffusionGemma得84.2和扩散模式的69.1之间它的自回归模式得分为84.2几乎与原始Gemma 4相当。这意味着同一套权重文件可以根据任务需求动态切换速度优先用扩散模式质量优先用自回归模式。---**八、开放给所有人开源、微调与下游应用**谷歌DeepMind选择以Apache 2.0许可证开放DiffusionGemma的全部权重这意味着任何人都可以下载、修改、商用没有任何限制。与此同时团队还发布了一套完整的微调工具包允许开发者在自己的数据集上进一步训练模型。微调工具包基于一个叫做Hackable Diffusion的开源研究工具箱支持LoRA低秩自适应技术——这项技术的原理是不修改模型的主体权重只在主体旁边附加一组小型的补丁权重通过调整这些补丁来让模型适应新任务。用装修的比喻来说LoRA就是不拆墙只贴壁纸以极低的成本2块A100 80GB显卡即可完成实现任务适配。作为演示研究团队选择了数独谜题求解作为测试案例。数独是一类典型的非自回归任务——谜题的81个格子之间存在复杂的相互约束关系任何一格的值都可能影响其他格子传统的逐词生成方式在这类任务上有天然的局限。经过LoRA微调rank8仅800万可训练参数DiffusionGemma在4096道测试题上达到了84.4%的准确率同时平均修改轮次从基础模型的40.65轮压缩至10.72轮——因为特定任务的熵天然更低模型更快收敛。未经微调的基础模型在这道题上准确率为0。在医学问答领域PubMedQA微调同样带来了明显提升答案准确率从75.6%提升到76.6%但更关键的是生成的解释性文段质量用BLEU分数衡量从10.76分提升到20.67分提升幅度接近一倍。报告发布后短短数周内已有外部团队将DiffusionGemma部署到具体应用场景中一家公司用它构建了多语言自动语音识别系统另一家医疗科技公司用它开发了放射科报告交互式辅助草拟系统。前者利用了扩散模型并行处理的高效性后者则发挥了模型对高度结构化文本快速收敛的特性。---**九、已知的局限与未来的方向**谷歌DeepMind在报告中坦率地列出了当前版本的已知问题这种透明度对理解模型的实际能力边界非常重要。性能与起点的差距是最显著的局限。DiffusionGemma的整体能力确实低于Gemma 4的自回归版本这源于多重因素的叠加跳过了从零开始的扩散预训练SFT阶段受计算预算限制而偏短SD·RL阶段为追求超低延迟而主动牺牲了部分峰值性能潜力以及模型架构和数据配比本是为自回归优化的不一定最适合扩散范式。过于简洁是SD·RL带来的另一个副作用。模型产出的文字比SFT版本短约一半这让它在某些需要深度思考、长篇论述的任务上表现不如预期。强化学习目标与扩散机制的特性共同驱动了这种简洁性但目前尚未找到在不影响速度的前提下恢复更长输出的方法。偶尔的词汇循环问题在SD·RL之后虽然大幅减少但仍未完全消除。极少数情况下模型会陷入重复生成同一个常见词如the the the的循环这主要发生在修改轮次被压缩到极限的情境下。多模态任务中思考模式有时会丢失闭合标签即思考过程的结束符号导致回答被错误截断。在MMMU-Pro图文综合理解题上这一问题导致开启思考模式的得分54.3分反而低于关闭思考模式的得分66.0分。谷歌DeepMind承认这是在最终发布前发现但来不及修复的问题。高并发吞吐量在32个以上并发用户时逊于传统语言模型配备多词预测这是由于DiffusionGemma的高并发批次优化工作尚未完成例如在高批次下使用top-k截断可以显著提升吞吐但这项优化目前尚未实装。参考实现已同时发布在HuggingFace Transformers和vLLM两个主流推理框架中前者以学术可扩展性为优先后者针对高性能部署优化方便不同需求的用户选用。---归根结底DiffusionGemma做的事情可以用一句话概括它证明了一个已有强大能力的语言模型不需要从零开始重新训练只需一套精心设计的改造方案就可以从打字机变成雕刻师在保持相当智能水平的同时把生成速度提升一个数量级。这种改造的代价确实存在——比起起点模型有一定的性能损耗——但得到的回报同样真实单张消费级服务器GPU上的每秒1500词意味着原本需要一秒才能完成的回答现在只需七分之一秒原本需要一组GPU集群才能服务的并发用户量现在一张卡就能应付。这对于实时语音交互、在线客服、即时代码补全等对延迟极度敏感的应用场景意味着用户体验的质变而非量变。更长远地看DiffusionGemma暗示了一个可能的未来同一套模型权重在空闲时用扩散模式高速生成草稿在关键任务时切换回自回归模式精细推理两种范式协同工作。这条路还很长但门已经打开。有兴趣深入研究的读者可以通过arXiv:2608.00146v1获取完整的技术报告模型权重及微调代码均已在Hugging Face平台公开发布搜索diffusiongemma-26B-A4B-it即可找到。---QAQ1DiffusionGemma是怎么做到比传统语言模型快那么多的ADiffusionGemma一次性处理256个词的草稿通过反复修改来完善内容而不是像传统语言模型那样逐个词输出。平均下来每次修改只需要约12轮每轮虽然比传统模型单步慢3.2倍但同时产出约20个词综合速度提升约7倍。Q2DiffusionGemma的能力比Gemma 4原版弱多少A在大多数测试项目上DiffusionGemma的得分比原版Gemma 4低大约5到15个百分点。例如AIME数学竞赛题原版得88.3分DiffusionGemma得69.1分。不过DiffusionGemma保留了原版的自回归运行能力切换到自回归模式后性能接近原版水平。Q3普通人如何使用DiffusionGemma或基于它开发应用ADiffusionGemma以Apache 2.0开源许可发布任何人可以免费下载和商用。模型权重已上传至Hugging Face平台搜索diffusiongemma-26B-A4B-it谷歌DeepMind同步发布了HuggingFace Transformers和vLLM两套参考实现以及支持在消费级GPU上微调的LoRA工具包。
返回列表