尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Reasoning with Latent Thoughts — On the Power of Looped Transformers——基于潜在思维的推理:论循环Transformer的力量

Reasoning with Latent Thoughts — On the Power of Looped Transformers——基于潜在思维的推理:论循环Transformer的力量 《Reasoning with Latent Thoughts: On the Power of Looped Transformers》的核心是系统性地论证了循环TransformerLooped Transformer在推理任务上的巨大潜力并挑战了“强大推理能力必须依赖海量参数”的传统观念。以下是文章的全面总结与核心观点概括1. 核心主张四大论点论文通过理论分析和大量实验提出了四个环环相扣的核心主张主张1许多推理问题“要深度但不要参数量”。 像加法、多步回溯、数学推理这类任务本质上是迭代算法因此用同一组参数小模型循环执行多次大深度就能高效解决无需增加参数总量。主张2在语言模型中循环模型具有“偏向推理”的归纳偏置。虽然循环模型的困惑度Perplexity和记忆型任务如闭卷问答表现不如同FLOPs的大模型但它在推理型任务如数学题、开卷问答、推理基元上的表现却出奇地好甚至能超过同FLOPs的大模型。主张3循环模型能生成“潜在思维”并模拟CoT。循环的每一次迭代都相当于一次隐含的“思维步骤”且可以并行处理多个潜在思维。理论上循环模型可以用 T 次循环精确模拟 T 步的思维链CoT推理。主张4受循环启发的正则化能提升推理能力。通过正则化让普通模型的各层权重趋于相似即逼近循环模型可以在不牺牲困惑度的前提下继承循环模型的推理优势。2. 实验验证与关键发现3. 理论支撑第5节群组合问题证明了一个1层循环Transformer用 ⌈log⁡2n⌉ 次循环就能最优地解决n个群元素的组合问题深度上界与非循环最优模型一致。通用模拟定理任何具有 R 个不同层的非循环Transformer都可以被一个1层循环Transformer模拟且深度相同、参数量更少。p-hop问题结合上述定理证明循环模型可以在 O(log⁡p) 深度内解决p-hop问题匹配非循环模型的理论下界。模拟CoT严格证明循环模型可以通过掩码机制在 m 次循环中精确模拟 m 步的思维链推理。4. 主要贡献与创新点视角转换将循环模型从“参数共享的压缩技术”重新定位为“实现深度推理的自然范式”。实证发现首次在大规模语言模型上系统揭示了循环模型在推理与记忆任务上的显著表现差异。理论奠基为循环模型在若干代表性推理任务上的深度最优性提供了严格证明。实用工具提出了一种简单有效的正则化方法可直接应用于现有模型提升推理能力。5. 局限与未来方向推理范围有限实验主要覆盖了符号推理、数学和结构化任务对更开放的常识推理、多模态推理的适用性尚待验证。归纳偏置的根源为何循环或权重共享会带来“偏向推理”的归纳偏置目前仍是一个开放问题。潜力展望作者认为循环模型是“推理时扩展”Inference-time Scaling的一种极具前景的实现方式未来或可像CoT一样通过增加循环次数来动态提升模型在困难问题上的表现。这篇论文有力地证明了“深度”和“参数量”可以解耦——通过循环利用同一组参数小模型也能获得大深度带来的推理能力并在理论和实验上为“循环模型即潜在思维”这一观点提供了坚实支撑。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要大型语言模型已展现出卓越的推理能力且规模定律表明大量的参数尤其是沿深度轴的参数是其主要驱动因素。在这项工作中我们提出了一个更强的主张——许多推理问题需要较大的深度但不一定需要大量参数。这为循环模型在推理方面开辟了一个新的应用。首先我们表明对于许多合成推理任务如加法、pp -跳归纳和数学问题一个 k 层Transformer循环 L 次的性能几乎与一个 kL 层的非循环模型相匹配并且显著优于一个 k 层模型。理论结果进一步证实了这一点表明许多此类推理问题可以通过迭代算法解决因此可以使用具有近乎最优深度的循环模型有效解决。也许令人惊讶的是这些好处也转化到了语言模型的实际设置中——在许多下游推理任务上一个 k 层循环 L 次的语言模型可以与一个 kL 层的语言模型竞争甚至更好。事实上我们的实证分析揭示了一个有趣的现象循环模型和非循环模型表现出的扩展行为取决于它们的有效深度类似于思维链CoT推理的推理时扩展。我们通过证明循环模型隐式地生成潜在思维并且可以用 T 次循环模拟 T 步CoT进一步阐明了与CoT推理的联系。受这些发现的启发我们还提出了推理与记忆之间一个有趣的二分法并设计了一种基于循环的正则化方法在这两方面都有效。1 引言语言模型在解决需要强大推理能力的问题上显示出巨大潜力例如数学、编程、常识推理和逻辑谜题Brown et al., 2020; Team et al., 2023。这激发了人们对开发技术以改进更难题目的推理能力的兴趣Wei et al., 2022b并启发了关于Transformer如何执行推理的理论研究Feng et al., 2024; Sanford et al., 2024a。推理能力通常在更大的语言模型中涌现Wei et al., 2022a——这与各种规模定律Kaplan et al., 2020; Hoffmann et al., 2022; Allen-Zhu Li, 2024相一致这些定律表明语言模型的性能非常依赖于模型大小即参数数量而与其他架构设计选择的关系较小。然而最近的工作开始质疑这一观点。Ye等人2024认为推理的规模定律更为微妙除了参数数量外深度也非常重要——在相同的参数数量下更深但更窄的模型更好。这与传统规模定律的智慧有所偏离但直觉上是合理的因为推理问题通常需要多步骤的组合思维因此深度可以发挥关键作用。在这项工作中我们提出了一个更强的主张——虽然深度很重要但许多推理问题不一定需要大量参数。如何用大深度但少参数来解决推理问题我们认为循环模型非常适合这一点其中相同的函数使用少量参数进行参数化被迭代地应用于输入。这引出了我们的第一个重要主张主张1许多推理问题需要深度但不一定需要参数。也就是说它们可以通过循环模型解决。主张2对于语言建模循环模型具有偏向于良好推理的归纳偏置尽管其困惑度和记忆能力不如等FLOP的非循环模型。对于上述主张我们再次在因果语言建模上训练一个 (k⊗L) 循环模型并将其与等参数 (k⊗1) 和等FLOP (kL⊗1) 非循环基线进行比较。虽然循环模型比等参数基线有所改进但也许并不令人惊讶的是它的困惑度最终比等FLOP基线差因为困惑度强烈依赖于参数数量。然而下游评估揭示了一个有趣的趋势循环模型倾向于改进需要推理的任务其程度远大于记忆任务。具体来说循环模型的推理性能更接近等FLOP基线有时甚至超过它尽管参数少了 LL 倍且困惑度更差。预训练指标和下游指标之间的这种对比行为近来已成为研究课题Saunshi et al., 2022; Liu et al., 2023并归因于不同架构和训练算法引入的归纳偏置。我们的实证分析还揭示了一个有趣的现象下游任务的准确性随有效深度的对数而扩展。特别是更多的循环会提升性能并且循环的相对益处对于需要更多推理的任务更高。这在概念上类似于CoT的推理时扩展但以循环为核心组件。为了进一步阐明循环模型与CoT的这种有趣关系我们提出以下主张。主张3循环模型生成潜在思维并且理论上可以模拟CoT推理。请注意CoT推理通过在答案之前生成多个思维令牌为模型提供了更多时间和计算资源并推动了像O1和DeepSeek的R1这样的“思考”模型的推理时扩展范式Guo et al., 2025。我们对CoT推理做了一个观察——它本质上是一个每次迭代生成1个思维令牌的循环模型。然而循环模型似乎强大得多因为它们可以在每次迭代中生成多个潜在思维。我们将这种直觉转化为一个关于循环模型如何模拟CoT推理的理论结果。受这些发现的启发我们提出了一种正则化方案旨在利用循环模型向推理的归纳偏置。这引出了我们的最终主张主张4受循环启发的正则化可以利用这种归纳偏置来实现更好的推理。在这些主张的背景下我们具体介绍本文的贡献如下在本文中我们研究了循环模型——具有权重共享的多层模型——及其在推理中的作用。特别地我们将 k 层模型循环 L 次表示为 (k⊗L)与等参数的 (k⊗1) 非循环模型k 层和等FLOP的 (kL⊗1) 模型kL 层参数多 L 倍进行比较。我们在第2节中对合成推理任务如加法、p -跳归纳和GSM风格的数学应用题进行了实验。对于这些任务我们惊讶地发现尽管参数少得多等FLOP的循环模型几乎可以匹配或超越非循环模型。支持这些实验的是我们在第5节中提出了理论结果解释了为什么循环模型能够以近乎最优的深度解决此类问题。在第3节中我们在10亿参数规模上训练了用于因果语言建模的循环模型。在这里我们表明循环模型具有在推理基准上表现良好的归纳偏置尽管其困惑度要差得多。这一发现是新颖的因为大多数关于循环的先前工作更关注困惑度指标而非下游推理任务。我们通过可视化训练过程中困惑度与下游性能的关系图来验证这种归纳偏置。此外我们表明循环模型在各种基准上随着循环次数的增加表现出良好的扩展行为类似于CoT推理。最后我们表明循环模型与草稿本结合可以模拟思维链推理。受这种归纳偏置的启发在第4节中我们提出了一种鼓励各层之间更相似的正则化方法。我们发现使用这种正则化进行训练继承了循环模型向推理的归纳偏置而不影响困惑度。2 简单推理任务上的循环模型2.1 简单推理问题的实验表2左图。符号化的 i-GSM 问题及其解答。右图。第2节中 i-GSM 任务上循环和非循环模型的准确率。 (k⊗L) 循环模型显著优于等参数 (k⊗1) 模型并且与非循环等FLOP (kL⊗1) 模型表现一样好。3 使用循环模型进行语言建模在本节中我们预训练并评估用于因果语言模型的循环模型。我们在Pile数据集Gao et al., 2020的250B个令牌上训练模型并针对大多数实验使用24层10亿参数模型其动机来自Tay等人2022中的设置更多详情请参见附录A.2。3.1 10亿参数语言建模实验评估指标。我们在训练完成后评估模型的困惑度指标。由于越来越多的证据表明困惑度虽然在训练中非常有用但却是衡量模型质量的一个狭窄指标我们还跟踪更全面的下游评估Liang et al., 2023。因此我们在4个重要方面评估模型闭卷问答、开卷问答、数学应用题和推理基元。这些总共包含19个不同的任务。表3在Pile数据集上训练的语言模型的下游评估。比较包括24层10亿参数基线模型、不同参数预算 kk 的等FLOP循环模型 (k⊗24/k)以及相应的等参数基线 (k⊗1)。下游评估是在4个任务组内对任务进行平均。我们还为每个 k 包含了 % Gap 指标以衡量循环模型覆盖的等参数基线和等FLOP基线之间的差距参见公式1。总体而言循环模型在困惑度和闭卷问答记忆基准上表现较差但对于需要推理的任务组开卷问答、数学应用题 % Gap 要高得多。事实上对于纯粹测试推理技能的推理基元尽管参数少了 24/k× 倍循环模型在所有 k 上都远优于10亿参数基线。为了更好地理解对推理的影响我们请读者注意表3中推理基元的评估。结果相当显著对于所有 kk 值(k⊗24/k) 循环模型在推理基元上都优于等FLOP基线 (24⊗1)。这先验地非常令人惊讶因为这些是合成生成的任务与预训练数据或模型架构无关。因此解决这些任务必然需要从上下文中进行推理记忆能力在这里无济于事。这些结果清楚地表明循环模型具有偏向于改善推理的偏置尽管其困惑度和记忆能力较差。接下来我们通过等值线图形式化这种向推理的归纳偏置。3.2 向推理的归纳偏置在本节中我们通过绘制Saunshi等人2022引入的困惑度与下游指标等值线图来形式化归纳偏置。第3.1节表明循环模型在推理问题上具有高于预期的性能。然而由于循环模型在困惑度上表现更差很难在各模型之间进行直接比较。使模型间具有可比性的一种方法是查看它们在相同验证预训练损失下的下游性能Liu et al., 2023。Saunshi等人2024提议绘制训练过程中的预训练损失与下游指标的关系图作为研究各种方法归纳偏置的一种方式。对于每个模型我们从120k步开始每20k步评估一次对数困惑度和下游指标。我们将这些值绘制在散点图中并拟合一个线性函数以对数困惑度和相应的下游指标分别为输入和输出。请参考图2和图7以查看两组等值线图。发现。对于所有 kk 值我们观察到以下情况(k⊗L) 循环模型和 (k⊗1) 基线的等值线图在闭卷问答任务上非常一致如果外推的话。这表明对数困惑度是基于记忆的任务的下游性能的一个非常强的指标。对于开卷问答和数学应用题循环模型的等值线总是高于基线模型。这表明在相同的对数困惑度下循环模型在这些需要更多推理的任务上往往具有更高的评估分数。对于推理基元循环模型和基线模型之间存在显著差异。循环模型在训练的大部分时间点似乎都有良好的性能。总的来说这表明循环模型具有强烈的向改善推理的归纳偏置。3.3 中间循环变体及其与渐进堆叠的关系最近Saunshi等人2024引入了一种用于训练语言模型的渐进堆叠Gong et al., 2019; Reddi et al., 2023方法称为MidAS。该方法在训练过程中通过在每个堆叠操作中复制模型的某些层来逐渐增加模型深度。令人惊讶的是他们发现MidAS不仅加速了预训练而且在相同意义上改善了推理——在相同的困惑度下具有更好的推理能力如图2所示。此外该论文通过层复制操作建立了MidAS堆叠与循环模型之间的强联系并推测这是这种归纳偏置的原因。我们前一节的结果为这一推测提供了令人信服的证据表明循环模型也显示出非常相似的归纳偏置从而进一步加强了堆叠与循环模型之间的联系。为什么会出现这种归纳偏置仍然是一个悬而未决的问题我们相信理解这一点是未来研究的一个重要方向。此外受他们发现的启发我们探索了中间循环参见图1的说明——一种循环变体它在网络的起始和结束部分保持独立的层并在中间块上执行循环。Saunshi等人2024的高级直觉是第一层和最后一层在模型中扮演特殊角色因此应与中间层区别对待。在表3中我们报告了一种中间循环版本的结果该版本与 (12⊗1) 基线等参数与 (24⊗1) 基线等FLOP就像 (12⊗2) 模型一样。总体而言我们发现中间循环具有更好的困惑度和比默认循环 (12⊗2) 更均匀的改进除了数学应用题因此可能是一种更实用的循环方法。我们将最佳循环策略的探索留待未来工作。图3随着有效深度的增加各任务组的扩展行为。蓝色曲线显示了使用 (4⊗D/4) 形式的模型在参数不增加的情况下性能如何随循环次数增加而扩展。橙色曲线可视化了 (D⊗1) 的扩展行为后者通过增加新参数来增加深度。对于推理基元循环模型的扩展与基线一样好甚至更好尽管参数少了 D/4 倍。3.4 循环的扩展行为表4第4节介绍的正则化应用前后的24层10亿参数模型的结果。我们尝试了各种块大小 k其动机来自表3中的循环模型设置。总体而言正则化有助于保留向推理的归纳偏置在数学应用题和推理基元上有显著改进而困惑度几乎不受影响。关于循环模型实际上可以模拟CoT推理。鉴于这种与CoT推理的联系循环在更难的推理上能够良好扩展是可信的。我们相信明确利用循环进行推理时扩展是一个非常 promising 的未来方向。4 受循环启发的正则化5 循环模型的理论分析在本节中我们提出理论结果以理解前几节中的现象——为什么参数很少的循环模型能够在推理问题上匹配等FLOP的非循环基线虽然完整的理论具有挑战性因为“推理”是一个非常宽泛的概念但目标是提供一些直觉和对循环模型表达能力的正式化。首先我们证明循环Transformer可以有效地解决群组合问题加法问题的推广。然后我们展示一个非常一般性的结果即具有很少不同层的非循环模型如何可以被循环模型模拟且模型大小仅有小幅增长。这个结果随后被用来使用单层循环Transformer解决 p -跳问题。我们对群组合和 p -跳问题的构造在深度上接近最优并且在参数上比非循环模型高效得多。5.1 预备知识和符号5.2 群组合问题5.3 循环模型可以模拟非循环模型我们的第二个理论结果表明具有重复层的非循环Transformer可以被具有更少参数和相同深度的循环Transformer模拟。5.4 循环模型可以模拟CoT推理在第3.4节中我们讨论了循环模型如何被视为在每次迭代中生成多个潜在思维。以下定理表明可以使用 L 次循环的循环Transformer来模拟具有类似大小的另一个Transformer的 L 步CoT。6 相关工作推理被认为是智能和稳健模型的核心能力因此在过去几年中受到了极大的关注。我们在这项工作中考虑的合成推理问题都已在Sanford等人2024bYe等人2024Sanford等人2024aNogueira等人2021的先前工作中使用以理论分析Transformer的优势和局限性。人们还对Transformer在计算问题上的表示能力感兴趣Liu et al., 2022; Strobl et al., 2023以及思维链推理Merrill Sabharwal, 2023a; Feng et al., 2023; Li et al., 2024。模型深度对性能的必要性已在小型模型Liu et al., 2024和推理Chen Zou, 2024; Ye et al., 2024; Petty et al., 2023方面有所论述。在这项工作中我们做出了更精细的观察即尽管更大的深度是必要的但这可以通过循环在有限的参数预算下实现。Transformer模型中的循环自从Dehghani et al., 2018; Lan et al., 2020的工作以来就已被研究他们分别展示了循环在监督学习任务和BERT预训练中的益处。循环也出现在Schwarzschild et al., 2021; Bansal et al., 2022中研究了循环在某些算法任务上的外推特性。最近Giannou等人2023de Luca Fountoulakis2024研究了循环解码器模型的理论特性并表明循环可以模拟任意图灵机。此外Yang等人2023Gao等人2024Gatmiry等人2024a;b研究了循环模型作为模拟上下文学习迭代算法的一种方式。最近Mohtashami等人2023引入了CoTFormer试图改善循环语言模型的困惑度而Liu et al., 2024探索了用于设备上LLM的延迟效率参数共享。相比之下我们的工作侧重于循环令人惊讶的归纳偏置以改善下游推理任务并超越了算法和上下文学习任务。不同的训练算法例如梯度下降Soudry et al., 2018和架构选择例如注意力Edelman et al., 2022已被证明具有某些隐式偏置。人们对预训练期间的这种归纳偏置越来越感兴趣Saunshi et al., 2022; Liu et al., 2023。最近Saunshi等人2024显示了堆叠Reddi et al., 2023对改善推理的归纳偏置并推测堆叠与循环模型的联系可能是造成这种情况的原因。我们的结果为这一假设提供了进一步的验证。图4左图。思维链推理可以被视为一个循环模型每次迭代产生一个新的思维令牌。新令牌以红色突出显示。右图。循环模型可以并行生成多个潜在思维并且理论上可以通过适当掩蔽更新来模拟CoT推理见定理5.4。7 结论、局限性与未来工作这项工作探索了“用于推理的循环模型”这一新方向。循环模型不仅能够以非常少的参数解决许多推理问题而且它们还具有不成比例地改善语言模型推理性能相对于记忆的归纳偏置。关于循环模型表达能力的理论结果开始为其深度最优性提供一些线索。虽然我们在推理问题的一个子集上测试了循环模型但一个自然的问题是这些结果是否适用于许多其他形式的推理例如多模态和常识推理。特别是对推理问题本身进行简洁的形式化是一个有趣的未来方向。此外在相同困惑度下改善推理性能的归纳偏置非常有趣值得进一步探索。我们发现循环模型的扩展行为非常迷人并且与潜在思维和CoT推理的联系开始为这种行为提供线索。我们希望这能激发未来探索使用循环模型进行更高效的推理时扩展以帮助进行更深层次的推理。
返回列表