
前言前一章思维链基础和进阶玩法我们介绍了如何写Chain-of-thought Prompt来激活生成逐步推理并提高模型解决复杂问题的能力这一章我们追本溯源讨论下COT的哪些元素是提升模型表现的核心要进行因果分析需要把思维链中的不同元素拆解开来然后通过控制变量实验来研究不同元素对COT效果的影响。以下两篇论文的核心差异就在于: COT的变量拆解以及控制变量的实验方式。结合两篇论文的实验结论可能导致思维链比常规推理拥有更高准确率的因素有思维链的推理过程会重复问题中的核心实体例如数字人物数字等思维链正确逻辑推理顺序的引入友情提示以下论文的实验依赖反事实因果推断这种因果分析方式本身可能存在有偏性进而得到一些错误结论读论文有风险迷信论文需谨慎哈哈~TEXT AND PATTERNS: FOR EFFECTIVE CHAIN OF THOUGHT IT TAKES TWO TO TANGO测试模型PaLM-62BGPT3CODEXgoogle这篇论文比较早按个人阅读舒适度来划分个人更推荐第二篇论文哟~COT元素论文把影响元素拆分成了TextSymbol和Pattern三个部分, 如下论文给出了symbol和pattern的定义剩下的token全是Textsymbol:是数据集的核心主体数学问题就是数字,SPORT数据集就是运动员和运动项目, DATE数据集就是时间这里的symbol类似实体的概念pattern: 可以是symbol的组合连接符(公式)或者帮助模型理解任务的表述结构。这里允许pattern和symbol重合也就是整个公式是pattern但公式中的数字同样是symbol。但在非数学问题上我个人觉得pattern的定义有点迷幻…实验论文针对以上3个元素分别进行了实验通过改变COT few-shot prompt中特定元素的取值来分析该元素对COT效果的贡献观点1.Symbol的形式和取值本身对COT影响不大这里论文用了两种控制变量的方式symbol随机采样和特殊符号替换特殊符号替换(symb_abs)abstract symbol就是用特殊符号来替换symbol这里作者同时替换了questionprompt和answer里面的symbol如下随机替换(symb_ood)OOD类似随机替换不过论文的替换方式有些迷幻。对于GSM8k数学问题作者用一一对应的数学数字替换了文字数字;对于体育常识问题的替换比较常规作者用随机的人名和赛事进行替换;对于时间常识问题作者用未来时间替换了当前时间??注意这里的替换作者保证了推理逻辑的一致性包括同一数字用同一symbol替换替换实体也符合推理逻辑以及对问题中的答案也进行了替换。所以这里纯纯只能论证symbol本身的取值和类型(例如数字1和一)是否对COT有影响abstract symbol就是用特殊符号来替换symbol这里作者同时替换了questionprompt和answer里面的symbol如下这种替换方式下的实验结果如下除了体育问题中的随机实体替换其余symbol的替换对COT的效果影响都非常有限。这让我想到了一篇关于NER模型的泛化性主要来自模型学会了不同类型的实体会出现在哪些上下文中而不仅是对实体本身的形式进行了记忆。他们的实验方式和作者替换symbol的操作其实很类似这种替换并不大幅影响下文对上文的Attention。观点2. pattern是COT生效的必要不充分条件对于Pattern作者更换了实验方式控制变量采用了只保留pattern和只剔除pattern这两种实验类型。以数学问题为例只保留pattern就是推理过程只保留数学公式只剔除pattern就是整个推理过程只把公式剔除。其余问题类型考虑在前面的pattern定义阶段个人就感觉有些迷幻… 所以我们直接跳到实验结论吧只有pattern的COT效果很差和直接推理差不多说明只有patten肯定是不够的这和上一篇博客提到COT小王子尝试过的只有数学公式的COT效果不好的结论是一致的。剔除pattern的COT效果受到影响因此pattern对COT有显著影响但很显然还有别的因素观点3. 推理出现问题中的关键实体且和问题保持格式一致很重要最后针对Text部分作者采用了实体替换和语法替换实体替换(text_diff_entities)把推理中的实体随机替换成和问题中不一样的实体包括数学问题中的数字常识问题中的时间地点和任务。个人感觉这应该是symbol的实验- 语法替换(text_yoda_thought): 把常规的英文表达改成了Yoda的说法风格。Yoda是按照名词-形容词-动词顺序来说话的。例如常规是This is my homeYoda会说My home this is。只对thought进行语法替换question保持正常的英文表达。效果上随机实体替换对所有任务的COT效果影响非常大, 所以在推理阶段使用Question中的核心实体很重要。其次推理和question在语法上的不一致会影响COT在部分任务上的表现。Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters测试模型text-davinci-002 text-davinci-003整体上第二篇论文的思路更简单清晰在拆解元素的同时还定义了关系。COT元素论文首先定义了思维链中的两种核心元素Bridge Object: 模型解决问题所需的核心和必须元素。例如数学问题中的数字和公式QA问题中的实体有点类似把论文1中pattern和symbol和在了一起感觉定义更清晰了Language Template除去Bridge Object剩余的部分基本都是Language Template其次定义了思维链的两种核心关系一致性Coherence 推理步骤之间的逻辑顺序, 先说什么后说什么相关性Relevance Question中核心元素是否在推理中出现实验论文的消融实验通过人工修改few-shot COT中的few-shot样本来验证思维链中不同元素的贡献这里我们以一个数学问题问题为例看下实验的两个阶段观点1. 完全正确的COT并非必要第一步作者证明了完全正确的In-Context样本并不是必须的用的什么方法嘞如下图所示作者手工把正确的In-Context COT样本改写成错误的改写方式是在保留部分推理顺序和部分bridge object的前提下随机的把推理改成错误的推理逻辑。作者发现魔改后错误的few-shot的样本对比正确的few-shot-cot保留了80%的水平只有小幅的下降。观点2.推理顺序和核心元素的出现更重要既然完全正确的COT样本并非必须那究竟思维链的哪些元素对效果的影响最大呢针对以上两种元素和两种关系作者用了数据增强的方式来对few-shot样本进行修改得到破坏某一种元素/关系后的few-shot样本破坏相关性: 这里使用了Random Substitution; 针对Bridge Obejct就是固定文字模板把数学问题中出现的数字在COT里面(32/42/35)随机替换成其他数字这里为了保持上下文一致性相同的数字会用相同的随机数字来替换; 针对template就固定Bridge Object从样本中随机采样其他的COT推理模板来进行替换。破坏一致性: 这里使用了Random Shuffle针对Bridge Object就是把COT中不同位置的Bridge Obejct随机打乱顺序针对Template就固定Bridge Object把文字模板的句子随机改变位置。整体效果如下图论文正文用的是text-davinci-002附录里也补充了text-davinci-003的效果看起来003的结果单调性更好二者结论是基本一致的因此这里我们只看下003的消融实验效果可以得到以下几个核心结论对比COT推理的正确性相关性和一致性更加重要尤其是相关性。也就是在推理过程中复述question中的关键信息可以有效提高模型推理准确率。个人猜测是核心元素的复述可以帮助模型更好理解指令识别指令中的关键信息并提高该信息对应的知识召回【这一点我们在下游难度较高的多项选择SFT中也做过验证我们在多项选择的推理模板的最后加入了题干的复述效果会有一定提升进一步把选项的结果完形填空放到题干中效果会有更进一步的提升】Language Template的一致性贡献度较高。也就是正确的逻辑推理顺序有助于模型推理效果的提升。这一点更好理解主要和decoder需要依赖上文的解码方式相关。【还是多项选择的指令微调我们对比了把选项答案放在推理的最前面和放在复述题干之前的效果都显著差于先推理分析复述题干并填入选项答案最后给出选项答案这个推理顺序】最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。四、AI大模型商业化落地方案五、面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】