尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

合成数据>人工数据,绝对性能暴涨超10个点!仅需任务定义,高效微调大模型

合成数据>人工数据,绝对性能暴涨超10个点!仅需任务定义,高效微调大模型 前言基础模型严重依赖大规模、高质量人工标注数据来学习适应新任务、领域。为解决这一难题来自北京大学、MIT等机构的研究者们提出了一种名为「合成数据强化学习」Synthetic Data RL的通用框架。该框架仅需用户提供一个简单的任务定义即可全自动地生成高质量合成数据。结合自动强化学习RL微调的结果显示该方法在数学、医疗科学金融等多个基准上取得十几个点的绝对性能提升。在同等数据数量条件下其效果不仅显著优于人工数据下的监督微调方法更媲美甚至超越了人工数据下的RL方法。尽管如GPT-4和Gemini等基础模型已在通用语言理解方面设立了新的行业标杆 但它们在需要深度领域知识的专业领域中其表现常常不尽如人意。当面临数学、医学、法律及金融等专门任务时这些模型时常表现不佳因为这些领域高度依赖特定的专业知识。传统上为了让这些模型适应特定领域最直接的方法是使用大规模的人类标注数据进行微调。然而这一过程不仅成本高昂、耗时漫长而且在许多实际应用场景中并不可行。为了解决上述挑战北京大学、MIT等机构的研究人员提出了「合成数据强化学习」Synthetic Data RL框架。这是一个简单而通用的框架仅从一个任务定义出发合成大量多样的领域特定样本然后利用强化学习RL对模型进行微调。论文链接https://arxiv.org/pdf/2505.17063代码仓库https://github.com/gydpku/Data_Synthesis_RL这种方式实现了参数化的自适应将领域知识直接嵌入到模型的参数中并且完全无需任何人类标注的数据。三步走实现高效自适应学习研究人员提出的合成数据强化学习框架由三个主要环节构成。图1三阶段方法框架图如图1所示首先系统通过知识引导的合成环节结合检索到的外部知识和任务特定模式生成既有事实依据又与目标任务对齐的合成数据。随后在难度自适应环节系统会根据模型的反馈来调整这些生成样本的复杂度目的是创建一个难度均衡、避免过于简单或困难的数据集。最后在高潜力样本选择与强化学习环节框架会精心挑选出高学习潜力的样本并利用强化学习在这些样本上进行微调。知识引导的数据合成该环节的目标是生成高质量、多样化并与任务高度相关的任务数据。该过程主要分为两个核心步骤关键词****提取与相关段落检索为了让生成的内容能紧密围绕相关领域的知识该环节首先会使用大模型从任务描述中提取一组领域特定的关键词。这些关键词可以看作是一种中间摘要精确地概括了任务的核心领域与要求。接下来一个「段落检索器」会使用这些关键词在一个大型的高质量文本库例如维基百科中进行搜索从而找到一系列与任务高度相关的知识段落。图2GPQA的任务定义包括任务描述输入和输出的形式。在获取了相关的知识段落后LLM生成器便开始合成初始的任务样本集。LLM生成器会综合利用所有信息包括之前检索到的相关段落、抽象模式与具体示例的组合可不提供以及原始的任务指令如图所示来生成初始合成数据集。并通过大多数投票方法确保任务输出的正确性。通过这种方式系统确保了合成出来的数据不仅在事实上有所依据而且在形式和内容上也更加丰富多样。难度自适应过程本环节旨在解决训练样本难度不均衡的问题。核心思想是通过自动评估和改写样本生成一个难度分布更合理的数据集从而提升模型的学习效率和最终效果。整个过程可以分为三个主要步骤1首先使用一个基础模型对初始数据集进行全面评估。根据模型能否正确解答样本被分为两类已解决样本集这个集合包含了所有基础模型能够正确解答的样本。未解决样本集这个集合包含了所有基础模型未能正确解答的样本。2接下来利用一个大语言模型改写器对已分类的样本进行难度调整以扩充数据集。改写器会分析已解决样本集中的内容并在此基础上创造出更具挑战性的新样本形成一个更难的样本集。同样地改写器会分析未解决样本集的内容并创造出难度更低的新样本形成一个「更容易的样本集」。最后将三个部分的数据合并在一起包括原始的初始样本集、新生成的更难样本集、新生成的更容易样本集。通过这个动态调整过程如下图所示最终的数据集在难度上更加多样和均衡更贴合人类真实数据的分布特征能够为模型提供一个平滑的学习曲线从而实现更优的训练效果。图3合成与人工数据难度分布合成数据调整后更贴合人工数据。筛选高潜力样本并强化微调在通过难度自适应策略生成了包含多样化难度的大规模合成数据集后研究人员并不会直接将所有数据用于训练因为许多合成样本可能对模型来说过于简单或过于困难无法提供有效的学习信号。为了最大化训练效率和效果研究人员设计了第三个环节旨在识别并利用那些最具学习价值的「高潜力」样本。为了精准地识别出这些高潜力样本框架设计了一套基于模型实际表现的评分系统。具体来说它会利用基础模型对每个样本进行多次解答尝试。接着系统会计算模型在多次尝试中成功解答的次数比例。这个评分系统有一个巧妙的设计对于那些模型在所有尝试中都失败的「极难」样本即通过率为0系统会故意给它们一个最高分比如1。这样做的目的是为了在后续排序时能够轻易地将这些过于困难/存在合成错误的样本沉底。评分完成后所有样本会按照它们的「通过率得分」从低到高进行排序。根据这个排序结果得分最低但大于0的样本正是我们寻找的「高潜力」目标—模型偶尔能答对但磕磕绊绊充满了不确定性。框架会从排序列表的顶端选取一定数量的样本构成训练集。最后这个精挑细选出的高潜力训练集将被用于对基础模型进行一轮的强化学习训练。最终步骤旨在将模型在这些「临界区」样本上的不确定性转化为稳定的正确解答能力从而产出一个性能得到显著提升的最终模型。全面超越SFT媲美人工数据RL实验设定在数据合成过程中GPT-4o被用作指导者模型而Qwen2.5-7B-base则作为基础模型整个流程的训练集大小也维持在500个数据RL训练采用了GRPO算法 。研究人员在数学、科学、医学、法律和金融等多个领域的8个公开基准数据集上对提出方法进行了全面评估并该方法与多个基线进行了比较包括像Qwen-2.5-7B和GPT-4o这样的预训练和指令调优模型像Self-Instruct和SynthLLM这样的其他合成数据生成方法以及像使用人类标注数据进行监督式微调SFT和强化学习RL这样的标准训练策略。实验结果如表1所示。表1该方法和基线在8个任务上的的表现。具体来看该框架带来全方位的性能提升不仅显著超越了模型自身的基础版本也优于官方的指令微调模型和其他主流的合成数据方法在数学推理领域在广泛关注的 GSM8K基准测试上该方法取得了91.7%的准确率相较于Qwen-2.5-7B基础模型的62.5%实现了29.2%的绝对性能提升。这一成绩不仅显著优于官方指令微调模型Qwen-2.5-7B-Instruct的88.8%也超越了包括Self-Instruct (85.1%) 和SynthLLM (90.1%) 在内的其他合成数据生成方法在更具挑战性的MATH数据集上也获得了8.7%的绝对提升。在专业知识领域该方法的优势同样延伸到了需要高度专业知识的领域。在MedQA医学、CQA法律和 CFA金融等基准测试中分别取得了8.9%、17.7%和13.7%的绝对性能提升。在科学领域在GPQA研究生水平科学问答这一高难度任务上其性能提升同样显著达到了13.1%同等数据预算下的效率优势该框架最引人注目的优势之一在于其极高的数据效率。在与使用「真实」人工标注数据进行训练的方法进行同等数据预算的公平比较时Synthetic Data RL表现出了显著的优势。完胜监督微调SFT当训练预算被限制在相同数量例如500个样本时「合成数据强化学习」方法的效果远超传统的监督微调SFT方法 。例如在GSM8K任务上SFT使用500个人类样本仅能达到74.5%的准确率而该框架则达到了91.7%。这突显了在数据稀缺的情况下RL相较于SFT的普遍优越性。媲美甚至超越人类数据RL更令人印象深刻的是该方法不仅效果好而且效率极高。在使用同等数量500个样本的训练数据时它的表现能够持平甚至略微超过使用「真实」人类标注数据进行训练的强化学习RL方法。在GSM8K任务上使用500个合成样本的准确率91.7%甚至略高于使用500个人类样本的RL91.2%。这一趋势在不同数据预算100、300、1000个样本的消融研究中也得到了证实详情见原文表明该方法始终能与使用人类数据的RL基线相媲美或更优。人工数据指导的边际效益递减表1的研究结果进一步揭示了一个重要现象对模型合成数据而言掌握任务的正确「形式」比学习大量具体「实例」更为关键这一点体现在人类标注数据呈现出的边际效益递减上当模型通过「合成数据强化学习」框架仅从任务定义中学习并掌握了任务的底层结构后其性能已经达到了一个非常高的水平。此时额外增加由人类标注的演示示例所带来的性能提升变得非常有限。例如在GSM8K基准测试上的表现仅使用任务定义进行训练的模型其准确率已经可以达到91.7%在此基础上即便再增加100个高质量的人类演示样本来指导合成数据最终的准确率也仅仅微升至92.1%这种微小的、渐进式的改进并非孤例在其他多个数据集上也观察到了相似的趋势例如在MATH、LogiQA、MedQA和MedNLI等任务上随着人类演示样本的增加性能也只是略有提高 。弱者教出强者另一个有趣的发现是「合成数据强化学习」框架能够让一个相对较弱的指导模型「老师」训练出一个在性能上超越其自身的、更强大的模型「学生」。在相关的验证实验中研究者将原本作为指导模型、性能顶尖的 GPT-4o 替换为能力相对较弱的Qwen-2.5-7B-Instruct模型并由这个「弱老师」来完成生成合成数据和调整难度分布的全部任务。从表1的最后一行结果显示最终训练出的基础模型即「学生模型」在包括GSM8K、GPQA、LogiQA、MedNLI、CQA和CFA在内的六个基准测试中其表现均超越了它的「老师」Qwen-2.5-7B-Instruct模型并在其余两个任务上达到了与之相当的水平。开启模型适应的新范式Synthetic Data RL框架的提出为大模型在专业领域的低成本、高效率适配提供了全新的解决方案。它通过将自动化数据合成与强化学习相结合将模型微调的门槛从昂贵的人工数据标注降低到了一个简单的任务描述无需任何后续的人工标注或反馈。这项工作证明了在无需大量人力投入的情况下依然可以实现高质量、高效率的领域模型定制化使得强大的AI能力适配变得更加规模化和成本可控为未来更广泛的应用如多模态任务奠定了坚实的基础。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表