尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Qwen3 Embedding系列重磅上线:多阶段训练打造高效文本嵌入与重排序能力,覆盖0.6B至8B多种尺寸

Qwen3 Embedding系列重磅上线:多阶段训练打造高效文本嵌入与重排序能力,覆盖0.6B至8B多种尺寸 Qwen3-Embedding 系列模型Qwen3-Embedding 系列模型,Qwen3-Embedding 系列模型是 Qwen 模型家族的全新成员专为文本表征、检索与排序任务而设计。该系列模型基于 Qwen3 基础模型进行训练全面继承了其在多语言文本理解方面的强大能力。关键特性卓越的泛化性能Qwen3-Embedding 在多个下游任务评估中表现优异达到了行业领先水平。其中8B 参数规模的 Embedding 模型在 MTEB 多语言 Leaderboard 榜单中排名第一截至 2025 年 6 月 6 日得分为 70.58性能超越众多商业 API 服务。此外该系列排序模型在各类文本检索场景中表现出色显著提升了搜索结果的相关性与准确性。灵活的模型架构Qwen3-Embedding 提供了从 0.6B 到 8B 的三种参数规模配置以满足不同应用场景对性能与效率的需求。开发者可以根据实际需求灵活组合表征模块和排序模块实现功能扩展。同时模型支持以下定制化功能表征维度自定义MRL Support用户可根据具体需求调整向量输出维度从而降低计算与存储成本。指令适配优化Instruct Aware支持自定义任务指令模板提升特定任务、语言或场景下的模型表现。全面的多语言支持Qwen3-Embedding 支持超过 100 种语言涵盖主流自然语言及多种编程语言具备强大的多语言处理、跨语言检索以及代码检索能力能够高效应对复杂的国际化和多语种数据处理需求。模型结构Embedding 模型采用双塔结构设计适用于大规模文本检索与匹配任务。Reranker 模型采用单塔结构用于对候选结果进行精细化排序。通过 LoRA 微调技术Qwen3-Embedding 系列模型最大限度地保留并增强了基础模型的语言理解能力。性能测试说明测试基准包括MTEB(eng, v2)、MTEB(cmn, v1)、MTEB(Multilingual) 和 MTEB(Code)分别记作 MTEB-R、CMTEB-R、MMTEB-R、MTEB-Code。排序任务基于 Qwen3-Embedding-0.6B 的 top-100 向量召回结果进行评估。开源与部署目前Qwen3-Embedding 系列模型已在 Hugging Face、ModelScope 和 GitHub 平台开源。用户也可以通过阿里云百炼平台获取最新的文本向量模型服务快速集成到各类 AI 应用中。模型架构基于 Qwen3 基础模型Embedding 模型和 Reranker 模型分别采用了双塔结构和单塔结构的设计。通过 LoRA 微调最大限度地保留并继承了基础模型的文本理解能力。具体实现如下Embedding 模型接收单段文本作为输入取模型最后一层_「EOS」_标记对应的隐藏状态向量作为输入文本的语义表示为了确保在下游任务中嵌入能够遵循指令将指令和查询拼接为一个单一的输入上下文而文档在处理之前保持不变。查询的输入格式如下{指令}{查询}|endoftext|Reranker 模型则接收文本对例如用户查询与候选文档作为输入利用单塔结构计算并输出两个文本的相关性得分。为了更准确地评估文本相似性使用 LLM 进行单个上下文内的逐点重排序。与嵌入模型类似为了实现指令遵循能力在输入上下文中包含指令。使用 LLM 的聊天模板并将相似性评估任务视为一个二分类问题。输入到 LLM 的模板如下所示|im_start|system 根据提供的查询和指令判断文档是否符合要求。注意答案只能是“是”或“否”。|im_end||im_start|user指令:{指令}查询:{查询}文档:{文档}|im_end||im_start|assistantthink/think模型训练Qwen3-Embedding 系列模型的训练继承了 GTE-Qwen 系列的多阶段训练范式但针对具体应用场景进行了深度优化。在 Embedding 模型的训练过程中采用三阶段训练架构第一阶段通过超大规模弱监督数据进行对比学习预训练第二阶段基于高质量标注数据进行监督训练最终通过模型融合策略融合多个候选模型以提升整体性能。这种分阶段训练机制有效平衡了模型的泛化能力与任务适配性。在 Reranker 模型的训练中基于实验验证结果直接采用高质量标注数据进行监督训练以提升训练效率。特别需要说明的是在 Embedding 模型的第一阶段弱监督训练中构建了多任务适配的 Prompt 体系利用 Qwen3 基础模型的文本生成能力针对不同任务类型和语言特性动态生成了一系列弱监督文本对突破了传统方法依赖社区论坛或开源数据筛选获取弱监督文本对的局限性实现了大规模弱监督数据的高效生成。Qwen3 嵌入系列引入了以下关键创新大规模合成数据驱动的弱监督训练与以往工作例如 GTE、E5、BGE 模型不同这些模型的弱监督训练数据主要从开源社区如问答论坛或学术论文收集我们提出利用基础模型的文本理解和生成能力直接合成配对数据。在监督微调中使用高质量合成数据由于 Qwen3 基础模型的卓越性能合成数据的质量非常高。因此在第二阶段的监督训练中选择性地引入这些高质量合成数据可以进一步提升模型的整体性能和泛化能力。模型合并受以往工作的启发在完成监督微调后我们应用了基于球面线性插值slerp的模型合并技术。该技术涉及合并微调过程中保存的多个模型检查点。这一步旨在增强模型在各种数据分布上的鲁棒性和泛化性能。快速使用Embedding Model 使用方法tokenizerAutoTokenizer.from_pretrained(Qwen/Qwen3-Embedding-8B,padding_sideleft)modelAutoModel.from_pretrained(Qwen/Qwen3-Embedding-8B)# We recommend enabling flash_attention_2 for better acceleration and memory saving.# model AutoModel.from_pretrained(Qwen/Qwen3-Embedding-8B, attn_implementationflash_attention_2, torch_dtypetorch.float16).cuda()eod_idtokenizer.convert_tokens_to_ids(|endoftext|)max_length8192# Tokenize the input textsbatch_dicttokenize(tokenizer,input_texts,eod_id,max_length)batch_dict.to(model.device)outputsmodel(**batch_dict)embeddingslast_token_pool(outputs.last_hidden_state,batch_dict[attention_mask])Reranker Model 使用方法tokenizerAutoTokenizer.from_pretrained(Qwen/Qwen3-Reranker-0.6B,padding_sideleft)modelAutoModelForCausalLM.from_pretrained(Qwen/Qwen3-Reranker-0.6B).eval()# We recommend enabling flash_attention_2 for better acceleration and memory saving.# model AutoModelForCausalLM.from_pretrained(Qwen/Qwen3-Reranker-0.6B, torch_dtypetorch.float16, attn_implementationflash_attention_2).cuda().eval()token_false_idtokenizer.convert_tokens_to_ids(no)token_true_idtokenizer.convert_tokens_to_ids(yes)max_length8192prefix|im_start|system\nJudge whether the Document meets the requirements based on the Query and the Instruct provided. Note that the answer can only be \yes\ or \no\.|im_end|\n|im_start|user\nsuffix|im_end|\n|im_start|assistant\nthink\n\n/think\n\nprefix_tokenstokenizer.encode(prefix,add_special_tokensFalse)suffix_tokenstokenizer.encode(suffix,add_special_tokensFalse)taskGiven a web search query, retrieve relevant passages that answer the queryqueries[What is the capital of China?,Explain gravity,]documents[The capital of China is Beijing.,Gravity is a force that attracts two bodies towards each other. It gives weight to physical objects and is responsible for the movement of planets around the sun.,]pairs[format_instruction(task,query,doc)forquery,docinzip(queries,documents)]# Tokenize the input textsinputsprocess_inputs(pairs)scorescompute_logits(inputs)最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表