尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

阿里巴巴与中科院联手打造“瑞士军刀“

阿里巴巴与中科院联手打造“瑞士军刀“ 这项研究由阿里巴巴集团、中国科学院自动化研究所及中国科学院大学、耶鲁大学联合完成论文编号为arXiv:2608.02583发布于2026年8月4日。有兴趣深入了解技术细节的读者可通过该编号在arXiv平台查阅完整原文。当你在搜索引擎里敲下北京最好吃的火锅背后发生的事情远比你以为的复杂。搜索系统需要在几毫秒内从数以亿计的网页里找出最相关的结果。这个过程依赖两种截然不同的查找方式而这篇论文做的事情就是把这两种方式塞进同一个模型里还顺手把文字之外的图片、视频也一并处理了。在正式进入故事之前有必要先解释一下这两种查找方式究竟是什么。把它们想成图书馆的两种找书方法第一种是稀疏检索类似于传统的索引卡片柜你按关键词找词能对上就能找到对不上就一无所获——这种方法快且精准但一旦你用汽车搜索它不认识轿车第二种是稠密检索类似于一位博学的图书管理员他理解语义知道汽车和轿车是一回事但他工作起来更慢而且没法直接告诉你他是怎么想的。现有的系统要么只用一种方法要么需要两套独立的系统分别运行。这项研究的主角——UEmbed统一嵌入模型——就像是把这两位图书馆员合并成了一个人让他既能快速翻卡片柜又能深度理解语义而且还能看懂图片和视频内容。更关键的是这个合体图书员只需要过一遍材料就能同时给出两种检索所需的信息不用跑两趟。一、为什么现有方案总是顾此失彼要理解UEmbed的价值得先看清楚现有方案卡在哪里。传统的稀疏检索方法以BM25为代表本质上就是统计词频——你的查询词在文档里出现几次、出现在什么位置决定了相关性得分。这个方法极其高效数十年来在工业界大量部署但它的致命弱点是不懂语义。一张白纸和空白页面在它眼里是两码事尽管意思完全一样。为了弥补这个缺陷研究者们发展出了学习型稀疏检索Learned Sparse RetrievalLSR其中SPLADE系列模型最具代表性。这类方法用神经网络来赋予词汇权重不仅能重新分配已有词的权重还能扩展出原文没有的相关词汇——比如看到笔记本电脑它能自动联想到laptop、电脑等词一并编入索引。这大幅提升了稀疏检索的语义理解能力。然而SPLADE这类方法有一个根深蒂固的架构限制它们依赖双向注意力机制就是BERT那类能看前后文的模型。近年来最强大的大语言模型——GPT、Llama、Qwen等——都是解码器-only架构也就是单向的每个词只能看到它前面的词看不到后面的。这种单向性带来了极大的效率优势和强大的生成能力但也使得直接套用SPLADE的方法行不通。之所以行不通是因为SPLADE的做法是把所有词的隐藏状态都投影到词汇空间然后取最大值作为每个词的权重。这个操作在双向模型里天然合理——每个位置都看过全文。但在单向模型里靠前的词只看到了前面的内容信息是残缺的用它来代表全文显然不妥。过去也有人尝试解决这个问题但方案都不够优雅要么把单向模型改造成双向的损失了单向架构的部署优势要么设计复杂的两阶段训练课程增加了额外成本。多模态方面更是几乎空白——现有的多模态稀疏检索方法通常要加一个专门处理图片的辅助模块结构复杂扩展性差。正是这三重困境——架构限制、模态局限、实用性未被充分探索——催生了UEmbed的诞生。二、分切词汇表一个看似简单却极为巧妙的解法UEmbed的核心创新可以用一个烹饪学校的比喻来理解。假设一所烹饪学校有一本厚厚的食材百科全书收录了20万种食材。学校只有一位大厨他的任务是读完一份菜谱后从这本百科全书里标注出所有相关食材。问题是20万个词条太多了一个人根本记不住全部更别说同时给所有词条打分了。UEmbed的解法是不派一位大厨而是派16位助理厨师每人只负责大约1.25万种食材20万÷16。每位助理读完整份菜谱然后在自己负责的那部分食材里打分。最后把16位助理的结果拼在一起就是完整的评分向量。这个比喻对应的技术方案如下在输入序列的末尾附加16个专门设计的特殊令牌可以理解为16位助理的身份牌。由于是单向模型这16个令牌排在所有内容之后因此每个令牌都能看到它前面的全部内容也就是完整的输入。然后词汇表被划分为16个互不重叠的子集每个特殊令牌负责一个子集预测其中每个词的权重。16个子集的结果拼接起来形成完整的稀疏向量。这个设计巧妙地绕开了单向架构的信息瓶颈。在传统方法里用单个EOS序列结束标记去投影整个词汇表就像让那唯一的大厨独自搞定20万份评分信息压缩率太高、表达能力有限。而分散到16个令牌后每个令牌只需要专注于约1.25万个词任务轻松多了也更能专注。词汇表的划分方式同样经过精心设计。研究团队没有随机分配而是用K-means聚类算法把词汇按语义相似性分组——意思相近的词被分到同一个子集里。这样每个特殊令牌就成了某个语义方向上的软性专家比如一个令牌专门负责与运动相关的词汇另一个专门负责科技相关词汇。实验证明这种语义聚类的分法优于随机分配和刻意最大化距离的分法。在正式训练之前研究团队还对词汇表做了一步压缩处理。现代大语言模型的词汇表往往存在大量近亲词——比如Hello、HELLO、héllò在语义上完全一致却占据不同位置。通过去重音符号、统一小写、折叠空白字符等标准化操作词汇表从24.8万个条目压缩到18.4万个。评分时同一组词只保留最高权重既节省了空间也避免了权重分散。稠密检索的部分则更为简洁直接取那个位于16个特殊令牌之前的EOS令牌的隐藏状态作为代表整段内容的稠密向量。当用户只需要稠密检索时16个特殊令牌完全可以省去没有任何额外计算开销。两种检索模式共用同一次前向计算一次推理两份结果。三、训练这个全能选手需要哪些原料理解了架构之后再来看看训练过程——因为一个好的设计需要好的训练数据和合适的优化目标才能真正发挥作用。训练数据来自三个公开数据集的混合。文本数据方面使用了Echo-Embedding训练数据覆盖广泛领域的查询-文档对和MLDR训练数据专注于长文档检索多模态数据方面使用了MMEB训练集涵盖图像分类、视觉问答、图文检索、视频理解、视觉文档检索等多种任务。最终混合比例大致是文本39.3%、图像27.1%、视频21.4%、视觉文档12.2%总计394万条样本。训练目标由四个部分组成。稠密检索的对比学习损失用余弦相似度衡量查询和正样本的相似性并拉开与负样本的距离、稀疏检索的对比学习损失用内积衡量稀疏向量的相似性、对查询稀疏向量的FLOPS正则化鼓励稀疏性减少非零激活、对文档稀疏向量的FLOPS正则化。这四个目标通过可调权重平衡其中稀疏和稠密的对比损失权重设为相等。负样本的质量对稀疏检索的训练至关重要——如果只用随机负样本模型很容易躺平学不到精细区分的能力。研究团队用Qwen3-VL-Embedding-8B作为教师模型对每个查询从语料库里检索出最相似但并不相关的文档作为困难负样本迫使模型真正学会辨别细微差异。训练的稳定性是一个实际挑战因为稀疏向量的内积范围远大于稠密向量的余弦相似度后者被限制在-1到1之间。研究团队发现混入文本训练数据能显著加速和稳定多模态稀疏模型的收敛——仅用图像和视频数据训练时模型需要约500步才能开始稳定区分正负样本加入文本数据后这个过程在100步内就能完成。在超参数方面稀疏检索使用了比稠密检索大得多的温度值τs32稠密为0.03。这是因为稀疏内积的数值范围很大如果用同一个温度会导致softmax过于尖锐训练不稳定。实验证明解耦两个温度并给稀疏端用更大的值能显著提升稀疏检索性能同时不影响稠密端。特殊令牌的数量设为16实验显示这是性能和计算开销之间的最佳平衡点——增加到32时性能反而下降因为每个子集太小序列也变得更长。研究团队在16到32张A100 GPU上训练了2B、4B、9B三个规模的模型基座模型使用Qwen3.5系列参数只通过LoRA方式微调只训练注意力和MLP投影层视觉编码器冻结不动。四、跑分结果在多模态排行榜上的表现说了这么多原理到底效果如何研究团队在两个主要评测平台上进行了测试。第一个是MMEB-v2这是目前最全面的多模态嵌入评测基准包含78个子数据集覆盖图像分类、视觉问答、图文检索、视频理解、视觉文档检索等几乎所有重要场景。在这个平台上UEmbed-9B的稠密检索得到71.8分稀疏检索得到71.0分——两者相差不到1分这是最令人印象深刻的结果之一因为此前几乎没有模型在多模态场景下同时跑过稀疏检索。对比已知的公开数据训练模型UEmbed-9B稠密超越了RzenEmbed-V2-7B71.1分和Ops-MM-Embed-7B67.1分。更有趣的是UEmbed-2B稠密66.5分甚至超过了一些7B规模的开源基线比如UniME-7B64.1分——小身材发挥出了超越体量的性能。唯一在总分上更高的是Qwen3-VL-Embedding-8B77.8分但研究团队在论文中明确指出该模型经过了大规模私有数据的多阶段训练本质上不是同一赛道的比较。通过进一步的错误分析团队发现UEmbed落后的主要场景在于细粒度视觉识别如ImageNet-A、SUN397、视频中的动作识别和长视频推理、以及多语言视觉文档。这些差距大多源于训练数据的覆盖不足而非架构本身的限制。从各大类别的分布看UEmbed的稀疏模型在视觉文档VisDoc任务上与稠密模型几乎持平9B模型稀疏79.1 vs 稠密79.2这与稀疏检索天然擅长处理结构化、关键词密集型文档的直觉吻合。相比之下在视频类别上稀疏模型相对稠密模型的差距略大这也符合预期——视频帧里几乎没有可以精确匹配的词汇信息稀疏检索的优势难以发挥。第二个测试平台是BEIR这是文本检索领域最主流的基准研究团队选取了其中9个代表性数据集进行评测使用nDCG10排名靠前的结果质量综合指标衡量。在稠密检索端UEmbed-9B以56.3分的均值领先超过了Qwen3-VL-Embedding-8B55.5分和GME-7B53.5分。在稀疏检索端UEmbed-9B以55.2分与Echo-Mistral-SPLADE55.2分持平——而后者是专门为稀疏检索设计的专用模型UEmbed在同时支持稠密、稀疏、多模态的前提下达到了相同水平这意味着通用性的代价几乎为零。五、实用价值三个让这个研究走出实验室的场景评测数据之外研究团队还专门探索了UEmbed在三个实际场景中的价值这也是这项工作相对于纯学术研究更有落地意义的部分。第一个场景是混合评分——把稠密和稀疏的结果线性加权合并看能否进一步提升效果。结果显示在文本检索和视觉文档检索上混合评分分别提升了0.3分和0.5分对图像和视频类型则提升幅度微乎其微。这个模式与常识吻合文字密集的内容比如一篇论文或一份表格既有关键词可以精确匹配又有语义关系需要理解两种检索各自贡献了互补的信息而一张风景照或一段舞蹈视频词汇层面几乎没什么可抓的稀疏向量自然贡献有限。混合评分最大的优势是零额外成本——因为两个向量来自同一次推理。第二个场景是部署效率。UEmbed的架构保留了纯自回归特性这意味着它可以直接接入vLLM等高吞吐量推理框架充分利用已有的优化基础设施。与此同时生成的稀疏向量可以直接对接Lucene等倒排索引系统不需要任何转换或适配。研究团队做了一个粗略的对比实验展示了稀疏检索在不同激活词数量上的速度-效果权衡曲线减少每个查询的激活词数量从512减到64检索延迟从约100毫秒降到约20毫秒而NDCG5从约0.14降到约0.02。这个权衡曲线让工程师可以根据实际场景灵活调整在响应速度和检索质量之间找到最合适的平衡点。第三个场景最为有趣智能体搜索。当大语言模型作为智能助手反复调用搜索工具来完成复杂任务时它通常会发出短而关键词密集的查询——这恰恰是稀疏检索最擅长的领域。研究团队用BrowseComp-Plus基准测试了这个场景这个基准模拟的是一个大语言模型智能体通过多轮搜索来回答复杂问题的过程用DeepResearch-30A3B作为推理引擎。结果显示稀疏模式下的UEmbed在每个问题平均需要的搜索轮次上始终少于稠密模式。以9B模型为例稠密模式平均需要33.68轮搜索稀疏模式只需31.05轮在最终准确率相同的情况下减少了约8%的工具调用次数。在成本敏感的生产环境里每次API调用都有成本减少搜索轮次意味着实际的金钱节省。这个结果也验证了一个反直觉的观点并不是更聪明的稠密检索在所有场景下都更好关键词驱动的查询配上稀疏检索效率反而更高。六、消融实验每个设计选择都经过了验证任何严谨的研究都需要回答一个问题你说这些设计有用是真的有用还是看起来有用UEmbed的研究团队通过一系列对照实验来回答这个问题。关于联合训练是否会导致两个模式相互拖累实验结果是否定的。单独只训练稠密检索的模型和联合训练后的稠密端在MMEB-v1上几乎得分一致64.6 vs 64.5稀疏端同样如此63.0 vs 63.4。两种模式在同一个模型里共存基本没有互相拖后腿的现象。关于使用单向模型是否真的比双向SPLADE更好研究团队用完全相同的Qwen3.5基座、相同训练数据、相同FLOPS正则化只是把注意力换成双向的并用标准SPLADE的max-pooling头得到一个对照组。UEmbed-2B在稠密端比这个对照高3.2分稀疏端高2.1分。差距最显著的是图像问答类任务稠密高8.2分稀疏高6.0分说明保留自回归模型天然的问答推理能力对多模态嵌入是真实有益的而不仅仅是带来了部署上的便利。关于词汇分区策略随机分配63.0分、最大距离聚类63.2分、语义聚类63.4分语义聚类最优。差距虽然不大但方向一致让每个特殊令牌专门负责一组语义相关的词汇比随机打散效果更好。七、局限性与这个模型还不擅长什么研究团队在论文里直接承认了三个主要局限这种坦诚本身也值得注意。第一是语言偏向问题。训练数据以英文和中文为主导致稀疏头激活的词汇也以这两种语言为主。在多语言检索场景里比如要检索日语、阿拉伯语或斯瓦希里语文档稀疏表示的泛化能力明显不足。要真正实现多语言稀疏检索需要更均衡的多语言训练数据。第二是词汇表中的异常令牌问题。现代大语言模型的词汇表规模巨大原始词汇表约24.8万条其中包含大量非标准子词比如_alt、)a这类在人类看来毫无意义的分词碎片。压缩之后仍有18.4万条这些边缘词汇有时会在稀疏激活中出现影响了稀疏表示的可解释性。未来可能需要更激进的词汇剪枝或专门的过滤机制。第三是视频类任务上的相对弱势。视频内容信息密度高、时序动态复杂直接把多帧视觉信息压缩成一个平坦的稀疏向量可能存在容量瓶颈。当前训练数据中视频比例也相对较少导致视频类任务上稀疏模型与稠密模型的差距比文本和图像场景都要大一些。归根结底UEmbed做到的是在不牺牲任何单一能力的前提下把多种能力集成到一个模型里并在实际应用中证明了这种集成的意义。它没有声称在所有任务上都是最佳但它提供了一种架构思路——稀疏检索可以从专用的双向编码器里解放出来成为任何自回归多模态大模型的天然副产品。对于普通用户而言这类技术进步最终会体现在搜索引擎返回结果更精准、AI助手回答问题更高效、视觉文档检索更智能这些具体体验上。当然从论文到产品落地还有相当长的路要走但方向已经清晰了一大步。如果你对这些技术细节感兴趣可以通过arXiv编号2608.02583查阅完整论文。QAQ1UEmbed的稀疏检索和传统BM25有什么本质区别ABM25依赖词频统计只认识字面相同的词UEmbed的稀疏检索通过神经网络学习词汇权重能自动扩展语义相关词汇比如看到汽车也能关联轿车同时还能处理图片、视频等非文字内容而BM25只能处理文本。Q2UEmbed的分词汇表设计为什么选择16个特殊令牌而不是更多A实验显示特殊令牌数量在16时性能最佳。增加到32时效果反而下降原因是每个令牌负责的词汇子集变得太小且训练时序列变长增加了对比学习的难度。16是性能与计算开销之间的实测最优平衡点。Q3UEmbed在智能体搜索场景中为什么稀疏检索轮次比稠密检索少A智能体在完成复杂任务时倾向于发出关键词密集的短查询这类查询天然适合稀疏检索的精确词汇匹配机制。稀疏检索能更直接地命中相关文档减少了需要反复搜索才能找到答案的情况从而降低了总搜索轮次。
返回列表