尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

XTREME 与 GLUE 有何不同?多语言 NLP 基准测试的 5 个关键差异

XTREME 与 GLUE 有何不同?多语言 NLP 基准测试的 5 个关键差异 XTREME 与 GLUE 有何不同多语言 NLP 基准测试的 5 个关键差异【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme如果你已经跑过 GLUE对 BERT 微调驾轻就熟那么初次接触 XTREME 时难免困惑同样是基准测试为什么它的任务清单里全是 XNLI、XQuAD、TyDiQA 这些陌生名字XTREMECross-lingual TRansfer Evaluation of Multilingual Encoders是一个专为评测预训练多语言模型跨语言泛化能力而生的多语言 NLP 基准测试覆盖 40 种语言、横跨 12 个语系、包含 9 个任务。而 GLUE 则是纯英文的单语 NLU 基准。这篇文章用 5 个关键差异帮你彻底搞清楚两者的区别以及为什么多语言模型评测离不开 XTREME。差异一语言覆盖范围——从纯英文到 40 种语言GLUE 的所有任务CoLA、SST-2、MNLI、QQP 等都是英文数据评测的是模型对单一语言的理解能力。XTREME 则完全不同它精选了 40 种类型学上高度多样的语言覆盖 12 个语系其中包括大量低资源语言——比如南印度的泰米尔语Tamil、非洲的斯瓦希里语Swahili和约鲁巴语Yoruba。语言选择策略以维基百科条目数最多的前 100 种语言为池子最大化语言多样性、任务覆盖率和训练数据可得性。这意味着一个模型要在 XTREME 上拿高分必须学会从英语迁移到泰米尔语、日语、希伯来语等差异巨大的语言上。差异二评测核心目标——单语理解 vs 跨语言迁移能力GLUE 的考察对象是单语 NLU 能力给定英文句子模型能否正确分类、判断语义相似度、推理蕴含关系。它是 BERT 时代衡量模型语言理解深度的标准尺。XTREME 的考察对象是跨语言迁移能力cross-lingual generalization模型只在英文标注数据上训练然后直接应用于其他 39 种语言的测试数据看知识能否零样本地跨语言流动。能否学出语言无关的共享表征才是 XTREME 真正要回答的问题。这也是为什么多语言模型评测绕不开 XTREME——它测的不是会几门语言而是换一种语言还会不会。差异三任务构成——9 个任务覆盖 4 大 NLP 范式GLUE 的 9 个任务集中在句子分类、文本蕴含和语义相似度上本质上都属于句子级理解。XTREME 的 9 个任务则横跨 4 大 NLP 范式考察不同层面的句法与语义推理任务类别包含任务考察能力️ 句子分类XNLI、PAWS-X自然语言推断、跨语言释义识别 结构化预测UD-POS、Wikiann NER词性标注、命名实体识别 句子检索BUCC、Tatoeba跨语言平行句对检索❓ 阅读理解XQuAD、MLQA、TyDiQA抽取式跨语言问答从上图可以直观看到XTREME 通过四大任务模块汇总出一个组合得分Combined Score全面衡量模型的多语言综合能力。如果你对单个任务的实现细节感兴趣可以在项目仓库的 third_party/processors/ 目录下找到对应数据处理代码例如 xnli.py 和 squad.py。差异四评测设定——零样本跨语言迁移 vs 逐任务微调GLUE 的标准流程是每个任务单独提供训练集模型分别微调、分别评测训练与测试语言一致。XTREME 采用零样本跨语言迁移设定先用英文标注数据微调预训练多语言模型再将该模型直接应用到同一任务的其他语言测试集上获取预测。比如在 XNLI 上模型只在英文 MNLI 数据上训练却要预测法语、阿拉伯语、日语等语言的蕴含标签。此外XTREME 还提供 translate-train 和 translate-test 变体——把英文训练集自动翻译成其他语言、或把测试集翻译回英文用于研究翻译增强对迁移效果的影响。项目仓库中的 scripts/train.sh 就是这套流程的入口脚本一条命令即可切换任务。差异五评分机制——组合得分如何计算GLUE 的得分体系相对简单每个任务单独计分准确率、F1、皮尔逊相关等最终取平均值排名。XTREME 的评分更强调跨任务、跨语言的综合表现每个任务的得分先按语言汇总再聚合到任务层面最后综合出组合得分。模型只有在所有 9 个任务、所有语言上都表现均衡才能获得高分——单项突出并不能掩盖短板。提交评测也非常规范将每个任务的预测结果按test-{语言代码}.{扩展名}命名放入对应子目录再通过仓库根目录的 evaluate.py 与标签文件比对即可目录格式示例可以直接参考 mock_test_data/predictions/。快速上手 XTREME多语言模型评测的实用路径想亲身体验这套多语言 NLP 基准测试按以下三步即可跑通克隆仓库并安装依赖克隆地址为https://gitcode.com/gh_mirrors/xt/xtreme然后运行bash install_tools.sh安装 transformers、seqeval、jieba 等依赖。下载数据按 README.md 的说明将 panx 数据集放入download目录再执行bash scripts/download_data.sh下载其余数据。训练与评测运行bash scripts/train.sh [模型] [任务]微调基线模型如bert-base-multilingual-cased、xlm-roberta-large最后用python evaluate.py --prediction_folder [路径] --label_folder [路径]计算得分。值得一提的是仓库中的 multichecklist/ 目录还提供了面向任务的细粒度检查清单适合想深入了解模型在特定语言上表现的进阶玩家。一张表看懂XTREME vs GLUE 核心区别维度GLUEXTREME 语言纯英文40 种语言、12 个语系 评测目标单语 NLU 理解跨语言迁移泛化 任务数量9 个句子级任务9 个任务、4 大范式 训练设定逐任务同语言微调英文微调后零样本迁移 评分方式单任务平均任务语言聚合的组合得分结语选 GLUE 还是 XTREME一句话总结做单语模型研究选 GLUE做多语言模型评测选 XTREME。如果你关注的是跨语言迁移、低资源语言表现、多语言预训练模型的泛化边界XTREME 是目前最权威的多语言 NLP 基准测试之一。理解了它与 GLUE 的这 5 个关键差异你就能更准确地解读多语言模型的评测结果也为后续研究跨语言 NLP 打下坚实基础。【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表