尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

XTREME 零样本跨语言迁移实战:只用英语训练,如何评估 40 种语言?

XTREME 零样本跨语言迁移实战:只用英语训练,如何评估 40 种语言? XTREME 零样本跨语言迁移实战只用英语训练如何评估 40 种语言【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtremeXTREME 是一个用于评估预训练多语言模型跨语言泛化能力的跨语言基准测试benchmark它覆盖 40 种类型学上差异极大的语言和 9 大经典 NLP 任务。它的核心玩法只有一个只用英语标注数据微调模型再零样本迁移到其余语言上直接评估全程无需任何外语训练语料。本文以最少的代码带你完整走通安装依赖 → 下载数据 → 英语微调 → 多语言预测 → 一键评分的实战全流程。什么是 XTREME 跨语言基准测试XTREMECross-lingual TRansfer Evaluation of Multilingual Encoders由 Google 与 DeepMind 团队提出目标只有一个回答预训练多语言模型在没见过的语言上到底行不行。它的两个关键设计让这个问题变得可量化40 种语言横跨 12 个语系除了英、法、德、日等常见语言还特意纳入了泰米尔语、斯瓦希里语、约鲁巴语等长期被忽视的低资源语言9 大任务覆盖句子分类、结构化预测、句子检索、问答四大范式从词法到语义全面考察模型。如果你想知道一个多语言模型能同时应付多少种语言XTREME 就是目前最权威的考场之一。项目完整说明见 README.md。为什么只用英语训练就够了零样本跨语言迁移原理普通的多语言模型如 mBERT、XLM-R在预训练阶段就学会了把不同语言映射到共享的语义空间。因此你只需要用英语标注数据对模型做微调fine-tune推理时直接喂入其他语言的句子模型凭借共享表示自动迁移能力这就是零样本跨语言迁移。这种方案的价值在于为 40 种语言逐一标注数据成本极高而英语数据唾手可得。XTREME 的评估设置也正是如此——README.md 中明确说明所有模型都只在英语数据上微调再应用到各语言测试集上出预测。一张表看懂 9 大任务与 40 种语言上面那张架构图展示了 XTREME 的四大任务族。具体每个任务考什么、怎么打分整理如下任务族任务考核内容评估指标句子分类XNLI跨语言自然语言推断准确率句子分类PAWS-X跨语言释义识别准确率结构化预测UD-POS词性标注F1结构化预测PANXWikiann命名实体识别F1问答XQuAD抽取式问答EM / F1问答MLQA多语言问答EM / F1问答TyDiQA-GoldP多语言问答EM / F1句子检索BUCC平行句对检索F1句子检索Tatoeba跨语言句对检索准确率每项任务覆盖的语言子集各不相同完整映射表定义在 evaluate.py 的XTREME_TASK2LANGS中例如 XNLI 覆盖 15 种语言而 NERPANX覆盖多达 40 种。实战第一步安装依赖与下载数据动手前先准备环境项目提供了两个便捷脚本运行bash install_tools.sh安装transformers、seqeval、jieba、kytea、pythainlp、sacremoses等依赖创建download目录手动放入 NER 数据集panx_dataset再执行bash scripts/download_data.sh自动下载其余全部数据集。这里有个贴心设计预处理阶段会移除测试集标签并打乱句子顺序防止你在做实验时不小心偷看答案保证评估公平。相关代码见 scripts/download_data.sh。实战第二步一键微调英语模型下载完数据后你不需要写任何训练代码——项目把全部训练逻辑封装进了 scripts/train.shbash scripts/train.sh [MODEL] [TASK]比如用 XLM-R 微调命名实体识别任务bash scripts/train.sh xlm-roberta-large panx支持的模型包括bert-base-multilingual-cased、xlm-mlm-100-1280和xlm-roberta-large任务支持udpos、panx、pawsx、xnli、xquad、mlqa、tydiqa、bucc2018、tatoeba九项。其中 BUCC 和 Tatoeba 属于检索类任务无需训练直接用预训练表示打分即可。每个任务还有独立的专项脚本如 scripts/train_xnli.sh、scripts/train_qa.sh方便你按需调用。实战第三步统一评估一键出分预测完成后把结果按照规范整理成目录再运行评估脚本就能得到标准分数python evaluate.py --prediction_folder [预测目录] --label_folder [标签目录] --xtreme_version xtreme --output_file report.json目录结构要求每个任务一个子文件夹文件命名为test-{语言代码}.json问答任务或test-{语言代码}.tsv其他任务。你可以在 mock_test_data/predictions/ 看到现成的示例结构在 mock_test_data/labels/ 对照真实标签格式。评估逻辑定义在 evaluate.py每个任务按语言逐项打分再取所有语言的平均值最后汇总成分类、标注、问答、检索四组的综合得分。进阶从 XTREME 到 XTREME-R如果你觉得 9 个任务还不够过瘾评估脚本还内置了升级版XTREME-R——在 evaluate.py 中通过--xtreme_version xtreme-r切换。它新增了 XCOPA常识推理、LaReQA、Mewsli-X 等任务并把语言覆盖进一步扩展例如 NER 任务的语言数从 40 增至 48 种对模型的低资源语言能力提出更严苛的考验。小结用英语训练、零样本评估 40 种语言XTREME 用一套标准化的流程把跨语言泛化能力变成了可量化的分数。从 install_tools.sh 装环境到 scripts/train.sh 微调再到 evaluate.py 出分全程只需几条命令。想动手试一试克隆仓库即可开始git clone https://gitcode.com/gh_mirrors/xt/xtreme下一个登上 XTREME 排行榜的多语言模型说不定就出自你的实验室。【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表