尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手

从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手 从0到1掌握bert-portuguese-ner葡萄牙语NER模型的安装与快速上手【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-nerbert-portuguese-ner是一个基于BERT架构的葡萄牙语命名实体识别NER模型专为处理葡萄牙语档案文献设计。它能够精准识别文本中的日期、职业、人物、地点和组织等关键实体为葡萄牙语文本分析提供强大支持。 模型核心优势高准确率的实体识别能力该模型在评估集上达到了97.00%的准确率和93.12%的F1分数能够有效识别以下5类实体B-Data日期和I-Data日期内部B-Local地点和I-Local地点内部B-Organizacao组织和I-Organizacao组织内部B-Pessoa人物和I-Pessoa人物内部B-Profissao职业和I-Profissao职业内部专为葡萄牙语优化基于neuralmind/bert-base-portuguese-cased预训练模型微调针对葡萄牙语语法特点和档案文献领域进行了专项优化词汇表规模达29794个支持葡萄牙语特有词汇和拼写。 快速安装指南1. 克隆项目仓库git clone https://gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner cd bert-portuguese-ner2. 安装依赖环境确保已安装Python 3.7然后安装必要依赖pip install transformers4.10.0.dev0 torch1.9.0cu111 datasets1.10.2 tokenizers0.10.3 模型使用教程加载模型和分词器from transformers import BertTokenizer, BertForTokenClassification tokenizer BertTokenizer.from_pretrained(./) model BertForTokenClassification.from_pretrained(./)实体识别示例text João Silva trabalhou na Universidade de Lisboa em 2020. inputs tokenizer(text, return_tensorspt) outputs model(**inputs) predictions outputs.logits.argmax(dim2) # 将预测结果转换为实体标签 id2label model.config.id2label tokens tokenizer.convert_ids_to_tokens(inputs[input_ids][0]) for token, prediction in zip(tokens, predictions[0]): if token not in [[CLS], [SEP], [PAD]]: print(f{token}: {id2label[prediction.item()]}) 模型性能表现关键评估指标准确率Accuracy97.00%精确率Precision91.47%召回率Recall94.83%F1分数93.12%训练过程表现训练轮次训练损失验证损失F1分数1-0.14380.914820.24540.12220.919630.05260.10980.931240.03720.11400.9312⚙️ 模型配置详解核心参数隐藏层大小768注意力头数12隐藏层层数12最大序列长度512优化器Adam学习率2e-05实体标签映射完整的实体标签定义可在config.json中查看包含11种标签类型其中以B-开头的表示实体开始I-开头的表示实体内部O表示非实体。 数据集来源模型训练数据来自葡萄牙档案文献标注语料库可通过http://ner.epl.di.uminho.pt/获取完整数据集。该语料库包含大量历史档案文献标注精细适合葡萄牙语NER任务训练。 引用与致谢如果使用本模型请引用以下论文Article{make4010003, AUTHOR {Cunha, Luís Filipe and Ramalho, José Carlos}, TITLE {NER in Archival Finding Aids: Extended}, JOURNAL {Machine Learning and Knowledge Extraction}, VOLUME {4}, YEAR {2022}, NUMBER {1}, PAGES {42--65}, DOI {10.3390/make4010003} }模型基于neuralmind/bert-base-portuguese-cased预训练模型开发感谢原作者团队的贡献。 应用场景葡萄牙语历史文献数字化处理档案管理系统实体提取葡萄牙语新闻自动摘要学术论文实体标注辅助工具多语言NER系统构建组件【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表