尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何从金融新闻中精准提取公司名称?SmoothNLP金融实体识别手把手教程

如何从金融新闻中精准提取公司名称?SmoothNLP金融实体识别手把手教程 如何从金融新闻中精准提取公司名称SmoothNLP金融实体识别手把手教程【免费下载链接】SmoothNLP专注于可解释的NLP技术 An NLP Toolset With A Focus on Explainable Inference项目地址: https://gitcode.com/gh_mirrors/smo/SmoothNLPSmoothNLP 是一款专注于可解释 NLP 技术的开源工具集内置面向金融场景的实体识别能力。本教程手把手教你使用 SmoothNLP 的金融实体识别功能从一条金融新闻中精准提取公司名称并进一步构建企业知识图谱——即使你是 NLP 新手也能在几分钟内跑通第一个示例 为什么金融实体识别这么难财经新闻里公司名称往往以简称、别名、中英混排的形式出现旷视科技预计将在今年9月在港IPO 中行9.78亿收购国开行旗下15家村镇银行 东芝23亿美元收购LandisGyr人工阅读容易程序自动提取却很难。SmoothNLP 的金融实体识别针对这类场景做了专门优化官方测试用例smoothnlp/unittest/test2_NER.py覆盖了公司简称识别、英文公司名识别、非公司名词防误判等典型 case准确率表现稳定。三步完成环境安装与首次调用第 1 步安装 SmoothNLPpip install smoothnlp0.4.0 要求 Python 3 环境版本检查逻辑见 smoothnlp/__init__.py。第 2 步一行代码提取公司名称import smoothnlp smoothnlp.company_recognize(旷视科技预计将在今年9月在港IPO)第 3 步解读返回结果[{charStart: 0, charEnd: 4, text: 旷视科技, nerTag: COMPANY_NAME, normalizedEntityValue: 旷视科技}]每个实体都是带完整信息的字典text是实体文本charStart/charEnd是它在原句中的起止位置方便高亮标注nerTag是实体类型normalizedEntityValue是规范化后的实体值。两个核心接口company_recognize 与 nerSmoothNLP 提供了两层 API按需选择接口用途适用场景smoothnlp.company_recognize直接返回公司实体只关心公司名称最省事smoothnlp.ner返回全部类型实体需要同时抽取公司、金额、日期等多类信息接口一直接抽取公司company_recognize内部实际调用ner接口再按COMPANY_NAME标签过滤实现见 smoothnlp/server/init.py对你来说它就是一个一键提公司的快捷方式。接口二全量实体识别import smoothnlp smoothnlp.ner(中国平安2019年度长期服务计划于2019年5月7日至5月14日通过二级市场完成购股)一次调用就能拿到 4 类实体COMPANY_NAME中国平安NUMBER2019年DATETIME2019年5月7日、5月14日做金融信息结构化时通常先用ner全量抽取再按nerTag过滤出COMPANY_NAME灵活度更高。长新闻怎么处理切句 批量处理关键限制单次请求的文本长度不能超过200 字符限制逻辑见 smoothnlp/server/init.py。处理长新闻时标准姿势是先切句、再识别import smoothnlp news 句子1!句子2!句子3! sentences smoothnlp.split2sentences(news) # 按标点切句 for s in sentences: print(smoothnlp.company_recognize(s))处理整篇新闻或大批量语料时直接把句子列表list传入接口即可SmoothNLP 会默认用2 个线程并发请求提升吞吐from smoothnlp import config config.setNumThreads(2) # 调整并发线程数 smoothnlp.company_recognize(sentence_list) # 传入 list 触发并发并发与重试机制实现见 smoothnlp/server/init.py遇到 QPS 超限时客户端会自动退避重试无需额外处理。进阶从公司名称到企业知识图谱提取出公司只是第一步更进一步可以用 SmoothNLP 的知识图谱模块从公司描述文本中抽取公司—关系—属性三元组from smoothnlp import kg kg.extract(上海培罗蒙西服公司成立于1928年总部位于上海是一家西服制作有限公司, prettyTrue)返回的 N 元组包含subject、object、action、type和置信度_conf_score可以进一步用kg.rel2graph构建 NetworkX 有向图。调用方式与字段说明详见 tutorials/知识图谱/README.md。上图中上海培罗蒙西服公司作为核心节点与有限公司状态修饰、于1928年成立、于上海地点之间自动关联——这正是实体识别 关系抽取的组合效果。常见问题速查Q1识别结果偶尔漏抽怎么办这是 NER 模型的常见边界情况官方专门为此维护了测试用例集运行python -m unittest test2_NER可查看当前模型在公司漏识别、非实体误判上的表现说明见 smoothnlp/unittest/README.md。Q2调试时想看详细日志from smoothnlp import config config.setLogLevel(DEBUG)Q3想解析百度与携程这类多实体 Query 并区分修饰关系可以关注 SmoothNLP 的 Query 解析功能Pro 版它能把国产特斯拉拆成国产 特斯拉功能介绍见 tutorials/Query解析/README.md。总结✅ 安装pip install smoothnlp0.4.0Python 3 环境即可✅ 提取公司smoothnlp.company_recognize一键抽取smoothnlp.ner全量抽取✅ 长文本smoothnlp.split2sentences切句预处理单句 ≤200 字符列表入参自动并发✅ 进阶kg.extract把公司实体升级为结构化知识图谱从一条新闻到一个企业知识图谱SmoothNLP 帮你把可解释的 NLP 推理落到了实处。现在就可以动手跑通第一个示例了 ✨【免费下载链接】SmoothNLP专注于可解释的NLP技术 An NLP Toolset With A Focus on Explainable Inference项目地址: https://gitcode.com/gh_mirrors/smo/SmoothNLP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表