
WeTextProcessing终极教程让你的文本处理效率提升10倍【免费下载链接】WeTextProcessingText Normalization Inverse Text Normalization项目地址: https://gitcode.com/gh_mirrors/we/WeTextProcessingWeTextProcessing是一款专注于文本规范化Text Normalization和逆文本规范化Inverse Text Normalization的生产级工具包能帮助开发者轻松处理各种文本格式转换需求显著提升文本处理效率。无论是将口语化表达转换为标准文本还是将数字、日期等结构化信息转为自然语言WeTextProcessing都能提供高效准确的解决方案。什么是文本规范化与逆文本规范化文本规范化Text Normalization和逆文本规范化Inverse Text Normalization是自然语言处理中的关键技术广泛应用于语音识别、文本合成等场景。文本规范化TN文本规范化主要将非标准文本转换为标准形式。例如将2.5平方电线转换为二点五平方电线或者处理特殊符号、缩写等使文本格式统一规范。逆文本规范化ITN逆文本规范化则相反它将口语化的表达转换为结构化的文本。比如将二点五平方电线转换回2.5平方电线便于计算机进行后续处理和分析。快速上手WeTextProcessing一键安装步骤使用pip命令可以快速安装WeTextProcessingpip install WeTextProcessing基本命令使用安装完成后可以直接通过命令行使用WeTextProcessing的功能# 文本规范化示例 wetn --text 2.5平方电线 # 逆文本规范化示例 weitn --text 二点五平方电线Python代码调用在Python项目中也可以方便地调用WeTextProcessing的APIfrom itn.chinese.inverse_normalizer import InverseNormalizer from tn.chinese.normalizer import Normalizer as ZhNormalizer # 初始化模型 zh_tn_model ZhNormalizer(remove_erhuaTrue) zh_itn_model InverseNormalizer(enable_0_to_9False) # 文本规范化 zh_tn_text 你好 WeTextProcessing 1.0船新版本儿船新体验儿简直6669和10 print(中文 TN (去除儿化音):\n\t{} {}.format(zh_tn_text, zh_tn_model.normalize(zh_tn_text))) # 逆文本规范化 zh_itn_text 你好 WeTextProcessing 一点零船新版本儿船新体验儿简直六六六九和六 print(中文ITN (小于10的单独数字不转换):\n\t{} {}.format(zh_itn_text, zh_itn_model.normalize(zh_itn_text)))高级用法自定义规则与部署克隆项目仓库如果需要自定义规则或进行高级配置可以克隆项目仓库git clone https://gitcode.com/gh_mirrors/we/WeTextProcessing cd WeTextProcessing pip install -r requirements.txt pre-commit install修改规则并重建修改文本规范化或逆文本规范化的规则后可以使用以下命令重建缓存# 修改tn规则后重建 python -m tn --text 2.5平方电线 --overwrite_cache # 修改itn规则后重建 python -m itn --text 二点五平方电线 --overwrite_cache语言支持与参数配置WeTextProcessing支持多种语言和丰富的参数配置例如# 中文文本规范化保留儿化音 python -m tn --language zh --no-remove-erhua --text 这儿 # 中文逆文本规范化转换小于10的数字 python -m itn --language zh --enable-0-to-9 --text 一二三缓存管理WeTextProcessing会自动管理模型缓存以提高性能。缓存默认存储在以下位置Linux:~/.cache/wetextprocessingmacOS:~/Library/Caches/wetextprocessingWindows:%LOCALAPPDATA%\wetextprocessing也可以自定义缓存目录或禁用缓存# 自定义缓存目录 normalizer ZhNormalizer(cache_dir/path/to/wetext-cache) # 禁用缓存 uncached_normalizer ZhNormalizer(cache_dirFalse)获取文本转换映射关系WeTextProcessing还支持获取输入文本与规范化后文本之间的映射关系方便进行进一步分析result zh_tn_model.normalize_with_mapping(今天中午12点) print(result.output_text) # 今天中午十二点 for mapping in result.mappings: print(mapping.token_type, mapping.input_text, , mapping.output_text) # math 12 十二总结WeTextProcessing作为一款功能强大的文本处理工具包为开发者提供了简单易用且高效准确的文本规范化和逆文本规范化解决方案。通过本文介绍的快速上手方法和高级用法你可以轻松将WeTextProcessing集成到自己的项目中提升文本处理效率。如果你想深入了解WeTextProcessing的规则架构和贡献指南可以阅读Python rule architecture and contribution guide。更多关于文本规范化和逆文本规范化的详细信息还可以参考TN.README和ITN.README。希望本教程能帮助你更好地使用WeTextProcessing让文本处理工作变得更加简单高效【免费下载链接】WeTextProcessingText Normalization Inverse Text Normalization项目地址: https://gitcode.com/gh_mirrors/we/WeTextProcessing创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考