尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

自然语言处理基础

自然语言处理基础 一、介绍自然语言处理Natural Language Processing, NLP是人工智能领域的重要分支旨在让计算机理解、生成和操作人类语言。中文因其无空格分隔、词义灵活、歧义丰富等特点给NLP任务带来了独特挑战。本文将基于《红楼梦》文本的处理案例介绍中文NLP中几个基础且关键的步骤分词、停用词过滤和TF‑IDF特征提取并展示如何用Python工具实现这些操作。二、 中文分词与用户自定义词典中文文本的切分是后续分析的基础。jieba 是流行的开源分词库基于统计和词典匹配。对于特定领域的专有名词如人名、地名、作品名默认词典可能无法正确切分这时需要加载用户自定义词典。项目中的红楼梦词库.txt收录了《红楼梦》中的大量特定词汇如“宝婺情孤洁”、“悲远嫁宝玉感离情”等。加载后jieba 会优先匹配词典中的最长词条。注意由于词库中包含了完整短语“悲远嫁宝玉感离情”因此它被整体切出而不是拆分为“悲远嫁”、“宝玉”、“感离情”三个词。若需拆分可从词库中移除该长词条。此例说明了自定义词典的优先级最长匹配优先。三、停用词过滤文本中常包含大量虚词、标点等对主题分析贡献甚微的词称为停用词。去除它们可降低特征维度聚焦于内容词。项目中的StopwordsCN.txt包含了常见停用词如“的”、“了”、“是”以及各类标点。在分词后遍历每个词并检查是否在停用词集合中若不在则保留。四、TF‑IDF特征提取词频‑逆文档频率TF‑IDF衡量词语在文档集合中的重要性。其思想是词在文档中出现的频率越高TF高且在全部文档中出现的文档数越少IDF高则其区分能力越强。sklearn.feature_extraction.text.TfidfVectorizer提供了便捷实现。TF某次在文章中出现的次数/文章的总次数逆文档频率IDFlog语料库的文档总数/包含该词的文档数1
返回列表