文本预处理是自然语言处理NLP的基础环节目标是将原始文本转化为适合模型或算法处理的规范化形式。常见步骤如下1. 文本清洗去除对分析无意义的噪声内容去除 HTML 标签网页抓取的文本常含p、div等标签去除特殊字符如、#、等符号去除表情符号视任务而定情感分析可能需要保留去除多余空白多个空格、换行符、制表符合并为单个空格大小写统一英文文本通常全部转为小写减少词表规模2. 分词将连续文本切分为有意义的语言单元英文按空格和标点切分如I love NLP→[I, love, NLP]中文需要专门的分词工具如 jieba、HanLP、THULAC如自然语言处理→[自然, 语言, 处理]子词分词BPE、WordPiece、SentencePiece 等方法平衡词表大小和未登录词问题3. 去除停用词过滤掉频率高但信息量低的词英文the、is、at、which、on中文的、了、在、是、我注意并非所有任务都需要去停用词。情感分析中不、没有等否定词可能携带关键信息。4. 词形归一化将不同形态的词还原为统一形式主要针对英语等屈折语方法说明示例词干提取截取词缀规则粗暴running→runbetter→bet词形还原基于词典还原为词元better→goodrunning→run词形还原比词干提取更准确但需要词性标注辅助计算成本更高。5. 词性标注为每个词标注语法类别名词、动词、形容词等辅助词形还原选择正确词元帮助消歧如book作名词书 vs 动词预订为句法分析和信息提取提供基础6. 去除低频词 / 高频词低频词仅出现 1-2 次的词通常是拼写错误或专有名词增加词表噪声高频词在几乎所有文档中都出现的词区分度低类似停用词的扩展常用工具TF-IDF 权重过滤7. 文本向量化将文本转化为数值向量供模型使用词袋模型统计词频忽略语序TF-IDF词频-逆文档频率降低常见词权重词嵌入Word2Vec、GloVe、FastText捕捉语义关系上下文嵌入BERT、ELMo根据上下文动态生成向量8. 其他可选步骤拼写纠错修正拼写错误如recieve→receive缩写展开dont→do notcant→cannot数字处理统一为占位符NUM或转为文字命名实体识别识别人名、地名、机构名等句法分析依存句法树、成分句法树步骤选择原则原始文本 │ ├─ 文本清洗 ──→ 去标签/特殊字符/空白 ├─ 分词 ──────→ 切分为词单元 ├─ 去停用词 ──→ 过滤无信息量词 ├─ 词形归一化 → 词干提取/词形还原 ├─ 词性标注 ──→ 标注语法类别 ├─ 去低频/高频 → 精简词表 └─ 向量化 ────→ 转为数值表示并非所有步骤都是必需的需根据具体任务和语种灵活组合。例如文本分类清洗 → 分词 → 去停用词 → TF-IDF机器翻译分词 → 子词切分BPE通常不去停用词、不做词形还原情感分析清洗 → 分词 → 保留否定词 → 词嵌入