文章摘要PDF导入知识库后出现乱码、空白、文字顺序错乱,是企业RAG项目最常见的数据源故障。根因可能是扫描件没有文本层、字体使用自定义编码、双栏版式阅读顺序错误、表格被拆散、OCR语言配置不正确,或者解析结果未经质量校验就直接分块。本文给出从PDF类型识别、文本层检测、字体与编码、OCR、版面恢复到入库质量门禁的完整排查流程。一、先不要急着调整Embedding模型典型现象:上传PDF → 成功生成向量 → 搜索不到正确内容开发者常见的第一反应是:换Embedding模型;调高Top K;调低相似度阈值;更换向量数据库。但如果解析出的原始文本已经错误,后续任何检索优化都无法补救。第一步应该查看:PDF解析后的原始文本而不是直接查看最终问答结果。二、先判断PDF属于哪种类型1. 文字型PDF可以在阅读器中选中文字并复制。通常可以直接提取文本,但仍可能存在:字体编码异常;阅读顺序错误;页眉页脚混入;表格结构丢失。2. 扫描型PDF每一页本质上是一张图片。特征:无法选中文字;文本提取结果为空;文件来自扫描仪或拍照;页面有明显阴影和倾斜。必须使用OCR。3. 混合型PDF部分页面有文本层,部分页面是扫描图。常见于:合同附件;盖章文件;多来源合并文件;旧档案数字化。需要逐页判断,不能只根据第一页决定整个文件的解析方式。三、文本为空怎么排查检测每页字符数:frompypdfimportPdfReaderdefinspect_pdf(path:str)-list[dict]:reader