
name: pdf-analyzerdescription: 分析 PDF 文件提取文本、表格、图片描述等结构化内容并生成格式规整的 Word 文档.docx。triggers:- 关键词分析PDF、PDF转Word、提取PDF内容、解析PDF- 文件类型application/pdfinstructions: |当用户上传一个 PDF 文件并请求分析或转换时请按以下步骤操作1. **读取 PDF 内容**- 使用 Python 库 pypdf 或 pdfplumber 提取全部文本。- 如果 PDF 包含表格使用 pdfplumber 提取表格数据为列表或 DataFrame。- 如果 PDF 包含图片尝试使用 pdf2image 转换为图片并保存但仅描述图片内容不进行 OCR除非用户特别要求。2. **结构化整理**- 按照原始顺序保留章节、段落、列表。- 检测标题基于字体大小或位置并标记层级。- 提取所有表格并转换为 Markdown 表格或纯文本表格。- 备注页眉、页脚、水印等可选择性保留。3. **生成 Word 文档**- 使用 python-docx 库创建 .docx 文件。- 将提取的文本按段落写入应用适当的样式标题1、标题2、正文。- 对于表格使用 add_table() 方法插入。- 如果包含图片可嵌入图片需要用户确认是否提取。4. **输出结果**- 返回生成的 Word 文档供用户下载。- 同时提供内容摘要如字数统计、页数、主要章节列表。5. **处理特殊需求**- 如果用户指定只提取某几页只处理指定范围。- 如果用户要求识别图片中的文字OCR提示需要额外的 OCR 引擎如 Tesseract并询问是否启用。- 如果 PDF 为扫描件纯图像建议用户先启用 OCR否则只能提取空文本。注意事项- 对于加密 PDF需先验证密码。- 大文件50MB处理可能较慢提示用户耐心等待。- 输出的 Word 文档尽量保留原格式但无法保证 100% 精确还原尤其是复杂排版。示例对话用户“帮我分析这个PDF提取所有内容并转成Word”助手上传文件后执行上述流程最后提供下载链接和内容摘要。