P
PDF 提取器
作者:鹿Sir办公效率v3
从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。当用户需要从 PDF 报告中提取数据、将 PDF 表格转换为 CSV、从演示文稿中提取图像、批量处理 PDF 转文本、处理学术论文时触发。触发词:PDF提取、PDF解析、表格提取、PDF转文本、PDF转CSV
下载量
300
点赞
75
价格
免费
技能文档
--- name: pdf-extractor title: PDF 提取器 category: 办公效率 description: "从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。当用户需要从 PDF 报告中提取数据、将 PDF 表格转换为 CSV、从演示文稿中提取图像、批量处理 PDF 转文本、处理学术论文时触发。触发词:PDF提取、PDF解析、表格提取、PDF转文本、PDF转CSV" --- # PDF 提取器 > 使用 pdfplumber 从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。 ## 使用场景 - **报告处理** - 从 PDF 报告中提取数据 - **表格提取** - 将 PDF 表格转换为 CSV - **图像收集** - 从演示文稿中提取图像 - **文本挖掘** - 批量将 PDF 转换为可搜索文本 - **学术研究** - 处理学术论文和白皮书 ## 依赖安装 ```bash pip install pdfplumber pypdf click pandas # For image extraction: pip install Pillow ``` ## 命令 ### 提取文本 ```bash python scripts/main.py text document.pdf python scripts/main.py text document.pdf --pages 1-5 ``` ### 提取表格 ```bash python scripts/main.py tables report.pdf --output tables.csv python scripts/main.py tables financial.pdf --page 3 ``` ### 提取图像 ```bash python scripts/main.py images presentation.pdf --output ./images/ ``` ### 合并 PDF ```bash python scripts/main.py merge doc1.pdf doc2.pdf --output combined.pdf ``` ### PDF 信息 ```bash python scripts/main.py info document.pdf ``` ## 示例 ### 示例 1:提取财务表格 ```bash python scripts/main.py tables annual-report.pdf --output financials.csv # Output: financials.csv with all tables found # Also creates individual CSVs: table_page3_1.csv, table_page5_1.csv ``` ### 示例 2:批量转换为文本 ```bash python scripts/main.py batch ./pdfs/ --output ./text/ # Converts all PDFs in folder to .txt files ``` ### 示例 3:提取指定页面 ```bash python scripts/main.py text whitepaper.pdf --pages 1,5-10,15 # Extracts only pages 1, 5-10, and 15 ```
使用说明
# PDF 提取器 使用 pdfplumber 从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。 ## 使用 ### 提取文本 ```bash python scripts/main.py text document.pdf python scripts/main.py text document.pdf --pages 1-5 ``` ### 提取表格 ```bash python scripts/main.py tables report.pdf --output tables.csv ``` ### 提取图像 ```bash python scripts/main.py images presentation.pdf --output ./images/ ``` ### 合并 PDF ```bash python scripts/main.py merge doc1.pdf doc2.pdf --output combined.pdf ``` ### 批量转换 ```bash python scripts/main.py batch ./pdfs/ --output ./text/ ``` ## 工作原理 本技能基于 pdfplumber 库实现 PDF 内容提取,支持三种核心操作: 1. **文本提取**:按页或按范围提取 PDF 中的文本内容,保留基本格式结构。 2. **表格提取**:自动识别 PDF 中的表格结构并转换为 CSV 格式,支持指定页面。 3. **图像提取**:从 PDF 中抽取嵌入的图片并保存到指定目录。 此外还支持 PDF 合并和批量处理,适用于报告处理、学术研究、数据迁移等场景。
支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手