P

PDF 提取器

作者:鹿Sir办公效率v3

从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。当用户需要从 PDF 报告中提取数据、将 PDF 表格转换为 CSV、从演示文稿中提取图像、批量处理 PDF 转文本、处理学术论文时触发。触发词:PDF提取、PDF解析、表格提取、PDF转文本、PDF转CSV

下载量
300
点赞
75
价格
免费

技能文档

---
name: pdf-extractor
title: PDF 提取器
category: 办公效率
description: "从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。当用户需要从 PDF 报告中提取数据、将 PDF 表格转换为 CSV、从演示文稿中提取图像、批量处理 PDF 转文本、处理学术论文时触发。触发词:PDF提取、PDF解析、表格提取、PDF转文本、PDF转CSV"
---

# PDF 提取器

> 使用 pdfplumber 从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。

## 使用场景

- **报告处理** - 从 PDF 报告中提取数据
- **表格提取** - 将 PDF 表格转换为 CSV
- **图像收集** - 从演示文稿中提取图像
- **文本挖掘** - 批量将 PDF 转换为可搜索文本
- **学术研究** - 处理学术论文和白皮书

## 依赖安装

```bash
pip install pdfplumber pypdf click pandas
# For image extraction:
pip install Pillow
```

## 命令

### 提取文本
```bash
python scripts/main.py text document.pdf
python scripts/main.py text document.pdf --pages 1-5
```

### 提取表格
```bash
python scripts/main.py tables report.pdf --output tables.csv
python scripts/main.py tables financial.pdf --page 3
```

### 提取图像
```bash
python scripts/main.py images presentation.pdf --output ./images/
```

### 合并 PDF
```bash
python scripts/main.py merge doc1.pdf doc2.pdf --output combined.pdf
```

### PDF 信息
```bash
python scripts/main.py info document.pdf
```

## 示例

### 示例 1:提取财务表格
```bash
python scripts/main.py tables annual-report.pdf --output financials.csv

# Output: financials.csv with all tables found
# Also creates individual CSVs: table_page3_1.csv, table_page5_1.csv
```

### 示例 2:批量转换为文本
```bash
python scripts/main.py batch ./pdfs/ --output ./text/

# Converts all PDFs in folder to .txt files
```

### 示例 3:提取指定页面
```bash
python scripts/main.py text whitepaper.pdf --pages 1,5-10,15

# Extracts only pages 1, 5-10, and 15
```

使用说明

# PDF 提取器

使用 pdfplumber 从 PDF 文件中提取文本、表格和图像,将静态 PDF 转化为可用数据。

## 使用

### 提取文本
```bash
python scripts/main.py text document.pdf
python scripts/main.py text document.pdf --pages 1-5
```

### 提取表格
```bash
python scripts/main.py tables report.pdf --output tables.csv
```

### 提取图像
```bash
python scripts/main.py images presentation.pdf --output ./images/
```

### 合并 PDF
```bash
python scripts/main.py merge doc1.pdf doc2.pdf --output combined.pdf
```

### 批量转换
```bash
python scripts/main.py batch ./pdfs/ --output ./text/
```

## 工作原理

本技能基于 pdfplumber 库实现 PDF 内容提取,支持三种核心操作:

1. **文本提取**:按页或按范围提取 PDF 中的文本内容,保留基本格式结构。
2. **表格提取**:自动识别 PDF 中的表格结构并转换为 CSV 格式,支持指定页面。
3. **图像提取**:从 PDF 中抽取嵌入的图片并保存到指定目录。

此外还支持 PDF 合并和批量处理,适用于报告处理、学术研究、数据迁移等场景。

如何安装此技能?

访问技能市场,点击「安装」按钮,按提示将技能包放入 AI 编程助手的 skills 目录即可。

浏览技能市场

支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手