本地OCR文字识别

作者:鹿Sir办公效率v1

本地OCR文字识别工具,支持从图片、截图中提取文字,保留原始排版格式,覆盖中英文、表格、公式等场景。

下载量
255
点赞
63
价格
免费

技能文档

---
name: local-image-ocr
description: 本地OCR文字识别工具,支持从图片、截图中提取文字,保留原始排版格式,覆盖中英文、表格、公式等场景。
title: 本地OCR文字识别
category: 办公效率
---

# 本地OCR文字识别

高效的文字识别与提取工具,从图片和PDF中精准提取文字内容,保留原始排版结构。

## 支持输入

- **图片格式**:JPG、PNG、BMP、TIFF、WebP
- **文档格式**:PDF(扫描件与电子版)
- **截图**:屏幕截图、手机截图、相机照片

## 识别能力

### 文字类型
- **印刷体**:中英文印刷体文字,支持多栏排版
- **手写体**:工整手写中文与英文
- **混合排版**:中英文混排、数字与符号
- **表格**:识别表格结构,输出为Markdown表格或CSV
- **公式**:基础数学公式识别,输出为LaTeX格式

### 特殊场景
- 证件文字:身份证、名片、营业执照
- 票据文字:发票、收据、火车票、机票
- 屏幕截图:代码截图、聊天记录、网页内容
- 低质量图片:模糊、倾斜、光照不均

## 工作流程

### 第一步:输入处理
1. 接收用户提供的图片或PDF文件
2. 自动检测图片方向,必要时旋转校正
3. 预处理:去噪、二值化、对比度增强

### 第二步:文字识别
1. 检测文字区域与排版结构
2. 按阅读顺序(从左到右、从上到下)识别文字
3. 识别表格线、分隔符等结构元素
4. 保留原始排版层次

### 第三步:输出整理
1. 组装识别结果为结构化文本
2. 保留段落分隔与缩进
3. 表格内容转为Markdown表格格式
4. 输出最终结果

## 输出格式

### 纯文本模式
直接输出识别到的文字内容,保留段落结构。

### Markdown模式
```markdown
# 文档标题

正文内容...

## 表格数据

| 列1 | 列2 | 列3 |
|-----|-----|-----|
| 数据 | 数据 | 数据 |
```

### 结构化模式
按区域分块输出,标注每个区域的类型(标题/正文/表格/图片说明)。

## 使用示例

**场景1:截图文字提取**
```
用户:请提取这张截图中的文字
处理:识别图片中的文字区域 → 按排版顺序输出
输出:保留原始段落结构的文字内容
```

**场景2:PDF扫描件转文字**
```
用户:把这个PDF扫描件转为可编辑文字
处理:逐页识别 → 合并结果 → 保留页码标注
输出:带页码标注的完整文字内容
```

**场景3:表格识别**
```
用户:提取图片中的表格数据
处理:检测表格结构 → 识别单元格内容 → 输出Markdown表格
输出:格式化的Markdown表格
```

## 识别技巧

### 提升识别准确率
1. 提供清晰、高分辨率的图片
2. 确保文字方向正确(非旋转)
3. 避免强烈反光或阴影
4. 对于倾斜图片,先进行校正

### 常见问题处理
- **识别乱码**:可能是图片质量过低,建议提供更清晰的图片
- **表格错位**:复杂表格可能需要手动调整
- **公式错误**:复杂公式建议手动校验

## 注意事项

- 识别准确率受图片质量影响
- 手写体识别准确率低于印刷体
- 复杂排版可能需要人工校验
- 大批量处理时注意内存占用

如何安装此技能?

访问技能市场,点击「安装」按钮,按提示将技能包放入 AI 编程助手的 skills 目录即可。

浏览技能市场

支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手