本
本地OCR文字识别
作者:鹿Sir办公效率v1
本地OCR文字识别工具,支持从图片、截图中提取文字,保留原始排版格式,覆盖中英文、表格、公式等场景。
下载量
255
点赞
63
价格
免费
技能文档
--- name: local-image-ocr description: 本地OCR文字识别工具,支持从图片、截图中提取文字,保留原始排版格式,覆盖中英文、表格、公式等场景。 title: 本地OCR文字识别 category: 办公效率 --- # 本地OCR文字识别 高效的文字识别与提取工具,从图片和PDF中精准提取文字内容,保留原始排版结构。 ## 支持输入 - **图片格式**:JPG、PNG、BMP、TIFF、WebP - **文档格式**:PDF(扫描件与电子版) - **截图**:屏幕截图、手机截图、相机照片 ## 识别能力 ### 文字类型 - **印刷体**:中英文印刷体文字,支持多栏排版 - **手写体**:工整手写中文与英文 - **混合排版**:中英文混排、数字与符号 - **表格**:识别表格结构,输出为Markdown表格或CSV - **公式**:基础数学公式识别,输出为LaTeX格式 ### 特殊场景 - 证件文字:身份证、名片、营业执照 - 票据文字:发票、收据、火车票、机票 - 屏幕截图:代码截图、聊天记录、网页内容 - 低质量图片:模糊、倾斜、光照不均 ## 工作流程 ### 第一步:输入处理 1. 接收用户提供的图片或PDF文件 2. 自动检测图片方向,必要时旋转校正 3. 预处理:去噪、二值化、对比度增强 ### 第二步:文字识别 1. 检测文字区域与排版结构 2. 按阅读顺序(从左到右、从上到下)识别文字 3. 识别表格线、分隔符等结构元素 4. 保留原始排版层次 ### 第三步:输出整理 1. 组装识别结果为结构化文本 2. 保留段落分隔与缩进 3. 表格内容转为Markdown表格格式 4. 输出最终结果 ## 输出格式 ### 纯文本模式 直接输出识别到的文字内容,保留段落结构。 ### Markdown模式 ```markdown # 文档标题 正文内容... ## 表格数据 | 列1 | 列2 | 列3 | |-----|-----|-----| | 数据 | 数据 | 数据 | ``` ### 结构化模式 按区域分块输出,标注每个区域的类型(标题/正文/表格/图片说明)。 ## 使用示例 **场景1:截图文字提取** ``` 用户:请提取这张截图中的文字 处理:识别图片中的文字区域 → 按排版顺序输出 输出:保留原始段落结构的文字内容 ``` **场景2:PDF扫描件转文字** ``` 用户:把这个PDF扫描件转为可编辑文字 处理:逐页识别 → 合并结果 → 保留页码标注 输出:带页码标注的完整文字内容 ``` **场景3:表格识别** ``` 用户:提取图片中的表格数据 处理:检测表格结构 → 识别单元格内容 → 输出Markdown表格 输出:格式化的Markdown表格 ``` ## 识别技巧 ### 提升识别准确率 1. 提供清晰、高分辨率的图片 2. 确保文字方向正确(非旋转) 3. 避免强烈反光或阴影 4. 对于倾斜图片,先进行校正 ### 常见问题处理 - **识别乱码**:可能是图片质量过低,建议提供更清晰的图片 - **表格错位**:复杂表格可能需要手动调整 - **公式错误**:复杂公式建议手动校验 ## 注意事项 - 识别准确率受图片质量影响 - 手写体识别准确率低于印刷体 - 复杂排版可能需要人工校验 - 大批量处理时注意内存占用
支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手