d

doc-extract

作者:注册老炮@MedXpert I SynomosAIv2

当用户需要从 Office 文档(docx/xlsx)、HTML、纯文本中抽取正文/表格内容喂给 AI 处理,但不想把文档上传到任何云转换服务时使用。数据全程本机解析。

下载量
273
点赞
68
价格
免费

技能文档

---
name: doc-extract
slug: doc-extract
display_name: "本地文档抽取 MCP(SynomosAI)"
displayName: "本地文档抽取 MCP(SynomosAI)"
summary: ".docx/.xlsx/.html/.txt/.md/.json/.csv 纯文本抽取:Office 走 zipfile+XML 本地解析,零云零依赖,数据不出本机。"
description: "当用户需要从 Office 文档(docx/xlsx)、HTML、纯文本中抽取正文/表格内容喂给 AI 处理,但不想把文档上传到任何云转换服务时使用。数据全程本机解析。"
description_en: "Local document text extraction: docx/xlsx (zipfile+XML) / html / txt / md / json / csv to plain text, fully offline & dependency-free. Data never leaves the machine."
version: "1.1.0"
category: dev-programming
platforms: [windows, macos, linux]
author: SynomosAI
license: MIT
tags: ["文档抽取", "docx", "xlsx", "html", "文本提取", "extract", "markitdown", "本地解析", "零云", "Office", "表格", "正文", "document parsing", "offline"]
---

# 本地文档抽取 MCP(SynomosAI)

> 🌐 作者 Author: SynomosAI(品牌 SynomosAI) | 类型: 本地 MCP 工具(纯 stdlib 单文件,零依赖零 Key)
> .docx/.xlsx/.html/.txt/.md/.json/.csv 纯文本抽取:Office 走 zipfile+XML 本地解析,零云零依赖,数据不出本机。

## 何时用(AI 触发条件) / When to use
- 用户上传/指向一个 docx/xlsx 要读内容
- 要批量把文档正文喂给 LLM
- 数据敏感不想用云转换

## 背后能力(MCP 工具) / Tools
| 工具 | 作用 |
|---|---|
| `extract_document` | 抽取 docx/xlsx/txt/md/json/csv 为纯文本 |
| `extract_html` | HTML 去脚本去样式取正文 |
| `list_supported` | 列出支持格式 |

## 标准工作流 / SOP
1. extract_document 传本机路径即可
2. xlsx 自动还原单元格为制表符文本
3. HTML 先 extract_html 去噪

## 铁律 / Hard rules
- **纯本地解析,数据不出机**
- **不支持加密/损坏文件时如实报错**

## 禁止行为 / Don't
- 不解析需密码的 Office 文件(提示解密后重试)

## 输入与输出 / IO
- 输入:以自然语言描述场景/数据即可,工具自行路由到对应函数;结构化参数按各工具 schema。
- 输出:结构化结果(等级/清单/区间/JSON),引用口径标注「参考框架/估算,非官方结论」。

## 接入与启用 / Setup
- 本地 mcp.json 加一条 stdio server,指向 `doc-extract/` 下的 server 脚本(随本技能包自带)。
- 纯标准库,无需 pip install;装完 WorkBuddy 重启即加载。

## 触发示例(用户会怎么说) / User trigger examples
- "读一下这份 docx 的正文:C:/path/报告.docx"
- "把这个 xlsx 的表格内容提出来"
- "这段 HTML 的正文是什么?"

## 与生态联动 / Ecosystem
- 属「理论驱动工具集」矩阵一员(白皮书见 `MedXpert理论驱动工具集_白皮书.md`);医疗合规链与 reg-*/samd-*/risk/pms 等互相引用。
- 上架渠道:WorkBuddy 开放平台连接器 + SkillHub + GitHub 三远端。

## 版本 / Version
- 1.0.0 · 2026-09-06 · 首批 SkillHub 包装

## 错误处理与失败模式
| 失败模式 | 表现 | 处置 |
|---|---|---|
| 加密文档 | zipfile 抛 RuntimeError / 请求口令 | 先解密再抽取,勿硬解析 |
| 图片型 PDF / 扫描件 | 抽出正文为空 | 走 OCR 路线;本工具只处理文本层 |
| 超大文件 | 内存/耗时超限 | 按页(PDF)/按节(Office)分段抽取,设置超时上限 |
| 复杂合并单元格表格 | 表格错位 | 先转 CSV 核对边界,再交给下游消费 |
## 反模式 FAQ
**Q:抽取出来是乱码/空内容?**
先判断文档类型:加密件需要口令;图片型扫描件没有文本层,要走 OCR。不要对硬骨头做无效重试。

**Q:超大文件直接读会怎样?**
容易内存超限/卡死。按页/按节分段抽取,设置超时上限。

**Q:提取的表格为什么错位?**
复杂合并单元格直接抽文本流会丢列对齐信息;先转 CSV 核对边界再消费。

**Q:抽取的原文会被上传或记日志吗?**
不会。全程本机解析零云依赖;不要把完整原文写入日志或外发,交付只保留用户要的片段。
## 安装与使用矩阵
| 宿主 | 安装位置 | 方式 |
|---|---|---|
| Claude Code / CodeBuddy | `~/.claude/skills/doc-extract/` | 复制本目录即可 |
| OpenCode | `~/.config/opencode/skills/doc-extract/` | 复制本目录即可 |
| 通用 Agent Skill 加载器 | `~/.agents/skills/doc-extract/` | 复制本目录即可 |
---

[![LGD-Powered · 凡自治之物](https://medxpert.cn/badge/powered/svg/lgd-powered-cn.svg)](https://medxpert.cn)

> © 2026 SynomosAI(诺声 Logos 署名体系)· MIT License · 按现状(AS IS)提供,不作任何明示或暗示担保

如何安装此技能?

访问技能市场,点击「安装」按钮,按提示将技能包放入 AI 编程助手的 skills 目录即可。

浏览技能市场

支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手