d
doc-extract
作者:注册老炮@MedXpert I SynomosAIv2
当用户需要从 Office 文档(docx/xlsx)、HTML、纯文本中抽取正文/表格内容喂给 AI 处理,但不想把文档上传到任何云转换服务时使用。数据全程本机解析。
下载量
273
点赞
68
价格
免费
技能文档
--- name: doc-extract slug: doc-extract display_name: "本地文档抽取 MCP(SynomosAI)" displayName: "本地文档抽取 MCP(SynomosAI)" summary: ".docx/.xlsx/.html/.txt/.md/.json/.csv 纯文本抽取:Office 走 zipfile+XML 本地解析,零云零依赖,数据不出本机。" description: "当用户需要从 Office 文档(docx/xlsx)、HTML、纯文本中抽取正文/表格内容喂给 AI 处理,但不想把文档上传到任何云转换服务时使用。数据全程本机解析。" description_en: "Local document text extraction: docx/xlsx (zipfile+XML) / html / txt / md / json / csv to plain text, fully offline & dependency-free. Data never leaves the machine." version: "1.1.0" category: dev-programming platforms: [windows, macos, linux] author: SynomosAI license: MIT tags: ["文档抽取", "docx", "xlsx", "html", "文本提取", "extract", "markitdown", "本地解析", "零云", "Office", "表格", "正文", "document parsing", "offline"] --- # 本地文档抽取 MCP(SynomosAI) > 🌐 作者 Author: SynomosAI(品牌 SynomosAI) | 类型: 本地 MCP 工具(纯 stdlib 单文件,零依赖零 Key) > .docx/.xlsx/.html/.txt/.md/.json/.csv 纯文本抽取:Office 走 zipfile+XML 本地解析,零云零依赖,数据不出本机。 ## 何时用(AI 触发条件) / When to use - 用户上传/指向一个 docx/xlsx 要读内容 - 要批量把文档正文喂给 LLM - 数据敏感不想用云转换 ## 背后能力(MCP 工具) / Tools | 工具 | 作用 | |---|---| | `extract_document` | 抽取 docx/xlsx/txt/md/json/csv 为纯文本 | | `extract_html` | HTML 去脚本去样式取正文 | | `list_supported` | 列出支持格式 | ## 标准工作流 / SOP 1. extract_document 传本机路径即可 2. xlsx 自动还原单元格为制表符文本 3. HTML 先 extract_html 去噪 ## 铁律 / Hard rules - **纯本地解析,数据不出机** - **不支持加密/损坏文件时如实报错** ## 禁止行为 / Don't - 不解析需密码的 Office 文件(提示解密后重试) ## 输入与输出 / IO - 输入:以自然语言描述场景/数据即可,工具自行路由到对应函数;结构化参数按各工具 schema。 - 输出:结构化结果(等级/清单/区间/JSON),引用口径标注「参考框架/估算,非官方结论」。 ## 接入与启用 / Setup - 本地 mcp.json 加一条 stdio server,指向 `doc-extract/` 下的 server 脚本(随本技能包自带)。 - 纯标准库,无需 pip install;装完 WorkBuddy 重启即加载。 ## 触发示例(用户会怎么说) / User trigger examples - "读一下这份 docx 的正文:C:/path/报告.docx" - "把这个 xlsx 的表格内容提出来" - "这段 HTML 的正文是什么?" ## 与生态联动 / Ecosystem - 属「理论驱动工具集」矩阵一员(白皮书见 `MedXpert理论驱动工具集_白皮书.md`);医疗合规链与 reg-*/samd-*/risk/pms 等互相引用。 - 上架渠道:WorkBuddy 开放平台连接器 + SkillHub + GitHub 三远端。 ## 版本 / Version - 1.0.0 · 2026-09-06 · 首批 SkillHub 包装 ## 错误处理与失败模式 | 失败模式 | 表现 | 处置 | |---|---|---| | 加密文档 | zipfile 抛 RuntimeError / 请求口令 | 先解密再抽取,勿硬解析 | | 图片型 PDF / 扫描件 | 抽出正文为空 | 走 OCR 路线;本工具只处理文本层 | | 超大文件 | 内存/耗时超限 | 按页(PDF)/按节(Office)分段抽取,设置超时上限 | | 复杂合并单元格表格 | 表格错位 | 先转 CSV 核对边界,再交给下游消费 | ## 反模式 FAQ **Q:抽取出来是乱码/空内容?** 先判断文档类型:加密件需要口令;图片型扫描件没有文本层,要走 OCR。不要对硬骨头做无效重试。 **Q:超大文件直接读会怎样?** 容易内存超限/卡死。按页/按节分段抽取,设置超时上限。 **Q:提取的表格为什么错位?** 复杂合并单元格直接抽文本流会丢列对齐信息;先转 CSV 核对边界再消费。 **Q:抽取的原文会被上传或记日志吗?** 不会。全程本机解析零云依赖;不要把完整原文写入日志或外发,交付只保留用户要的片段。 ## 安装与使用矩阵 | 宿主 | 安装位置 | 方式 | |---|---|---| | Claude Code / CodeBuddy | `~/.claude/skills/doc-extract/` | 复制本目录即可 | | OpenCode | `~/.config/opencode/skills/doc-extract/` | 复制本目录即可 | | 通用 Agent Skill 加载器 | `~/.agents/skills/doc-extract/` | 复制本目录即可 | --- [](https://medxpert.cn) > © 2026 SynomosAI(诺声 Logos 署名体系)· MIT License · 按现状(AS IS)提供,不作任何明示或暗示担保
支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手