书
书匠——炼书成器
作者:鹿Sir通用技能v1
从中文书籍自动提取方法论、思维模型与可复用技能,生成一个跨项目可用的 skill。当用户上传一本书(PDF/TXT/EPUB/MOBI/DOCX/MD)并希望从中提炼可复用的方法论、思维模型或语录金句时触发。触发词:把书做成skill、从书中提取方法、炼书成器、书籍转技能。
下载量
285
点赞
72
价格
免费
技能文档
---
name: book-to-skill-pro
title: 书匠——炼书成器
category: 通用技能
description: 从中文书籍自动提取方法论、思维模型与可复用技能,生成一个跨项目可用的 skill。当用户上传一本书(PDF/TXT/EPUB/MOBI/DOCX/MD)并希望从中提炼可复用的方法论、思维模型或语录金句时触发。触发词:把书做成skill、从书中提取方法、炼书成器、书籍转技能。
---
# 书匠——炼书成器
从书籍中提取技能/方法论/思维方式,并自动创建可复用 skill 的元技能。
## 何时使用我
- 用户上传一本书或长文档,并表达类似意图:"把这本书变成 skill""从《XX》里提取方法""这本书能做成我的助手吗""把作者的思维方式沉淀下来"
- 用户想把某本书的"干货"固化为自己以后能直接调用的能力
如果你判断用户只是想**读/总结**一本书,而不是"做成 skill",先确认意图,不要一上来就生成 skill。
---
## 2 分钟快速开始
> **用户只需做 2 件事:① 把书发给我(或告诉书名)→ ② 确认"要生成 skill"。其余步骤自动处理。**
**一句话激活**:"把这本书做成 skill" / "从《XX》里提取方法" / "上传这本书,帮我提炼可复用 skill"。
**系统会自动**:
1. 判断书的格式 → 选最省力的读取方式
2. 摸目录结构 → 定位核心方法论章节 → 精读提取
3. 生成命名 + 描述 + 模板 → 质量自检 → 给你确认 → 保存到用户级 skills 目录
**进阶玩法**(可选):
- 想拆成多个 skill:加一句"拆成多个"
- 已有旧版要增量更新:加一句"增量更新"
- 要特定模板(语录/心法):加一句"用语录型模板"
---
## 支持的格式与中文读取链路
| 格式 | 推荐读法 | 说明 |
|------|----------|------|
| `.md` / `.txt` | 直接读取 | 中文 TXT 常是 GBK 编码,先检测编码再转 UTF-8 |
| `.pdf` | 文本型用 `pdftotext`;扫描型需 OCR | 中文 PDF 多为扫描/双栏/复杂排版,直接提取易乱码缺字 |
| `.epub` / `.mobi` | Calibre `ebook-convert` 先转 Markdown | 中文 EPUB/MOBI 常有 DRM,转 MD 最稳 |
| `.docx` | python-docx 抽取 | 中文书常**不带 Word 标题样式**,需回退文本特征重建目录 |
### 中文 PDF 专项
1. **先判断文本型还是扫描型**:用 `pdftotext book.pdf - | head` 看输出。有可读文字→文本型;空白/乱码→扫描型。
2. **文本型**:`pdftotext -layout book.pdf book.txt`(`-layout` 尽量保排版)。中文双栏可能串栏,转完要检查。
3. **扫描型(需 OCR)**:优先用带中文包的 OCR。思路:用 PyMuPDF 拆页 → 逐页 `tesseract page.png out -l chi_sim+eng` → 拼接。
- **失败回退**:`pdftotext` 未安装 → 用 `pymupdf`/`pdfplumber` 替代;`tesseract` 未安装 → 改用 `rapidocr-onnxruntime`(纯 Python)或 `paddleocr`。
4. **复杂排版(双栏/图表混排)**:提取后人工/脚本修正跨栏错行。
### EPUB/MOBI 实战命令
```bash
ebook-convert book.epub book.md
ebook-convert book.mobi book.md
```
> **失败回退**:`Calibre` 未安装 → 用 `python-ebooklib` 直接读 EPUB 解析文本。
### 中文 DOCX 专项
1. **抽取全文**:用 `python-docx` 遍历段落与样式。但**真实中文书往往完全不用 Heading 样式**。
2. **样式为空时的回退**:用文本特征重建目录——正则匹配 `^第[一二三四五六七八九十百零0-9]+章`、`^序|前言|引言|附录|后记`。
3. **分页符/页码**:docx 提取通常**丢失物理页码**;优先用"章节 + 小节"定位。
> **失败回退**:`python-docx` 不可用 → 用 `docx2txt` 一键提取纯文本;仍不行 → 用 `pandoc` 把 docx 转 MD。
### 编码检测与清洗
```bash
file book.txt
iconv -f GBK -t UTF-8 book.txt > book.utf8.txt
```
> **失败回退**:用 Python `chardet` 自动检测编码。
---
## 技能工作流
### 步骤1:分层精读(控 token,抓重点)
中文书动辄几十万字,全量读必爆 context。采用分层策略:
1. **目录层**:先读目录/章节标题,建立结构地图。
2. **摘要层**:对每章只读开头结尾与黑体/小标题,抓核心论点。
3. **精读层**:只对"核心方法论章""关键案例章"做深读,其余略过。
4. 如章节过长,用脚本按章节切分后**逐章处理**。
5. **终止条件**:精读覆盖"所有承载核心术语/方法/模型的章节"即可;当连续若干章**未出现新的方法论术语**时,停止深读。
### 步骤2:清洗与去噪
- **统一编码**:全部转 UTF-8。
- **过滤无关内容**:序言/自序/致谢/参考文献/索引/版权页/广告插页——默认剔除。
- **案例型书要防"案例稀释"**:方法论提取时**默认降权或跳过纯案例章**,仅保留"能佐证方法的最小案例片段"。
- **中文特有修正**:合并被换行打断的段落;去除多余空格;OCR 常见误字酌情修正;保留原书标点与专有名词原貌。
### 步骤3:提炼核心模型(最关键)
> 这一步决定生成 skill 的质量上限。**不是"提取六个维度"的平铺,而是"从一本书里提炼出核心模型"的深度操作。**
#### 3a. 核心模型提取法(5 步)
**第 1 步:扫作者自命名的框架**
用 Grep 搜原书全文,找信号词:`模型|法则|循环|工程|精神|定律|公式|方程|原则|铁律|维度|步骤|方法`。把命中的概念列成候选清单。
**第 2 步:锁定每个模型的精确定义**
每个候选模型,**回到原文用 Grep 定位定义**。优先用原书的**图**标题和注释;原书有明确一句话定义 → 直接引用,标出处;找不到明确定义 → 标"待核实"。
**第 3 步:梳理模型间关系(最关键)**
核心模型之间通常有三种关系:
- **层级关系**:A 包含 B
- **流程关系**:A → B → C
- **支撑关系**:A 是 B 的基础
关系图示例:
```
制造大师模型(全书主线)
├─ 四阶段:准备 → 出场 → 演出 → 谢幕
│ ├─ 出场:痛点教学(挖痛四维 + 痛点三方法)
│ ├─ 演出:实效教学(结构实效 + 方法六面模型)
│ └─ 谢幕:行动教学
└─ 三基础:大师基因 / 大师秘诀 / 大师境界
```
**第 4 步:从案例反推隐含模型**
作者没明确命名框架,但反复用同一种方法解决问题 → **隐含模型**。标注"隐含模型,非原书命名"。
**第 5 步:模型验证(3 问)**
1. 这个模型原书有没有明确说?
2. 边界条件是什么?
3. 输入→输出是什么?
#### 3b. 六维补充
核心模型确定后,补充:核心主题、关键概念、方法论、思维方式、实践步骤、应用场景。
#### 3c. 译本必做——术语统一表
中文译本术语常不统一。提取前建立"统一译法→原文词"对照表,全书统一使用。
#### 3d. 六维 → 模板内容映射表
| 提取内容 | 应放入模板的位置 | 哪类模板必须填 |
|---------|----------------|-------------|
| 核心模型 + 关系图 | 「核心模型」节 | A/C/E |
| 核心主题 | 「概述」节 | A/B/C/E |
| 关键概念 | 「术语表」或「核心概念」节 | 全部 |
| 方法论细节 | 「具体步骤」/「运用要点」 | A/C/B/E |
| 思维方式 | 「这是什么」+「如何培养」 | B/C |
| 实践步骤 | 「具体步骤」/「实践技巧」 | A/C/D |
| 应用场景 | 「应用场景」/「适用形势」 | A/C/D/E |
### 步骤4:命名规范
- **`name` 字段**:必须**英文小写 slug**,连字符分隔,≤ 40 字符,只能含 `[a-z0-9-]`。
- **人类可读标题**:放在正文 H1 与 `description` 里用中文。
- 命名要体现核心技能,不要用书名全称。
### 步骤5:写高质量 description
`description` 是系统判断"何时调用这个 skill"的**唯一依据**。写法:
> **[这个 skill 是什么]** + **[何时用 / 触发场景]** + **[动词开头的动作]**
硬性要求:
- 必须含触发词
- 中文同名词要消歧
- 长度适中(1–3 句)
### 步骤6:选模板生成
根据书的性质选模板:
- 步骤/流程清晰 → 模板 A(方法论型)
- 认知升级/心智模型 → 模板 B(思维方式型)
- 既有步骤又有认知 → 模板 C(综合型)
- 金句/语录/原则 → 模板 D(语录型)
- 战略/策略/兵法 → 模板 E(战略心法型)
- 分不准时默认**模板 C**
模板详情见 [references/templates.md](references/templates.md)。
### 步骤7:出处回溯
在 skill 目录下生成 `references/出处索引.md`,记录关键观点对应的**原书章节/小节**。
### 步骤8:质量自检
- [ ] 核心模型已提炼,每个模型定义已回原文锁定
- [ ] 模型关系图已梳理,放在 skill 最前面
- [ ] `name` 是英文小写 slug,≤ 40 字符
- [ ] `description` 含触发词 + 使用场景 + 动词动作
- [ ] 内容可操作/可调用,不是空泛摘要
- [ ] 未编造原书没有的引用
- [ ] 隐含模型已标注
- [ ] 译本术语已统一
- [ ] 去噪完成
- [ ] 用了合适的模板
### 步骤9:保存与落地
- **默认路径**:用户级 skills 目录(跨项目可用)。
- 先给用户确认:展示生成的 SKILL.md 与目录结构,用户认可后再落盘。
- 生成的目录结构:
```
<name>/
├── SKILL.md # 主文件(frontmatter + 正文)
└── references/ # 可选
├── 详细方法论.md
├── 案例和示例.md
└── 出处索引.md
```
---
## 进阶:一书多 skill & 增量更新
**一书拆多 skill**(文集/语录体):按"独立可调用的最小能力单元"切分。
**增量更新**:先读旧 skill → 新内容做 diff → 只补充/修正差异部分 → 重新跑自检。
---
## 注意事项
- **concise is key**:提取最核心、最可操作的内容。
- 书太泛时,聚焦 1–2 个核心技能。
- 保留原书语气与措辞的精华。
- 任何"解读/延伸"要与"原书内容"区分清楚。
- **绝不写入任何个人密钥**;不依赖任何个人绝对路径。
## 参考资料
- 模板详情 → [references/templates.md](references/templates.md)
- 常见问题 → [references/faq.md](references/faq.md)
- 完整示例 → [references/example.md](references/example.md)使用说明
# 书匠——炼书成器 从中文书籍自动提取方法论、思维模型与可复用技能,生成一个跨项目可用的 skill。 ## 使用 发一本书(任何格式),说一句话即可: ``` 把这本书做成 skill ``` 系统自动识别格式、提取核心方法论、生成可复用 skill。 ## 工作原理 1. **识别格式** → 文字版直接解析,扫描版自动 OCR 2. **分层精读** → 目录层 → 摘要层 → 精读层,控制 token 消耗 3. **提炼核心模型** → 锁定作者自命名框架,梳理模型间关系 4. **选模板生成** → 根据书的内容自动匹配最佳模板(方法论/思维方式/语录/战略心法) 5. **质量自检** → 核对核心模型、术语统一、出处回溯 ## 支持格式 | 格式 | 处理方式 | |------|---------| | `.docx` | python-docx 解析,自动重建目录 | | `.epub` / `.mobi` | Calibre 转 MD | | `.txt` / `.md` | 自动检测编码转 UTF-8 | | 文字版 `.pdf` | pdftotext 提取 | | 扫描版 `.pdf` | OCR(rapidocr/paddleocr) | ## 进阶用法 - `拆成多个` — 文集/语录体拆分为多个 skill - `增量更新` — 已有旧版时只补充差异 - `用语录型模板` — 指定模板类型
支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手