WORKBUDDY 上手手册 · 第三部分 · 进阶:Skill 与自动化
第 23 章 打造 Skill:将书和视频蒸馏为可执行 Skill
知识精馏:用 cangjie-skill 六阶段 SOP 把书本和视频中的方法论转化为带触发条件的可执行 Skill——它不是摘要、笔记或 RAG,而是让 Agent 在对的时刻主动拿出对的框架。
展开本章目录
本章适合谁
- 读完书、做完笔记,两周后遇到真实问题方法论却抓不住的人
- 想把专家方法论、经典著作、高价值课程沉淀为团队可复用 Skill 的人
开始前的准备
- 蒸馏前最好读过或看过一遍原材料——蒸馏是阅读后的知识结构化工具,不是替代阅读
- 准备开源工具 cangjie-skill(GitHub:kangarooking/cangjie-skill;v1 蒸馏书,v2 增加视频蒸馏)
- 视频蒸馏还需 video-downloader skill;预期 Token 消耗密集(一本书约数万至十余万 Token、30–90 分钟)
制作 Skill,除了把自己的 SOP 沉淀为 Skill 外,还有一条更省力的路:用开源项目 cangjie-skill(GitHub:kangarooking/cangjie-skill)把知识蒸馏成 Skill。它 v1 支持蒸馏书,v2 增加了视频蒸馏,思路部分来自 Andrej Karpathy 关于 LLM 个人知识库的想法。本章回答:如何将书本和视频中的方法论转化为 Agent 可自动调用的 Skill,以及这与 RAG 检索的本质差别在哪里。
问题起点:知识读了但用不起来
AI 在训练时已经摄入了大量经典著作,但在实际问答中往往输出「正确的废话」——每个字都对,但缺乏针对特定问题的可落地步骤。这不是幻觉问题,而是调用机制问题:AI 知道书里有什么,但不知道该在什么场景下主动调出哪个框架。
人类读者面临同样的问题:读完一本书,笔记做了、金句划了,合上书以为升级了。两周后遇到真实问题,那些方法论却抓不住——知识在记忆里,但激活路径不清晰。知识精馏要解决的,就是这个「学了用不上」。
知识精馏的定义
知识精馏(Knowledge Distillation for Skills):从书本或视频中,提取出具有独立触发条件和执行步骤的原子化知识单元(Skill),使 Agent 在遇到对应场景时能够自动激活并给出可落地的行动路径。
化学中的精馏是按沸点将混合物分离成不同纯净组分。知识精馏按「框架 / 原则 / 案例 / 反例 / 术语」五个维度,将书或视频中的知识分离成不同类型的纯净组分,然后只把真正有用的提纯成可执行的 Skill。
知识精馏不是:摘要(压缩原文)、读书笔记(结构化原文)、RAG 索引(存储原文片段供检索)。知识精馏是:将方法论转化为 Agent 能够在真实场景下自动调用的执行单元。
六阶段蒸馏 SOP
- 阶段 0:整书 / 整片理解
- 阶段 1:五个 Agent 并行提取
- 阶段 1.5:三重验证筛选
- 阶段 2:构造 Skill
- 阶段 4:链接——建立 Skill 关系网络
- 阶段 5:压力测试
阶段 0:整书 / 整片理解
不从摘取金句开始,而是先读清整本书的骨架:全书主旨是什么;核心论证链怎么走;关键术语作者如何定义和使用;作者自身的局限与盲点在哪里。这一步决定后续提取的质量上限——跳过它直接提取,容易把作者反对的观点当成他支持的方法论。
阶段 1:五个 Agent 并行提取
| Agent | 提取目标 |
|---|---|
| 框架提取 Agent | 作者构建的分析或决策框架 |
| 原则提取 Agent | 可跨场景复用的行为原则 |
| 案例提取 Agent | 作者援引的正面案例和成功路径 |
| 反例提取 Agent | 作者援引的失败案例和反面教训 |
| 术语词典 Agent | 作者专有术语及其定义 |
五个角度并行,避免单线阅读中的视角遗漏。
阶段 1.5:三重验证筛选
每个候选知识单元必须通过三关,未通过直接淘汰:
| 验证类型 | 检查内容 |
|---|---|
| 跨域验证 | 该方法论在书中至少两个独立场景出现过,不是孤证 |
| 预测力测试 | 能用它推导出书中没有直接讨论的问题吗 |
| 独特性检验 | 是不是任何人都能说出来的常识?常识不构成 Skill |
阶段 2:构造 Skill
每个通过验证的知识单元被构造成一个 Skill,核心是设计触发条件:什么场景下自动激活;激活后执行什么步骤;什么时候不该用(边界);质量验证标准是什么。触发条件的设计是最难也最关键的一步——没有触发条件的 Skill,在实际使用中无法被 Agent 正确识别和调用。
阶段 4:链接
找出 Skill 之间的关系,形成知识网络:依赖(Skill A 的执行需要先调用 Skill B 的输出)、对比(适用于相似场景但方向相反)、组合(联合使用效果更好)。链接层让 Agent 在遇到复杂问题时,能够选择一组 Skill 而不只是单个 Skill。
阶段 5:压力测试
诱饵测试:故意给不该触发的场景,检验 Skill 是否能忍住不激活——一个没有边界的 Skill,在错误场景下调用反而帮倒忙。执行验证:给出真实问题,验证 Skill 是否能输出可落地的步骤而不是正确的废话。
蒸馏产物结构
book-skill/
├── README.md # 书目信息、蒸馏说明、适用场景
├── skills/
│ ├── skill-01.md # 每个 Skill 独立文件
│ ├── skill-02.md
│ └── ...
├── index.md # Skill 关系网络(链接层产物)
└── tests/
├── skill-01-test.md # 每个 Skill 的测试用例
└── ...每个 Skill 文件包含:触发条件、执行步骤、输出格式、边界限制、测试用例。测试用例格式兼容 darwin-skill(自动 Skill 进化工具),蒸馏产物可以持续自动优化。
知识精馏 vs RAG
| 维度 | RAG | 知识精馏(Skill) |
|---|---|---|
| 本质 | 检索——找出最相关的原文片段 | 提炼——从原文中提取可执行的方法论 |
| 使用前提 | 用户需要知道该问什么 | 用户描述问题,Skill 自动识别并激活 |
| 质量控制 | 无——任何内容都可以入库 | 三重验证过滤,宁缺毋滥 |
| 调用方式 | 被动等待查询 | 主动匹配场景并触发 |
| 知识形态 | 存储原文(记住知识) | 提纯为执行步骤(运用知识) |
| 边界控制 | 无 | 诱饵测试确保不乱激活 |
| 资源消耗 | 较重(需维护向量索引) | 较轻(Skill 文件即可) |
RAG 解决「知识管理」问题——让你能查到书里有什么。知识精馏解决「知识运用」问题——让 Agent 在对的时刻主动拿出对的框架。当你不知道该问什么时,RAG 帮不了你;Skill 不需要你记得书里有哪些方法论。
与 Karpathy LLM Wiki 思路的对比
Andrej Karpathy 提出 LLM 知识库(LLM Wiki)的思路:将原始资料索引到目录,让 LLM 编译成 Wiki,然后对 Wiki 做 Q&A,产出结果再回填,持续增强。cangjie-skill 的阶段 0(整书理解)和阶段 1(并行提取)吸收了这一核心思想。差别在最后几步:
| 对比点 | LLM Wiki | 知识精馏 |
|---|---|---|
| 产物形态 | Wiki 条目(结构化知识库) | Skill 集合(可执行单元) |
| 使用方式 | 用户主动查询 | Agent 被动触发后主动激活 |
| 解决问题 | 知识管理 | 知识运用 |
两种方案不互斥,但目标不同。
视频蒸馏工作流(v2 新增)
- 输入视频链接
- video-downloader skill:下载视频
- 提取音频
- ASR 转写为文案
- cangjie-skill:六阶段蒸馏
- 输出 Skill 集合
- 视频下载:使用 yt-dlp(开源工具)支持 YouTube、B 站等主流平台,输入链接即可自动下载;视频号因平台限制暂不支持自动化
- 音频转写:本地 Whisper 模型可用,但长视频转写耗时显著(一小时视频约需 48 分钟本地转写);推荐使用 ASR API 服务,速度快,适合批量处理
- 多视频合并蒸馏:同一主题的多个视频可以合并蒸馏,Agent 自动处理内容去重和知识单元合并,避免同一原则被重复提取为多个 Skill
分工设计:视频处理逻辑(下载、提取音频、转写)独立封装在 video-downloader skill 中,不集成到 cangjie-skill 内部。原因是职责分离——cangjie-skill 专注文本蒸馏,视频获取是前置准备步骤,两者可以独立演进。
适用与不适用场景
| 类型 | 适合程度 | 说明 |
|---|---|---|
| 方法论密度高的书 | ★★★★★ | 框架清晰,原则可提取,最适合 |
| 访谈 / 课程视频 | ★★★★☆ | 内容结构化程度较高,适合蒸馏 |
| 长视频 / 播客 | ★★★☆☆ | 可用,知识密度因内容而异 |
| 金句散文类书籍 | ★★☆☆☆ | 方法论少,蒸馏产物质量有限 |
| 小说 / 叙事文学 | ★☆☆☆☆ | 不适合,缺乏可提取的方法论框架 |
资源消耗与模型选择
| 场景 | 大致 Token 消耗 | 大致耗时参考 |
|---|---|---|
| 蒸馏一本普通书 | 数万至十余万 Token | 30–90 分钟 |
| 蒸馏 26 集课程视频(4 小时) | 较高 | 约 1 小时 |
| 蒸馏 4 个主题视频(80 分钟) | 中等 | 约 40 分钟 |
- 任务拆解和蒸馏协调:使用推理能力强的模型负责 Agent 编排
- 并行提取和验证:可使用性价比高的 Coding 模型执行
- 长上下文场景:选择原生支持长上下文的模型,避免因上下文截断导致蒸馏不完整
蒸馏产物的分享与复用
- 使用已蒸馏的 Skill:将 GitHub 仓库地址提供给 Agent,自动安装即可使用,无需重新蒸馏
- 社区协作:同一本书不需要被每个人重复蒸馏,任何人蒸馏的成果都可以开源复用
- 扩展应用:视频课程的蒸馏产物可以进一步构建课程 Agent,供学员问答和辅助实践
常见误区
- 「AI 训练过的书不需要再蒸馏」——即使 AI 训练过某本书,蒸馏的价值在于建立触发条件:让 AI 知道在什么场景下应该调出该书的哪个框架,而不只是「知道书里有什么」;小众书、新书和时效性强的视频则大概率没训练过
- 「蒸馏完就不需要看书了」——蒸馏是阅读的补充,不是替代;读过一遍后再蒸馏,产物质量和完整度显著更高
- 「AI 给了建议就能直接执行」——方向对不对、能不能执行、效果好不好,仍然需要人来判断;AI 给出的是选项和分析,决策是人的责任
- 「Skill 覆盖越多越好」——覆盖太宽的触发条件会导致在不适用场景被错误激活,反而误导;三重验证和诱饵测试的目的正是控制边界
蒸馏结果示例
原文以吴恩达《给所有人的 AI 入门课》(2026 版,26 个视频,时长约 4 小时)为例:蒸馏耗时约 1 小时,产出 25 个 Skill。特点是全部为时效性内容,AI 未经训练,蒸馏后可直接在对应场景下被 Agent 调用。
知识精馏在技能包体系中的位置
知识精馏是 Skill 的一种生产方式,它与 SOP → Skill 封装流程(见第 26 章岗位路线图)是并行的:
| 来源 | 适用场景 |
|---|---|
| 从业务流程提炼(SOP → Skill) | 企业内部操作规范、重复性业务流程 |
| 从书本 / 视频蒸馏(知识精馏) | 专家方法论、经典著作、高价值课程内容 |
版本说明:功能与界面可能随更新变化
- 资料整理于 2026-09-21,参考资料保存于 2026-09-20。
- 以下内容尚未逐项确认,请以当前应用为准:第三方开源项目(cangjie-skill / video-downloader / darwin-skill)的链接与版本;Token 消耗与耗时(原文参考值)。
读完后,检查一下
- 每个 Skill 都有明确触发条件、执行步骤、边界(什么时候不该用)和测试用例
- 候选单元过了三重验证(跨域、预测力、独特性);诱饵测试能忍住不激活
- 产物包含 index.md 关系网络,知道哪些 Skill 依赖、对比或组合使用
容易遇到的问题
- 以为 AI 训练过的书不需要蒸馏——蒸馏的价值是建立触发条件,不只是「知道书里有什么」
- 没读过就蒸馏——关键判断节点缺背景,产物遗漏重点
- 认为 AI 给了建议就能直接执行——AI 给的是选项和分析,决策是人的责任
- 触发条件覆盖太宽——不适用场景被错误激活反而误导;宁可窄一点,不要乱激活