book-to-skill Skill:将技术书籍一键转化为 AI Agent 可精准调用的知识库
总结
book-to-skill 是一个开源技术文档提取工具,能将任意技术书籍(PDF/EPUB/DOCX 等)一键转换为 AI Agent Skill 格式,让 Claude Code、GitHub Copilot CLI、AMP 等主流 AI 编程工具实现「随时精准调用书中知识」而非「每次全文塞入上下文」。截至 2026-07-27,GitHub 获 10.1k Stars、1.2k Forks,每日仍以 300+ Stars 的速度增长,曾入选 Trendshift「#10 Python Repository of the Day」与「#25 Repository of the Day」双料榜单,是当前 GitHub Trending Python 板块的热门新星。
功能与原则
book-to-skill 的核心能力是将一本书或一份技术文档,转化为结构化的 Agent Skill——包含核心心智模型索引(SKILL.md)、按章节拆分的随时调用文件(chapters/)、术语表(glossary.md)、设计模式汇总(patterns.md)和速查表(cheatsheet.md)。
设计原则:
- 按需加载:只把被问到的章节调入上下文,而非每次全量塞入(约省 24–51 倍 tokens)
- 结构化提取:不仅做文本抽取,更提炼出框架名称、决策规则、反模式等深层知识
- 本地处理:提取完全在本地完成,文件不离开用户机器
- 开放标准:遵循 Open Agent Skills 规范,Copilot CLI / Claude Code / AMP 均可使用
认可度
- GitHub Stars:10,100(截至 2026-07-27),1.2k Forks
- 今日新增 Stars:358(Python 日榜稳居前列)
- Trendshift:#10 Python Repository of the Day + #25 Repository of the Day(2026-05-23)
- Releases:3 个正式版本(最新 v1.2.0,支持多语言章节标题识别)
- 贡献者:16 人(含 @claude、@Copilot 等)
链接
GitHub:https://github.com/virgiliojr94/book-to-skill
原作者
@virgiliojr94(Virgilio F.)— 专注开发者效率工具,开源维护者,同时接受 GitHub Sponsors 资助。
介绍
技术书籍买了就读一遍,三个月后连第 7 章存在都想不起来——这是所有工程师的共同痛点。book-to-skill 正是为解决这一问题而生:运行 /book-to-skill your-book.pdf,即可将整本书转化为一个 AI Agent 能随时加载的 Skill。
生成的文件结构非常清晰:SKILL.md 包含核心心智模型和章节索引,chapters/ 目录按章节存放可按需调入的内容,glossary.md 收录所有关键术语(按字母排序并标注出处章节),patterns.md 汇总所有设计模式和算法技巧,cheatsheet.md 则提供决策表和速查规则。
生成后的使用体验极为自然:在 Claude Code 中输入 /designing-data-intensive-apps replication,Agent 便会自动读取对应章节并基于真实内容作答,不再出现幻觉或「我不知道这本书」的情况。更重要的是,提取成本约 1 美元/本,而每次重复使用 PDF 代理的 token 消耗是前者的 24–51 倍。
特点
- 多格式支持:PDF、EPUB、DOCX、TXT、Markdown、reStructuredText、AsciiDoc、HTML、RTF、MOBI/AZW 全覆盖
- 智能工具选择:自动识别技术类书籍(用 Docling 保留表格+代码块)或文字类书籍(用 pdftotext 秒级处理)
- 超低 Token 消耗:上下文转储的 1/24~1/51,每次仅加载 ~5K tokens(核心 + 单章节)
- 增量更新:可将新文章/论文折叠进已有 Skill,持续累积知识库
- 支持对比 RAG:NotebookLM 适合浅层检索大量书籍,book-to-skill 适合深层掌握单本专著;两者互补而非竞争
使用方法
安装为 Agent Skill(以 Claude Code 为例):
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.claude/skills/book-to-skill
转换一本书:
# 在 Claude Code / Copilot CLI / AMP 中直接运行
/book-to-skill ~/path/to/your-book.pdf
# 指定输出名称
/book-to-skill ~/path/to/your-book.pdf my-book-slug
# 处理文件夹
/book-to-skill ~/workspace/project-docs/ project-knowledge
# 更新已有 Skill(增量折叠新内容)
/book-to-skill ~/articles/new-paper.pdf ~/.claude/skills/project-knowledge
CLI 独立模式(pip):
pip install "book-to-skill[pdf,epub,docx]"
book-to-skill ~/path/to/book.pdf --mode text
book-to-skill --check # 检查依赖是否齐全
生成后的使用:
/designing-data-intensive-apps # 加载核心心智模型
/designing-data-intensive-apps replication # 查找并解释某主题
/designing-data-intensive-apps ch05 # 深入第 5 章
使用场景与人群
适用场景:
- 反复查阅的技术专著(《Designing Data-Intensive Applications》《深入理解计算机系统》等)
- 团队内部文档、架构决策记录、Runbook 的 Agent 化
- 品牌设计规范、API 合同、合规文档的知识库化
- 研究论文集群的汇总整理与持续更新
目标用户:
- 日常使用 Claude Code / GitHub Copilot CLI / AMP 的工程师
- 需要深度掌握某本技术书籍的开发者(面试准备、架构学习等)
- 有大量内部文档希望 AI 能精准调用的技术团队
输入与输出案例
输入:
/book-to-skill ~/books/DesigningDataIntensiveApps.pdf
输出(生成的文件结构):
~/.claude/skills/designing-data-intensive-apps/
├── SKILL.md (~4K tokens:核心心智模型 + 章节索引)
├── chapters/
│ ├── ch01-*.md (~1K tokens/章节,按需加载)
│ ├── ch02-*.md
│ └── ...
├── glossary.md (~1.5K tokens:所有关键术语,按字母排序)
├── patterns.md (~2K tokens:设计模式与算法汇总)
└── cheatsheet.md (~1K tokens:决策表与速查规则)
实际调用:
> /designing-data-intensive-apps 什么是 CAP 定理?
→ [Agent 自动加载 ch12-*.md,输出:
CAP 定理指出……(Berkeley, Kleppmann et al.)
书中原文:章节 12 详细讨论了在分布式系统中
一致性、可用性、分区容忍性的三元权衡……
]
Token 消耗对比:直接塞 PDF 全书约 200K tokens,用 book-to-skill 每次调用仅 ~5K tokens(核心 + 单章节),节省约 97.5%,且答案可溯源到原书章节。
评论区
登录后可评论。










