19,943 Stars 的 ebook2audiobook:把任何电子书变成「听起来不廉价」的有声书

19,943 Stars 的 ebook2audiobook:把任何电子书变成「听起来不廉价」的有声书


一款工具,GitHub 上攒了快 2 万颗星,支持 1158 种语言、8 种 TTS 引擎、语音克隆,官方还提供了 Colab、Kaggle 和 HuggingFace 在线跑的方式——不需要高端显卡,官方说 2GB 内存 + 1GB 显存就能跑。

这是 DrewThomasson/ebook2audiobook,一个开源电子书→有声书转换工具。它的核心价值主张很直接:让你在合法范围内,把手里的电子书变成可以听的有声书,而且听起来像真人朗读,而不是机械音。

它能做什么

支持的输入格式相当宽泛:epub、mobi、azw3、fb2、pdf、txt、rtf、doc、docx、html、odt 这些常见格式都能吃,还支持 tiff/png/jpg(带 OCR 文字识别)。甚至可以把一整个 zip 包扔进去批量处理。

输出格式同样全面:mp3、m4b、flac、aac、ogg、wav、webm 都支持,还能输出成带章节标记的 m4b(iTunes/Audible 那种格式,有章节名和封面元数据)。

TTS 引擎可选,这是它区别于大多数同类工具的地方。内置支持 XTTSv2(目前最接近真人的开源方案)、Bark、Fairseq、VITS、Tacotron2、Tortoise、GlowTTS、YourTTS。不同引擎在质量、速度、显存占用上各有权衡,用户可以按自己机器的配置和需求选。

语音克隆是另一个被社区高频提及的功能——上传一段你自己或任何授权人的音频(最好 30 秒以上),就能让 TTS 用这个声音来朗读整本书。这在今天已经不算黑科技,但把它做成开箱即用的流程,确实降低了使用门槛。

实际体验门槛有多高

官方的最低要求写得很克制:2GB RAM + 1GB VRAM。但这是下限,实际体验上 8GB RAM 是更舒服的起点。

具体场景的体感数据(来自社区反馈和 README 记录):

  • 一本 10 万字的书,用 XTTSv2 在 RTX 3060 上跑,大约需要 2-4 小时
  • Bark 速度快很多,但声音质量不如 XTTSv2 自然
  • CPU 模式可以跑,但速度大约是 GPU 的 1/5 到 1/3
  • 语音克隆质量高度依赖克隆音频的清晰度和时长,用高质量音频克隆出来的声音和原始声音的相似度可以很高

安装方式有四种:Docker(最省事,一条命令起容器)、pip 直接装、Gradio Web UI(带 GUI,适合不想敲命令的人)、纯 headless 命令行。对于不想折腾环境的用户,HuggingFace Spaces 和 Google Colab 是成本最低的体验方式——白嫖 GPU,直接用。

它不适合谁

第一个边界很清楚:它只能处理没有 DRM 的合法电子书。从 Amazon/Kindle 买的 azw3 带 DRM,需要先 DeDRC 化再喂给它,这在多数国家的法律框架下处于灰色地带,工具本身也有明确声明不为此负责。

第二个门槛是有声书不是即时产物。跑一本长书花几小时是常态,中途断电就得重来,没有云端排队任务的概念。如果你的需求是「立刻马上要听」,它不合适。

第三个是声音质量的上限仍然受限于 TTS 本身。XTTSv2 已经是开源方案里顶尖的了,但和真人专业播音员比,停顿、语气、重音偶尔还是会有机械感。尤其是小说类叙事文本,机械感会比非虚构类更明显。

适合谁用

视障人士或阅读障碍用户:这是最直接的价值——把电子书变成可以听的格式,语音克隆还能用自己熟悉的音色来听。

研究人员和知识工作者:大量论文、报告、书籍,有声化后可以在通勤、运动时「读」,不耽误眼睛。

语言学习者:支持 1158 种语言,可以用目标语言的音色来听该语言的书籍,对听力和语感训练有实际价值。

内容创作者:把版权清晰的书籍内容转成音频播客素材,或者生成多语言版本的有声内容。

下一步建议

如果想先试水,建议从 Google Colab 走——官方 Notebook 已经封装好环境,点开就能跑,不需要配 Python 环境,也不需要自己有 GPU。

如果确定要本地长期用,Docker 方式是维护成本最低的选择,一条命令拉起 Gradio 界面,后续升级也只是一行 pull 的事:

docker run -d -p 13333:8080 
  -v "$(pwd)/books:/books" 
  athomasson2/ebook2audiobook

然后浏览器打开 http://localhost:13333 就是 Web UI。

如果对声音质量要求高,先读一遍 GitHub Discussions 里关于 XTTSv2 调参和语音克隆的帖子,里面有大量社区验证过的实战经验,比 README 详细得多。


评论区

0 条评论

登录后可评论。