BabelDOC Skill:PDF学术论文翻译神器,保留公式排版的双语对照工具
BabelDOC 是一款专注于 PDF 学术论文翻译与双语对照的开源工具,能够在保留原文排版(公式、表格、图形)的前提下,将文档译为目标语言并生成双语对照 PDF。它既提供在线体验(每月 1000 页免费额度),也支持本地部署和 CLI 调用,适合研究者和翻译工作者。截至 2026-08-10,BabelDOC 在 GitHub 已累计约 9,200+ Star、750+ Fork,今日新增 55 Star,持续保持 Python Trending 热度。
功能与原则
BabelDOC 解决的核心问题是:PDF 翻译过程中排版结构丢失。大多数翻译工具只能抽文本再贴回,公式被乱码、表格错位、图表消失。BabelDOC 通过一个标准化管道,先解析 PDF 的空间布局(文字块、公式、表格、图形坐标),再逐区域翻译,最后按原始坐标重新渲染,确保译后排版与原文高度一致。
核心设计原则:
– 结构感知:以 PDF 元素(块、公式、表格、图像)为单位处理,而非整页文本流
– 格式保真:保留字体、字号、颜色、位置关系
– 双语对照:支持原文/译文双栏对照输出,便于对照阅读
– 多后端兼容:支持 OpenAI、Claude、Gemini 等任意 LLM API
认可度
- GitHub Star:约 9,248(截至 2026-08-10),Fork 759
- 今日新增:55 Star,持续出现在 GitHub Python Trending 日榜
- 社区讨论:CSDN、博客园、知乎、掘金均有深度教程,GitHub Commits 1,828 次,开发活跃度高
- 发布渠道:提供官方在线体验(沉浸式翻译 BabelDOC)、PyPI 安装包、Docker 自部署方案
链接
GitHub:https://github.com/funstory-ai/BabelDOC
原作者
funstory-ai 团队,专注于 AI 驱动的文档处理与翻译,开源项目还包括 PDFMathTranslate-next 等文档翻译相关工具链。
介绍
BabelDOC(Yet Another Document Translator)是一款开源 PDF 科学文献翻译与双语对比库。它的工作流程分三个阶段:
阶段一:PDF 解析。BabelDOC 内置 PDF 解析器,逐页提取文字块坐标、字体信息、公式图像位置,生成一份完整的”版面地图”。
阶段二:LLM 翻译。按区域将内容送入 LLM API 翻译,支持指定源语言和目标语言。可接入 OpenAI GPT-4o-mini、Claude、Gemini 等任意兼容 OpenAI 接口的模型。
阶段三:版面重建。将译文按原文坐标重新渲染进 PDF,生成排版保真的目标语言版本。支持双栏对照(原文 + 译文左右对照,或奇偶页交替排版)。
除 CLI 外,BabelDOC 还提供 Python API,可集成到其他程序中作为翻译组件使用。活跃开发者还制作了 VS Code 插件,方便在编辑器内直接调用翻译。
特点
- 排版保真:公式、表格、脚注、页眉页脚均按原始坐标精确还原
- 双语对照:一键生成原文/译文对照 PDF,阅读体验接近原生文献
- 多语言支持:内置数十种语言对,中英/中日/英德等主流语言对开箱即用
- 离线资源:支持下载语言模型资源包,减少在线 API 调用
- 扫描件 OCR 兼容:内置扫描文档检测和 OCR 兜底策略,扫描版 PDF 也能处理
- 安全加固:CMap 加载器已做反序列化安全加固,避免恶意 PDF 攻击
使用方法
安装(推荐 uv):
uv tool install --python 3.12 BabelDOC
babeldoc --help
基本翻译命令:
babeldoc --openai
--openai-model "gpt-4o-mini"
--openai-base-url "https://api.openai.com/v1"
--openai-api-key "your-api-key-here"
--files example.pdf
--lang-in en
--lang-out zh
Python API 调用:
from babeldoc.document_translator import DocumentTranslator
translator = DocumentTranslator(
target_lang="zh",
llm_config={
"provider": "openai",
"model": "gpt-4o-mini",
"api_key": "your-key",
}
)
translator.translate("input.pdf", "output.pdf")
在线体验:访问 https://app.immersivetranslate.com/babel-doc/,每月 1000 页免费额度,无需配置环境。
使用场景与人群
适用场景:
– 学术论文翻译(保持数学公式排版是刚需)
– 技术文档本地化
– 扫描版 PDF 的 OCR 翻译兜底
– 翻译工作流自动化集成
目标用户:
– 研究者:需要快速翻译 arXiv、PubMed 等英文文献
– 翻译工作者:需要保留排版的批量文档翻译
– 开发者:将翻译能力集成到自己的文档处理工具中
输入与输出案例
案例一:arXiv 论文翻译
输入:一篇 12 页含大量 LaTeX 数学公式的 arXiv PDF(英文)
babeldoc --files arxiv-paper.pdf --lang-in en --lang-out zh --openai --openai-model "gpt-4o-mini" ...
输出:中文化论文 PDF,所有公式排版不变,双栏对照版可切换原文/译文显示。
案例二:扫描版 PDF 翻译
输入:一份扫描版中文 PDF(古籍数字化)
babeldoc --files ancient-doc.pdf --auto-enable-ocr-workaround --lang-in zh --lang-out en
输出:英文翻译 PDF,OCR 自动检测并启用文字识别,再完成翻译重建。
评论区
登录后可评论。