目录
PDFMathTranslate是一个由开源社区开发的开源项目,目前有多个活跃的分支和版本。它不是一家公司产品,而是由开发者们协作维护的工具。该项目在GitHub上拥有超过3.2万星标,深受科研人员欢迎。
它的诞生源于一个明确的需求:科学论文包含复杂的数学公式、图表和严谨的排版结构,通用翻译工具在处理这类文档时往往会导致公式错乱、格式丢失。PDFMathTranslate通过AI布局分析和PDF指令流解析,在翻译的同时完整保留原文的公式结构和排版样式。它与Zotero文献管理工具集成,方便科研人员在自己的工作流中直接使用。
官网入口地址
项目主页和在线体验入口:https://pdf2zh.com/
下载地址
-
GitHub项目地址:https://github.com/Mu-L/PDFMathTranslate
-
PyPI安装包:https://pypi.org/project/pdf2zh/
-
Windows便携版:从GitHub Releases页面下载
pdf2zh-version-win64.zip
功能介绍
PDFMathTranslate的功能围绕“保留排版的科学论文翻译”这一核心目标进行设计。
保留原始排版
利用AI布局分析和PDF指令流解析技术,精准识别并保留文档中的行内和行间公式、图表样式、表格结构、目录索引以及页脚注释,确保翻译后的文档与原文排版基本一致。
多翻译服务支持
兼容Google Translate、Bing、DeepL、OpenAI、Ollama、智谱AI等多种翻译服务,用户可根据需求和预算自由切换。
多语言互译
支持中、英、日、韩、俄等多种语言之间的翻译,满足不同语种文献的阅读需求。
命令行与图形界面
提供命令行工具(pdf2zh)和图形界面(pdf2zh -i)两种操作方式,适合不同技术背景的用户。
部分文档翻译
支持通过 -p 参数指定翻译页面范围,适合只关注论文特定章节的场景。
双语对照输出
每次翻译会生成两个文件:纯译文版本(-mono.pdf)和双语对照版本(-dual.pdf),方便对照阅读。
多线程加速
支持 -t 参数设置线程数,提升长文档翻译效率。
应用场景
-
学术文献阅读:翻译外文论文,完整保留公式和排版,帮助科研人员快速理解前沿成果。
-
文献综述撰写:批量翻译多篇论文,加速系统性文献调研。
-
跨语言团队协作:生成双语对照论文,方便不同语言背景的团队成员讨论。
-
国际会议准备:翻译自己的论文或相关文献,熟悉目标语言的技术表达。
使用方法
在线体验(无需安装)
访问官网提供的在线Demo,上传PDF即可体验翻译效果。计算资源有限,适合少量文档试用。
Python安装(推荐)
-
确保Python版本在3.8至3.12之间。
-
执行安装命令:
pip install pdf2zh。 -
基本翻译命令:
pdf2zh document.pdf(默认使用Google翻译,生成双语对照PDF)。
图形界面
在命令行执行 pdf2zh -i,浏览器会自动打开本地图形界面,通过上传文件和选语言即可操作。
Windows便携版
下载 pdf2zh-version-win64.zip 解压后,双击 pdf2zh.exe 即可运行,无需安装Python。
Docker部署
执行以下命令启动容器服务:docker pull byaidu/pdf2zh && docker run -d -p 7860:7860 byaidu/pdf2zh,然后访问 http://localhost:7860 使用。
Zotero插件
通过Zotero PDF2zh插件,在文献管理软件中直接调用翻译功能。
高级选项
-
指定翻译服务:
pdf2zh document.pdf -s deepl -
指定语言方向:
pdf2zh document.pdf -li en -lo zh -
翻译指定页面:
pdf2zh document.pdf -p 1-3
服务支持
-
定价模式:开源免费。软件本身免费,使用Google/Bing等免费翻译服务无需额外付费。使用DeepL、OpenAI等付费服务时,需自行拥有对应API密钥并按服务商标准付费。
-
开发者信息:由开源社区协作开发,项目核心维护团队为Byaidu。贡献者包括多个GitHub开发者。
-
网络问题提示:部分地区用户下载AI模型遇到困难,可通过设置环境变量
HF_ENDPOINT=https://hf-mirror.com使用镜像源解决。
| 源码反馈/咨询 (共有 条反馈) |
PDFMathTranslate常见问题
PDFMathTranslate不是公司产品,而是由开源社区协作开发的开源项目,主要维护团队为Byaidu。项目有多个活跃分支和贡献者。
是一个专门翻译科学PDF文档的开源工具,特点是能完整保留原文中的数学公式、图表、目录和排版格式。科研人员可以用它来翻译外文论文,既不会破坏公式结构,又能保留原文版式,大大提升阅读效率。
有几种方式。最简单的推荐在线免费体验,上传PDF就能试。如果经常用,建议通过 pip install pdf2zh 安装,然后用 pdf2zh document.pdf 命令行翻译。不熟悉命令行的用户可以用 pdf2zh -i 打开图形界面操作。
软件本身开源免费。翻译时使用Google或Bing服务也是免费的。但如果选择DeepL或OpenAI作为翻译引擎,需要自己拥有对应API密钥并按服务商标准付费。
因为是开源软件,代码透明可审查,安全性有一定保障。本地部署时文档不会上传到第三方服务器,数据只留在自己设备上,对处理敏感学术内容比较友好。
第一,如果只需查看论文正文而非全部内容,用 -p 1-15 参数只翻译正文部分,跳过参考文献和附录,节省时间和费用。第二,翻译专业文献时,建议使用DeepL或OpenAI等付费服务,术语准确率比免费服务更高。第三,如果需要核对翻译质量,可以同时生成双语对照版本。
核心的特色是“公式和排版保留”--翻译后的PDF中,数学公式结构不变、图表位置不乱、目录仍然可点。另外它支持多种翻译服务自由切换,还有Zotero插件,可以直接在文献管理软件里翻译论文。
项目主页是 https://pdf2zh.com/ ,GitHub地址是 https://github.com/Mu-L/PDFMathTranslate 在线体验入口也在官网可找到。
翻译准确性取决于选择的翻译引擎。用Google或Bing时质量可用,用DeepL或OpenAI时质量更高,特别是术语处理更准确。它本身专注于“格式保留”,翻译质量由后端引擎决定。
支持中、英、日、韩、俄等多种语言的互译。具体源语言和目标语言的组合取决于所选的翻译服务,主流语言方向都有覆盖。
不一定。有编程基础的用户可以用命令行操作,效率更高。不熟悉命令行的用户可以下载Windows便携版,解压后双击exe就能用图形界面。在线Demo甚至不需要安装任何东西。
可以的。可以用 --dir /路径/ 参数指定文件夹,自动处理目录下所有PDF。也可以通过脚本遍历目录批量调用。
普通翻译工具处理PDF时只提取纯文本,导致公式变成乱码、图表错位、排版全乱。PDFMathTranslate专门针对科学论文场景优化,能精准识别并保留公式、图表和排版结构,翻译后的文档看起来像是一份完整的译文而非碎片。