免费 PDF 翻译:pdf2zh 十分钟翻出公式原样保留的双语论文

发布时间:2026/10/11 1:35:44
免费 PDF 翻译:pdf2zh 十分钟翻出公式原样保留的双语论文
免费 PDF 翻译pdf2zh 十分钟翻出公式原样保留的双语论文【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate论文翻译绕不开一个坑正文能翻公式和双栏版式常被翻烂。PDFMathTranslate命令名 pdf2zh是保留版式的开源 PDF 全文翻译工具正文译成中文公式、图表、目录留在原位。跑完得到两份文件paper-mono.pdf纯中文版和paper-dual.pdf中英对照版。原理与边界版面模型分块译文写回原坐标链路一句话pdf2zh 先用版面模型预训练好的轻量模型ONNX 格式一种跨平台通用的模型部署格式识别页面上每一块——正文、公式、图、图注——把需要翻译的正文送进你选定的翻译服务再把译文写回原文所在位置。这是 PDF 公式保留翻译页面不会被压扁成截图。适合带文本层的英文论文尤其双栏、公式密集的理工科文献。不适合扫描件和图片型 PDF。工具只读文本层图片型 PDF 里没有可读文字得先 OCR光学字符识别把图片里的字变成可选中、可复制的文本做出带文本层的 PDF 再翻新版还有实验性的内置 OCR 功能pip install pdf2zh[ocr]翻译前自动对图片页跑本地 OCR但仍是实验状态。这个项目被 EMNLP 2025 System Demonstrations 收录论文摘要写明 PyPI 下载量超 22.2 万数字出自摘要README 的引用块里可查原文。十分钟拿到第一份双语 PDF装、跑、自查命令环境仅需 Python 3.11/3.12两条命令从装到跑pip install pdf2zh pdf2zh paper.pdf判断成功命令结束后当前目录多出paper-mono.pdf和paper-dual.pdf两个文件。Windows 上不想装 Python到项目发布页下载pdf2zh-version-win64.zip解压后双击pdf2zh.exe打不开就先装vc_redist.x64.exeVC 运行库再试。跑完自查目录里多了带-mono和-dual后缀的两份文件与源文件名一一对应。打开 dual 版正文是中文公式和图还是公式和图不是被转成的图片。效果参照通读一遍 mono 版读得懂、版式无明显错位就算通过。全程不需要额外配置默认翻译服务是 googlegoogle、bing 两个服务都免 API keyAPI key 即调用付费接口的身份密钥。译得更好一点质量三档、术语统一、缓存省钱按「你想要什么」分想零配置跑通默认 google 就够或加-s bing换服务都不需要 key。想提高质量档-s deepl或-s openai。前者要设DEEPL_AUTH_KEY后者要设OPENAI_API_KEY等每个服务各需哪些环境变量见环境变量对照表。想断网可用-s ollama接本地模型默认地址http://127.0.0.1:11434翻译环节不走外网。想让术语统一比如 mutant 一律译「突变体」。写一个提示词文件用--prompt prompt.txt传入模板支持${lang_in}、${lang_out}、${text}三个变量。想省成本内置翻译缓存相同内容不会重复调用 API。「先试翻几页、满意再全量」这条路是零成本的写法看下一节。从一篇到一团队批量、GUI、Docker只翻几页加-p 1-5也支持-p 1-3,5这种写法。显式指定语言方向-li en -lo zh。一文件夹英文论文批量翻译pdf2zh --dir /path/to/papers/ -o output/ -t 3判断成功output/里出现与每个源文件对应的-mono/-dual成对文件-t是翻译线程数。图形界面跑pdf2zh -i浏览器没自动弹出就访问http://localhost:7860/把 PDF 拖进去点 Translate 即可细节见 GUI 说明。 团队共用 Docker大家不必各自准备 Python 环境先docker pull byaidu/pdf2zh拉镜像再docker run -d -p 7860:7860 byaidu/pdf2zh起容器之后每个人用浏览器访问http://localhost:7860/进界面。判断成功浏览器能打开这个地址并看到选文件页面。翻不动了对号入座症状原因处理扫描件翻出来是空的或没结果PDF 是纯图片没有文本层工具只读文本层先 OCR 出带文本层的 PDF 再翻或试新版实验性内置 OCRpip install pdf2zh[ocr]首次运行卡在模型下载或超时要下载版面模型wybxc/DocLayout-YOLO-DocStructBench-onnx先设 HF 镜像再运行CMD 用set HF_ENDPOINThttps://hf-mirror.comPowerShell 用$env:HF_ENDPOINT https://hf-mirror.com其他网络问题查代理配置文档换了服务或提示词译文却没变命中翻译缓存没有重新调 API加--ignore-cache强制重翻输出 PDF 字体显示异常字体子集化只保留实际用到的字形以压缩文件体积的副作用加--skip-subset-fonts跳过该步骤按身份走在读论文的人今天就pip install pdf2zh挑必读的那篇用-p 1-10先确认质量再全量跑出一份-dual当 PDF 中英对照逐段读。维护团队工具的人把上面两条 Docker 命令起一个实例团队所有人从浏览器进不用各自装环境。想读懂实现的人从pdf2zh/包读起版面解析在pdfinterp.py翻译调度在translator.py篇幅不长。提醒一句Python API 目前处于弃用状态计划在 2.0 重新提供需要程序化调用以 API 说明 为准。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考