尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

PDFMathTranslate(pdf2zh):如何把 PDF 论文翻成中文且保住公式与排版

发布时间:2026/9/20 17:40:04

资讯中心
01
ARTICLE

PDFMathTranslate(pdf2zh):如何把 PDF 论文翻成中文且保住公式与排版

PDFMathTranslate(pdf2zh):如何把 PDF 论文翻成中文且保住公式与排版
PDFMathTranslatepdf2zh如何把 PDF 论文翻成中文且保住公式与排版【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslate命令pdf2zh是一个保留版式的科学 PDF 双语翻译工具只翻译文字层公式、图表、目录与双栏结构原样保留。适合第一次读外文文献、又想要一份排版不乱版的中英文对照版的学生和研究人员。两条命令即可交付译文默认走 Google 翻译不需要任何密钥。先弄懂 pdf2zh 的能力边界pdf2zh 解析的是 PDF 的文本层逐页检测出公式、图片、表格、标题等元素后只有文字块会被送去翻译服务其余一律不动译文按原字体、原位置回填。它不重排文档也不修复文本层本身就损坏的文件纯图片扫描件没有文本层可取默认流程翻不了有实验性的快速 OCR 模式适用范围以仓库文档为准。做什么双栏论文全文翻译公式、图号、脚注、页眉留在原位不做什么不改变原版式结构不重建缺失的文本层最终产物当前目录下两个文件xxx-mono.pdf纯译文版、xxx-dual.pdf中英对照版两条命令跑通第一次 PDF 翻译安装前先核对四点每条都注明不满足的后果Python 在 3.11 到 3.12 之间pyproject.toml声明3.11,3.13用 3.10 或 3.13 安装会直接失败网络要通首次运行会从 Hugging Face 下载 ONNX 版面模型wybxc/DocLayout-YOLO-DocStructBench-onnx断网会卡住依赖不用手装onnxruntime、pdfminer-six、gradio等会随安装命令自动带入Windows 用户若跑 exe 报 DLL 加载失败先装 VC 2015–2022 运行库再试确认无误后两条命令开始pip install pdf2zh pdf2zh document.pdf跑完当前目录多出document-mono.pdf和document-dual.pdf。首次运行比之后慢慢在下载版面模型这一步属正常现象。看看 pdf2zh 双语翻译的实际效果上排为英文原文下排为中文译文章节标题、公式编号 (34.32)–(34.41)、积分与求和符号、页脚星号注释全部在原位左右两栏逐行对齐没有漂移。核心机制一句话DocLayout-YOLO 的 ONNX 模型先逐页框出公式、图片、表格、标题等元素只有文字块进入翻译服务译完按原位置回填公式与图表全程未被触碰相当于对 PDF 文本层做外科手术。想深挖检测逻辑可以看 版面检测源码 pdf2zh/doclayout.py。覆盖更多场景批量、GUI、容器、MCP单文件pdf2zh paper.pdf产物直接落在当前目录批量目录pdf2zh --dir /path/to/papers/ -o results/整目录 PDF 一次翻完输出归入-o指定目录图形界面pdf2zh -i后打开http://localhost:7860/在浏览器里选翻译服务、选页码范围、实时预览效果见下图Docker 部署docker pull byaidu/pdf2zh再docker run -d -p 7860:7860 byaidu/pdf2zh同样是 7860 端口的 Web 界面MCP 接入pdf2zh --mcp以 STDIO 模式注册进 Claude Desktop 等客户端对话里直接翻 PDF加--sse切换 SSE 模式日常记住这 8 个参数就够参数作用示例-p只翻指定页码pdf2zh paper.pdf -p 1-3,5-s切换翻译服务pdf2zh paper.pdf -s deepl-li/-lo指定源语言与目标语言pdf2zh paper.pdf -li en -lo zh-t翻译并发线程数pdf2zh paper.pdf -t 4-o输出目录缺省为当前目录pdf2zh paper.pdf -o results--ignore-cache忽略翻译缓存强制重新翻译pdf2zh paper.pdf --ignore-cache--prompt加载自定义 LLM 提示词文件pdf2zh paper.pdf --prompt prompt.txt--config加载 JSON 配置文件pdf2zh --config config.json paper.pdf常见报错现象、原因与解法扫描版 PDF 翻不动→ 原因是文件为纯图片、没有文本层而 pdf2zh 取的是文本层 → 解法先 OCR 生成文本层再投入翻译或用pip install pdf2zh[ocr]安装快速 OCR 模式主要针对白底扫描件以仓库文档为准。首次运行卡在模型下载→ 原因是部分地区访问 Hugging Face 受限 → 解法先设镜像再运行Windows 执行set HF_ENDPOINThttps://hf-mirror.comPowerShell 写$env:HF_ENDPOINT https://hf-mirror.com。切换服务后报鉴权错误→ 原因是DEEPL_AUTH_KEY、OPENAI_API_KEY等环境变量没提前设置 → 解法到 docs/ADVANCED.md 的服务表格里查对应变量名设完再执行。GUI 没自动打开浏览器→ 原因可能是端口被占用或浏览器未拉起 → 解法手动访问http://localhost:7860/端口冲突时用--serverport换一个端口。需要读外文论文、又接受不了排版散架的译文就装它pip install pdf2zh之后两条命令可用。想把翻译能力集成进自己的程序Python 与 HTTP 接口说明在 docs/APIS.md。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。