尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5

发布时间:2026/9/28 20:06:38

资讯中心
01
ARTICLE

TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5

TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5
TeleOCR到底有多强OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCRTeleOCR 是一个仅约1.2B 参数的开源轻量级文档解析模型视觉-语言模型VLM单个框架就能同时处理数字 PDF 文档和手机拍照的纸质文档。这篇文章将用 OmniDocBench、Wild_OmniDocBench、PureDocBench、Dr.DocBench 挑战赛和 ICDAR2026 Sci-ImageMiner5 大公开基准的实测数据把它与 PaddleOCR-VL、MinerU 以及 GPT-5 系列大模型放在一起对比帮你快速判断它到底值不值得用。 一图速览TeleOCR 是什么在跑分之前先花 30 秒认识一下这个模型项目说明参数规模约 1.2B消费级显卡即可部署开源协议Apache-2.0模型底座基于 Qwen2.5-VL 架构见 config.json 中的Qwen2_5_VLForConditionalGeneration核心卖点数字文档 拍照文档统一解析拍照件无需矫正预处理可解析内容文本、公式、表格、代码、版式布局它和传统 OCR 工具最大的不同是一张弯弯曲曲的手机照片直接丢进去它不需要先做去畸变矫正就能直接输出解析结果这是很多竞品都做不到的。项目介绍详见 README.md模型实现位于 modeling_naviocr.py。 基准一OmniDocBench v1.6 官方榜——1.2B 打赢 235BOmniDocBench 是文档解析领域最权威的公开基准之一同时考核文本、公式、表格和阅读顺序。实测结果如下节选自 README.md 中的实验数据模型参数Overall ↑Text Edit ↓Formula CDM ↑Table TEDS ↑TeleOCR1.2B96.870.02796.3697.05OvisOCR20.8B96.580.02597.5394.76PaddleOCR-VL-1.60.9B96.330.03397.4994.76MinerU2.5-Pro1.2B95.750.03697.4593.42GLM-OCR0.9B95.220.04497.1892.83PaddleOCR-VL0.9B94.110.04095.7090.65Gemini 3 Pro未知92.850.06495.8389.15Qwen3-VL-235B235B89.780.06392.5383.07GPT-5.2未知86.520.11488.0082.95三个关键结论综合分 96.87 登顶超过同为 1.2B 的 MinerU2.5-Pro95.75和 PaddleOCR-VL-1.696.33表格解析是最大杀器Table TEDS 97.05 全场最高PaddleOCR-VL 系列只有 90~95降维打击通用大模型参数只有 GPT-5.2 的几百分之一的 TeleOCR综合分领先 10 分以上。文档解析这件事上专确实能胜大。 基准二Wild_OmniDocBench——真实场景才见真章官方基准里的文档都太干净了。Wild_OmniDocBench 专门收集真实世界里的复杂文档复杂背景、光照不均、排版混乱是更贴近实际使用的考试模型类型Overall ↑Text Edit ↓Table TEDS ↑TeleOCR解耦式 VLM88.530.117389.05PaddleOCR-VL-1.6解耦式 VLM87.360.136985.76MinerU2.5-Pro解耦式 VLM87.330.136285.46OvisOCR2端到端 VLM87.910.12985.13GLM-OCR解耦式 VLM85.080.151481.31在难度拉满的题库里TeleOCR 依然保持第一且文本和表格两项均为全场最佳——差距虽小但五项指标没有一项落后说明它不是靠某一项刷分。 基准三PureDocBench——抗退化能力碾压大模型PureDocBench 把同一份文档分别放在干净、数字退化、真实退化三种条件下考察模型。这正是拍照文档解析的核心考验模型干净 Overall数字退化 Overall真实退化 OverallTeleOCR86.9077.4770.85OvisOCR282.1477.7766.61MinerU2.5-Pro75.8771.7762.56PaddleOCR-VL-1.573.0166.7360.50Gemini-3.1-Pro70.0469.2871.98干净文档TeleOCR 以 86.90 领先第二名 OvisOCR2 约 4.8 分真实退化模糊、光照差、拍摄角度歪斜TeleOCR 70.85 第一连 Gemini-3.1-Pro 这类旗舰通用模型都拿它没办法——退化的纸质扫描件恰恰是通用大模型的软肋。 基准四Dr.DocBench 挑战赛EMNLP 2026在 EMNLP 2026 举办的 Dr.DocBench 文档解析挑战赛中TeleOCR 以原始权重直接参赛模型overall ↑Text edit ↓formula cdm ↑Table teds ↑TeleOCR67.960.19030.0264.97MinerU 2.5 Pro62.260.34020.0467.75OvisOCR259.250.38830.0061.59PaddleOCR-VL 1.655.110.43640.2151.34领先第二名 MinerU 2.5 Pro 约5.7 分PaddleOCR-VL 1.6 则是 12.8 分的大胜。文本识别Text edit 0.1903越低越好优势尤其明显。 基准五ICDAR2026 Sci-ImageMiner——科学图表提取冠军这个赛道考核的是从科学插图中提取隐含表格数据的高难任务论文配图里的曲线、柱状图 → 结构化数据排名队伍RMSTEDS加权总分1TeleOCR17.2366.3941.812VLMinators17.2964.3140.803Ricoh_SRCB16.2361.1238.676Qwen3-VL 8B14.0857.8635.97TeleOCR 以加权总分41.81 夺得冠军领先第二名接近 1 分。这意味着处理科研论文时它不仅能解析正文里的表格还能把图里藏的数据捞出来。 一个模型解析文档的所有内容TeleOCR 把文档解析拆成 5 个可单独调用的能力用不同提示词prompt即可切换任务说明官方示例素材文本识别正文、段落直接转文本assets/text.png公式识别公式图片 → LaTeXassets/formula.png表格识别输出 OTSL 格式可转 HTML 表格assets/table.png代码识别代码截图 → 源码assets/code.png版式分析整页布局定位含畸变文档assets/layout.jpg、assets/layout_distorted.jpg上图是一个典型的多行数学公式解析示例——TeleOCR 能将此类公式图片识别为可渲染的 LaTeX 源码公式 CDM 分数在 OmniDocBench 上高达 96.36。对于畸变的拍照文档TeleOCR 还内置了**多点版式分割分析**能力直接对弯曲、倾斜的页面做布局定位无需专门的矫正模型这也是它 Wild/PureDocBench 抗退化成绩领先的底气所在。 为什么 1.2B 能做到6 项核心技术跑分领先不是运气README.md 中列出了支撑成绩的 6 项关键设计多节点共识投票MCV自动生产高质量伪标签解决标注数据不足的老大难问题几何感知文档建模专为手机拍照文档设计直接理解弯曲、透视畸变曲率引导 Douglas-Peucker 采样CGDP沿文档曲线智能采样保留关键几何信息图像到图像自验证模型自己检查自己自动清洗错误数据渐进式四阶段训练流水线分阶段训练从易到难逐步提升内容-结构解耦学习表格和公式的内容与结构分开学习这正是它 Table TEDS 97.05 的第一名由来。 3 分钟上手安装与首次文档解析部署门槛很低两条命令即可开始。第 1 步安装依赖pip install transformers torch pillow第 2 步加载模型并解析一张图片from PIL import Image from transformers import AutoProcessor, AutoModel import torch processor AutoProcessor.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, use_fastTrue) model AutoModel.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, torch_dtypetorch.bfloat16).cuda().eval() # 文本解析 image Image.open(./assets/text.png).convert(RGB) print(infer(image, Please output the text content from the image.))完整的推理与后处理代码含 OTSL 表格转 HTML、公式 LaTeX 规范化可以直接参考 README.md 中的 Quick Start 部分模型分词与推理行为定义在 tokenizer_config.json 和 generation_config.json 中。如果想在本地拉取仓库试用git clone https://gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR✅ 谁适合用 TeleOCR你的场景推荐度理由自建文档数字化流水线⭐⭐⭐⭐⭐开源 Apache-2.01.2B 可私有化部署大量手机拍照的票据/表单解析⭐⭐⭐⭐⭐无需矫正预处理抗退化第一科研论文表格/插图数据提取⭐⭐⭐⭐⭐ICDAR2026 冠军科学图表提取最强消费级显卡本地跑 OCR⭐⭐⭐⭐⭐1.2B 参数显存占用远低于 30B 大模型通用多模态对话⭐它是文档解析专家不是聊天模型❓ 常见疑问快速解答Q11.2B 参数真的够用吗在 5 个基准上TeleOCR 的综合成绩普遍领先参数 2~200 倍的通用 VLM如 Qwen3-VL-235B、InternVL3.5-241B。文档解析是专精赛道小模型反而更优。Q2手机拍的弯歪照片要先矫正吗不用。几何感知建模 多点版式分割让它直接解析畸变文档DocUNet、DIR300 数据集上的可视化结果均验证了这一点。Q3表格和公式的输出格式表格默认输出 OTSL 标记官方提供一键转 HTMLtable的逻辑含合并单元格公式输出 LaTeX自动补$$定界符。 总结5 大基准全部第一OmniDocBench 96.87、Wild 88.53、PureDocBench 86.90、Dr.DocBench 67.96、ICDAR2026 冠军对比结论表格解析胜 PaddleOCR-VL、整体稳超 MinerU 2.5 Pro、碾压 GPT-5 系列与 Gemini 旗舰落地友好1.2B Apache-2.0拍照件免矫正是目前开源文档解析领域最强轻量解。如果你正在搭建文档解析管线或对手机拍照场景的鲁棒性有要求TeleOCR 值得成为你的第一候选。【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。