认识TeleOCR1.2B轻量级文档解析模型完全指南——一个模型搞定OCR、表格与公式【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCRTeleOCR 是一个仅约1.2B 参数的开源轻量级文档解析模型把 OCR 文本识别、表格还原、公式转 LaTeX 全部装进一个模型里。它基于 Qwen2.5-VL 架构中英双语支持Apache-2.0 协议完全开源普通消费级显卡即可本地部署是 2026 年文档智能领域公认的小钢炮。 为什么你需要一个轻量的文档解析模型传统文档解析方案要么拼凑多个工具OCR 一个、表格检测一个、公式识别又一个要么依赖动辄几十 B 参数的大模型部署成本高、链路复杂。TeleOCR 的解法很直接一个模型统一框架同时处理数字文档PDF、扫描件和相机拍摄的扭曲文档。你拍一张歪斜的纸质合同照片它也能直接输出结构化结果无需额外的透视矫正模型。⚡ 60 秒认识 TeleOCR 的六大核心能力能力说明输出形式 文本 OCR中英文混排文本识别纯文本 表格还原支持合并单元格OTSL 标记 → HTML 表格 公式识别手写/印刷公式转 LaTeX$...$LaTeX 代码 代码解析识别截图中的代码片段代码文本️ 版面分析标题、段落、图表区域定位结构块 坐标 科学图表解析从科研图/表中抽取隐含数据表格HTML 表格值得一提的是模型对扭曲文档做了专门的几何感知建模——拍摄照片常见的弯曲、倾斜、透视变形都不再是问题这在同类轻量模型中并不多见。 成绩到底有多强在权威基准OmniDocBench v1.6上TeleOCR 以 96.87 的综合分拿下 SOTA超过 30B 级别的通用大模型模型参数量综合分 ↑表格 TEDS ↑TeleOCR1.2B96.8797.05MinerU 2.5 Pro1.2B95.7593.42Gemini 3 Pro未公开92.8589.15Qwen3-VL-235B235B89.7883.07在 EMNLP 2026 举办的Dr.DocBench Challenge文档解析竞赛中TeleOCR 以 67.96 的综合分排名第一领先 MinerU 2.5 Pro 约 5.7 分。 关键结论1.2B 参数 ≈ 235B 通用大模型的文档解析表现而推理成本只有它的零头。 模型文件里都有什么整个仓库就是一套即用的推理模型核心文件如下model.safetensors —— 模型权重本体bfloat16 精度config.json —— 架构配置28 层 Transformer、128K 上下文长度、基于qwen2_5_vlmodeling_naviocr.py —— 自定义模型加载代码trust_remote_codeTrue时自动启用tokenizer.json 与 vocab.json —— 分词器包含 OTSL 表格专用标记preprocessor_config.json —— 图像处理参数动态分辨率最高约 12.8M 像素generation_config.json —— 推理参数temperature 0.1适合确定性输出chat_template.jinja —— 对话模板想深入了解模型细节和完整评测可阅读项目说明文档 README.md。 三步跑通本地文档解析第一步安装依赖仅需 HuggingFace 生态三大件pip install transformers torch pillow第二步加载模型import torch from PIL import Image from transformers import AutoProcessor, AutoModel processor AutoProcessor.from_pretrained(StarDoc-AI/TeleOCR, trust_remote_codeTrue, use_fastTrue) model AutoModel.from_pretrained(StarDoc-AI/TeleOCR, trust_remote_codeTrue, torch_dtypetorch.bfloat16).cuda().eval()第三步发一句话拿一个结果TeleOCR 采用自然语言指令驱动想解析什么就说什么# 表格识别输出 OTSL 格式可自动转成 HTML raw infer(Image.open(./assets/table.png), This is the image of a table. Please output the table in OTSL format.)官方示例覆盖文本、表格、公式、代码、版面分析共 6 类场景完整用法见 README.md 的 Quick Start 部分。 1.2B 参数凭什么做到 SOTATeleOCR 论文技术报告 arXiv:2608.12898提出的几个关键创新值得了解多节点共识投票MCV——自动合成高质量伪标签数据质量拉满几何感知文档建模——专门针对相机拍摄文档的形变问题曲率引导的 Douglas-Peucker 采样CGDP——更精细地捕捉弯曲文字区域内容-结构解耦学习——表格与公式内容和结构分开训练两者同时高分四阶段渐进训练——从易到难逐步逼近极限这些技术让它在保持轻量部署的前提下性能反而超过更大的模型。️ 适合哪些场景✅ 本地化文档数字化发票、合同、试卷批量解析✅ 论文/书籍电子化公式转 LaTeX 特别出色见上方示例图✅ 手机拍摄文档的实时解析歪斜、反光场景✅ 科研图表数据抽取⚠️ 提示完整的生产级文档解析管线含版面切分、阅读顺序建议配合官方推理框架使用可参考 README.md 中的说明 写在最后TeleOCR 证明了文档解析这件事不需要大参数也能做好1.2B 的体量、Apache-2.0 的开源协议、中英双语支持、拍照文档也能扛——对于想把文档智能装进自己产品里的团队和个人开发者它目前几乎是开箱即用的最优选择之一。建议先从文本 OCR 和公式识别玩起这两个任务几行代码即可体验完整效果。动手试试吧【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考