多个榜单登顶、1.2B参数,轻量化TeleOCR解锁文档智能化解析新能力

栏目:互联网 | 来源:机器之心Pro | 2026-09-30 15:10

编辑|Clio

回顾一下 2026 年的 AI 圈热词:Memory、Skills、Harness、Agentic RL、Latent Reasoning、World Action Model、Self-Evolving……越来越多研究开始把注意力放在模型如何记住信息、调用能力、完成长期任务,以及怎样以更低的计算成本稳定工作。

作为现实信息进入 AI 系统的重要入口,OCR 同样正在经历这样的变化:从识别文字、理解版面,到处理拍摄形变、复杂表格、公式和科学图表,模型需要解决的问题越来越细,也越来越贴近真实场景。

最近,中国电信星辰通用人工智能实验室推出的文档解析模型TeleOCR引发关注。它只有约 1.2B 参数,却在多个公开文档解析评测中取得领先成绩:OmniDocBench v1.6 综合得分 96.87,Wild-OmniDocBench 得分 88.53,PureDocBench 三个赛道综合均值 78.41;在 ICDAR 2026 Sci-ImageMiner 科学图表转表格挑战赛中,TeleOCR 还拿下了第一名。

模型目前已经开源,开发者可以通过 GitHub、Hugging Face 获取相关资源,也可以通过天翼 AI 开放平台直接体验文档解析能力。

近日,TeleOCR 登上 HuggingFace 趋势榜前五。连 HuggingFace 官方也亲自下场,主动给 TeleOCR 搭了个 ZeroGPU 在线Demo,还补贴了免费算力。

模型调用地址:

  • https://github.com/caipeng328/TeleOCR
  • https://huggingface.co/StarDoc-AI/TeleOCR

模型在线体验:

  • https://www.teleai.com.cn/docparse/documentParsing

这些成绩背后,TeleOCR 面对的已经远远超出「把一页纸上的字认出来」这么简单。真实文档既有规整的电子 PDF,也有存在弯曲、折痕、透视、阴影等问题的拍摄件,页面中还可能同时包含多栏正文、复杂表格、公式和科学图表。

也正是在这些更复杂的场景里,OCR 正在经历新一轮能力升级。

TeleOCR 为什么能以约 1.2B 的体量,在多个文档解析评测中取得领先?它又是怎样处理一张弯曲、折叠甚至被斜着拍下来的纸?

答案,要从 OCR 今天面对的「新考题」说起。

一页文档,几代OCR在解决不同的问题

想象这样一张普通的文档:一页打印出来的双栏论文,被手机随手斜着拍了一张。页面上有公式、有跨栏表格,右下角还配了一幅折线图。更糟的是,靠近装订线的地方纸张微微卷起,侧面打来的灯光还留下了一块阴影。

人扫一眼就知道怎么看:标题在上面,正文从左栏读到右栏,表格行对应的数字,公式有结构,折线图的走向也一目了然。

但交给机器,过去二十多年里,为了看懂这张纸,OCR 经历了好几轮「考题升级」。

第一题:这里写了什么字?

最早的一代 OCR,解题思路很简洁:先找文字区域,再把字符一个个认出来。对于扫描件和规则版面,这套方法已经相当成熟,今天的身份证识别、票据录入、书籍数字化,都建立在这一能力之上。

第二题:这些字是怎么组织的?

就算每个字都认对,机器还得知道左栏读完该跳到右栏、表格里的数字属于哪行哪列、数学符号还原成什么 LaTeX、图下方的文字是正文还是图注。页面里出现了大量二维关系,文档逐渐从「很多字」变成了有空间结构的信息载体。

于是,文档解析逐渐进化成了一条完整流水线:先通过版面分析(Layout Analysis)把标题、正文、图片、表格、公式区域找出来;文字交给 OCR,表格给专门模型,公式进公式模块;最后按阅读顺序拼回一份文档。这套工程思路至今支撑着大量成熟产品,让机器真正理解「什么东西在什么位置」。

第三题:纸张变形了怎么办?

电子版 PDF 中,文字块和表格往往规整地排列在矩形区域里。但到了真实拍摄环境,情况完全不同:纸张卷曲会把文本行拉成弧线,折痕会造成局部扭曲,斜拍带来透视畸变,光照还可能留下阴影和反光。

这时,模型需要先搞清楚这块内容原本应该在哪里,它和周围内容是什么关系。

也是在这一阶段,视觉语言模型(VLM)开始大举进入文档解析,把文字、图像、版面和结构放进同一套表征里学习。

如果我们把市面上最热的 DeepSeek-OCR、MinerU、PaddleOCR-VL 和 TeleOCR 横向对比,会发现它们在「轻量化」上保持着某种默契,但解题思路又各不相同:

• DeepSeek-OCR (3B)锁定「视觉 Token」,重点研究如何压缩海量视觉信息,并优化 Token 处理顺序,让模型更经济、灵活地保留文字和结构;后续的 DeepSeek-OCR 2 更是玩起了 Token 的处理顺序,让模型在面对复杂页面时信息流转更加灵活。

• MinerU 2.5(1.2B)走的是一种直觉拉满的「由粗到细(coarse-to-fine)」路线。先用低分辨率掌握整页宏观布局,再切回原始分辨率解析重点区域,将算力用在刀刃上。

• PaddleOCR-VL(0.9B)延续强工程体系,将轻量 VLM 接入原有系统,主打文档理解能力与成熟 OCR 工具链、SDK 和多语言部署的无缝融合。

• TeleOCR(1.2B) 则直接专注于那张「不平整的纸」。

TeleOCR 沿用了「先理解版面、再解析内容」的解耦式 VLM 思路,但关键在于把物理形变直接打入训练环节。原本规则的矩形框被替换为动态多边形,让模型主动学习控制点与局部扭曲,把弯曲、折痕和透视吸收进视觉理解中。

这种能力最终会落到一些非常具体的场景里。面对弯曲、透视的拍照文档,TeleOCR 需要重新恢复扭曲区域的空间位置;面对跨行跨列和合并单元格,要还原原有的行列关系;公式即使经过拍摄和形变,也要保留符号和语法结构;论文中的折线图、柱状图,还能进一步转换成结构化表格,供程序继续统计和分析。

对大多数业务来说,这些解析结果也不是终点。合同、扫描件、论文和历史档案经过解析后,可以进一步转换成 Markdown、HTML、LaTeX 等结构化格式,进入企业文档系统、数据库和自动化流程。尤其是在知识库和 RAG 场景中,原生 PDF、扫描件和拍照档案只有先被整理成结构清晰、阅读顺序可靠的语料,后续的切片、检索和问答才有更可靠的数据基础。

这些能力最终还需要通过不同类型的公开评测来验证。再回头看 TeleOCR 跑的这几项测试,覆盖了文档解析从「标准环境」走向「真实世界」的几道关键关卡:OmniDocBench 考数字文档基础,Wild-OmniDocBench 引入弯曲、透视与强光,PureDocBench 拆分各类退化场景,ICDAR 2026 则要求从科学图表中提取数据。

当场景从数字原生延伸至移动实拍,几何形变成了新的考点。

TeleOCR 的定位就在这里:用同一套模型,既能处理规整的数字文档,也能应对复杂的现实实拍。

至于这套本领到底是怎么教给模型的?接下来,我们要翻开 TeleOCR 的技术底牌了。

TeleOCR 给纸张增加了一点「空间感」

人类大脑天生自带「几何矫正器」。纸张弯了一点、透视拉陡了一点、光线暗了一块,我们依然能无缝还原出「这是一张平整页面」。但对模型来说,眼前只是一张经历了物理空间扭曲的像素图:笔直的文本行弯成了弧线,规整的表格被拉成了梯形,褶皱和折痕处甚至会出现局部的突变与断裂。

这也正是 TeleOCR 突破点之一,它试图让视觉模型真正感知到纸张是有物理形状的。

TeleOCR 将这种能力概括为Deformation-aware Learning(形变感知学习)。在训练阶段,模型不仅要看字符,还要显式学习页面的几何控制点与区域边界,以此建立对物理形变的数学描述。相较于传统数字 PDF 里规则的矩形框,拍摄文档中的内容区域改由一组动态的多边形边界点来标注。

原因很简单:一个平整的正文块,用左上角和右下角两个点就能框定;但纸张一旦卷曲,正文边缘会变成弧线。此时如果仍然强行套矩形框,要么混入无关内容,要么切掉边缘文字。

因此,TeleOCR 将版面分析进一步推进到Layout Segmentation(版面分割)。多边形的采样点越多,对复杂曲线的拟合就越精确。为了避免一味增加采样点,团队设计了一个相当巧妙的算法:CGDP(曲率引导的道格拉斯—普克采样)。

CGDP 解决了「有限的点该点在何处」的问题,平坦区域只需少量采样点,褶皱、尖角和强弯曲区域则需要更多点来保留细节。它会结合区域尺度和局部曲率动态分配采样优先级,把更多资源留给几何结构复杂的区域。

简单来说就是,在正式读取语义前,先让模型建立起对页面几何和空间结构的感知。

不过,懂物理形变只是第一步。另一个问题是:海量、高质量的复杂文档数据从哪里来?

给普通图片分类,标签可能只有「猫」或「狗」;但一份实拍文档的标注粒度要复杂得多——版面区块、阅读顺序、表格拓扑、LaTeX 公式、图表关系,再加上多边形几何边界。如果全部依赖人工逐项标注,成本很快就会失控。

TeleOCR 的解决方案,是建立一套自动化的数据引擎,其核心机制叫Multi-node Consensus Voting(多节点一致性投票)。

具体做法是:将同一份文档分发给多个结构异构的模型并行解析。模型 A、B、C 分别给出答案,系统再对它们的结果进行多维度对齐校验,版面看 IoU(交并比),文字看编辑距离,表格看 TEDS,公式看 CDM。多个模型结果高度一致时,就生成高置信度伪标签;分歧明显时,则进入更精细的校验流程。

这样一来,海量高质量伪标签就可以被批量生产出来。

这套流程后端还有一道很关键的质检机制:视觉重渲染校验(Render-and-Compare)。

团队将模型预测出的结构化结果(如 HTML 表格、LaTeX 公式)重新「画」成渲染图,再与原始文档做视觉对比。这样一来,原本抽象的结构错误就会变成直观的图像差异:表格少一列、公式漏一个括号,都能更容易被发现。

团队还发现,Qwen3-VL-235B 做零样本视觉一致性判断时,召回率不足 40%。因此,他们基于 Qwen2.5-VL-7B-Instruct 微调了一个自判断模型,专门用于数据质量把关。

解决了「纸张形变」和「数据供给」,第三个难点是复杂的内在结构

多行跨列的复杂表格、层层嵌套的数学公式,一直都是 OCR 中最难处理的场景之一。模型不仅要识别字符,还要准确拆解字符之间的结构和拓扑关系。TeleOCR 在这里引入了Content-Structure Decoupled Learning(内容—结构解耦学习)。

在处理表格时,模型会优先学习OTSL(优化表格结构语言)等结构化 Token,重点表达行列、单元格以及合并关系;在处理公式时,则从 LaTeX 中提取语法树结构,让模型将「符号内容」和「语法嵌套关系」拆开学习。

这相当于先搭起一副「骨架」:表格的骨架是行列拓扑,公式的骨架是嵌套关系和运算符。骨架确定后,再填入具体的文字、数字和符号。

这套解耦思路也被延伸到了科学图表。论文里的折线图、柱状图、热力图形式不同,但核心都是坐标轴、图例和数据点之间的对应关系。TeleOCR 将它们统一转化为 OTSL 格式的结构化表格 Token,再还原成数据表格,从而支持跨 5 大类、19 种细分科学图表的数据提取。

上述技术模块最终可以归纳为一套四阶段训练体系

1.第一阶段(视觉语言对齐):让模型掌握基础 OCR 与通用版面理解;

2.第二阶段(形变感知训练):注入几何先验,专门处理真实拍摄场景中的物理形变;

3.第三阶段(结构化专项):训练表格拓扑、复杂公式和科学图表;

4.第四阶段(强化学习微调):引入GRPO算法,根据文本、表格和公式各自的评估指标进行最终的任务级对齐。

可以看到,TeleOCR 在一个相对紧凑的参数体量里,把算力和训练资源集中投入到「数据质量」「空间几何」「结构解耦」和「强化对齐」这些关键环节上,从而实现小模型下的高精度专精能力。

一张纸看似简单,对模型来说却同时包含布局、表格、公式、图表和物理形变。TeleOCR 所做的,就是把这些复杂信息一步步转化成模型更容易理解和学习的结构。纸张有了「空间感」,复杂内容有了「骨架」,训练数据也有了自动化的生产和质检流程。

这些技术能力解释了 TeleOCR 如何解决复杂文档问题,而当视角从一款模型继续向外延伸,它背后还有中国电信在 AI 基础能力上的长期布局。

一个 OCR 模型背后的电信使命

近年来,中国电信持续推进「云改数转智惠」战略,围绕云、算力、数据、模型和应用等能力加快布局人工智能。从底层基础设施到上层业务应用,AI 已经逐步进入中国电信的技术体系和业务体系。TeleOCR 所在的文档解析方向,也是这一整体布局中的组成部分。

文档解析看起来是一项基础能力,却连接着大量真实业务数据。企业内部的合同、票据、扫描件、历史档案、科研论文以及拍照文档,往往同时包含文字、表格、公式、图表和复杂版面。只有先把这些内容转化为结构清晰、机器可读的数据,后续的知识库、RAG、数据分析和自动化流程才有可靠的数据基础。

这也使 OCR 在 AI 应用链路中承担着一个很具体的角色:把现实世界中的文档信息转化为能够被软件系统继续处理的数据。随着企业数字化持续深入,文档输入的来源越来越复杂,既有原生 PDF,也有扫描资料、手机拍照件和长期沉淀的纸质档案。对这些内容进行稳定、统一的解析,已经逐渐成为知识管理和智能化应用中的基础环节。

TeleOCR 的技术路线也体现了这一需求。约 1.2B 的参数规模,使模型在部署成本、推理效率和工程集成方面具备较好的适配空间;形变感知、结构化解析等能力,则进一步覆盖了拍摄文档、复杂表格、公式和科学图表等真实场景。对于需要长期运行的文档解析系统来说,模型规模、解析精度和部署效率需要同时纳入考虑。

从「云改数转智惠」的整体脉络来看,TeleOCR 所对应的也是「智」与「惠」在具体业务中的落点。一方面,文档解析能力可以进入企业知识库、数据治理、科研分析和流程自动化等场景;另一方面,轻量化、开源和本地化部署也降低了技术应用门槛,使更多开发者和业务系统能够接入这类能力。

从公开评测、模型开源到在线体验,TeleOCR 正在逐步进入更完整的开发者使用链路。对中国电信而言,这类基础模型的价值也体现在持续积累和工程化能力上:模型需要经过训练、评测、部署,再进入具体业务系统,最终形成可以长期运行的技术能力。

从网络连接、云和算力,到数据、模型和应用,中国电信的技术体系正在继续向人工智能延伸。TeleOCR 所对应的是其中一个相对具体的切面——通过文档解析,让更多现实世界中的信息转化为可计算、可检索、可调用的数据,并进一步进入知识库、数据分析和自动化流程。

从 TeleOCR 这样一项具体能力出发,也能看到 AI 进入产业后的一个变化:技术最终要落到稳定的数据处理、工程部署和实际使用上。对于模型而言,这也带来了更加具体的评价尺度。

结语:AI 落地正在重新定义「好模型」

当 AI 真正进入业务,评价一个模型的标准就变得非常具体。很多时候,决定一个系统能不能跑起来的,往往是那些在后台默默支撑的基础能力:能不能稳定处理复杂的真实数据?能不能控制成本?能不能顺利接入现有的工作流?

OCR 就属于这样的能力,它是现实世界的文档进入数字系统的入口,也是各类知识库、数据分析和自动化系统能运转起来的前提。TeleOCR 的价值,就在于把这个很具体的基础工作做深、做细,让它在真实的业务链条里真正发挥作用。

对中国电信而言,打磨这类基础模型是其建设 AI 能力的一环。把模型、数据、工程和实际场景长期结合起来,需要持续的技术积累和体系化投入。

AI 越往产业深处走,就越离不开这些稳定运转的「基建」。TeleOCR 在多个公开榜单和国际竞赛中取得的成绩,也为中国电信在文档解析这一基础能力上的持续投入提供了阶段性的检验。

了解更多

猜你想看

← 返回首页