OCR经典算法梳理、时间线、大模型时代的OCR

一、OCR文本检测经典算法梳理

OCR(光学字符识别)文本检测是OCR流程的核心第一步(检测→识别),核心分为两大方向:水平/多方向文本检测(规则排版文本)、任意形状文本检测(自然场景异形文本),以下按算法设计思路与适用场景分类,梳理经典核心算法及演进逻辑。

1. 水平/多方向文本检测(规则文本,早期主流)

核心思路以目标检测回归、锚点匹配为主,落地性强,适配横排、轻微倾斜/旋转的规则文本,是工业界早期主流方案。

1.1 CTPN(Connectionist Text Proposal Network, ECCV 2016)
  • 核心基础:基于Faster R-CNN改造,专为文本检测设计
  • 创新点:将文本行切分为固定高度的文本提议框,通过LSTM链接相邻提议框,还原完整文本行
  • 特点:首次解决多方向文本检测,对横排/轻微倾斜文本效果优异,是早期多方向文本检测的标杆算法
  • 不足:无法处理弯曲文本,对长文本分割流程较繁琐
1.2 EAST(An Efficient and Accurate Scene Text Detector, CVPR 2017)
  • 核心定位:实时高效的多方向文本检测算法,工业界落地经典
  • 创新点:摒弃传统“提议框+后处理”流程,端到端直接回归文本框(支持旋转矩形框/四边形框)
  • 特点:速度极快(GPU下可达15FPS+),精度高,对水平/多方向规则文本适配性强,是工业界实时场景首选
  • 不足:不支持弯曲文本,对极端倾斜文本的框回归精度略低
1.3 TextBoxes/TextBoxes++(AAAI 2017/TPAMI 2018)
  • 核心基础:基于SSD(单阶段目标检测)改造,适配文本的长宽比特性
  • 创新点:设计适合文本的锚点框(高宽比为1:2/1:4/1:8等),解决SSD对细长文本检测的漏检问题
  • 特点:单阶段检测,速度快,易部署,适合批量处理水平/多方向文本
  • 不足:对文本边缘的定位精度一般,无弯曲文本处理能力
1.4 SegLink(CVPR 2017)
  • 核心思路:检测+链接双分支,先检测文本小片段(Seg),再通过链接分支(Link)将同属一个文本行的片段拼接
  • 特点:对长文本、破碎文本的检测效果好,支持多方向
  • 不足:后处理链接逻辑较复杂,速度略低于EAST

2.任意形状文本检测(自然场景,当前主流)

针对自然场景中弯曲、不规则、变形文本(如logo、广告牌、手写体),核心思路以像素级分割为主,部分结合锚点/无锚点设计,是近年研究重点,衔接前文精读的PAN算法。

2.1 PSENet(Shape Robust Text Detection with Progressive Scale Expansion Network, CVPR 2019)
  • 核心定位:任意形状文本检测的先驱算法,PAN的直接改进基础
  • 创新点:提出渐进式尺度扩展策略,先检测文本的核心内核,再通过多尺度膨胀,逐步还原完整的任意形状文本区域
  • 特点:首次高效解决弯曲文本检测,对各种异形文本的形状建模能力强
  • 不足:后处理的尺度扩展逻辑复杂,速度慢(仅3.9FPS),难以实时落地
2.2 PAN(Pixel Aggregation Network, ICCV 2019)
  • 核心定位:PSENet的高效改进版,精度+速度双优的任意形状文本检测经典(前文精读核心算法)
  • 创新点:用可学习的像素聚合(PA) 替代PSENet的手工尺度扩展,结合轻量级FPEM+FFM特征融合,大幅提升速度
  • 特点:速度达42.9FPS(ResNet-18),精度超PSENet,是实时任意形状文本检测的标杆,工业界落地广泛
  • 不足:依赖像素级精细标注,对极小文本细节略有丢失
2.3 DBNet(Real-time Scene Text Detection with Differentiable Binarization, AAAI 2020)
  • 核心定位:工业界当前最主流的任意形状文本检测算法,精度、速度、部署性拉满
  • 创新点:提出可微分二值化(DB),将传统分割后处理的“固定阈值二值化”融入网络训练,解决分割阈值适配难题
  • 特点:单阶段分割,速度快(50FPS+),精度高,对任意形状文本适配性强,支持端到端训练+推理,是工业界OCR文本检测首选算法
  • 衍生版:DBNet++(改进特征融合,适配极小文本)、DBNet-Lite(轻量化,适配移动端/嵌入式)
2.4 Mask TextSpotter(系列, CVPR 2018/2019/ICCV 2021)
  • 核心定位:端到端检测+识别一体化算法(检测和识别联合训练)
  • 创新点:基于Mask R-CNN,用实例分割实现任意形状文本检测,同时融合识别分支,一步完成检测+识别
  • 特点:无需单独训练检测/识别模型,端到端落地便捷,对弯曲文本形状建模精准
  • 不足:模型复杂度高,速度略低于纯检测算法(DBNet/PAN)
2.5 CRAFT(Character-Region Awareness For Text detection, CVPR 2019)
  • 核心思路:字符级检测,先检测文本中的单个字符区域,再通过字符间的亲和力(Affinity)链接为文本行
  • 特点:对任意形状文本(包括极度弯曲、手写)检测效果极佳,字符级定位精度高
  • 不足:后处理的字符链接逻辑较复杂,对无字符分隔的连笔文本效果一般
2.6 FOTS(Fast Oriented Text Spotting with a Unified Network, CVPR 2018)
  • 核心定位:首个实时端到端检测+识别的多方向/轻微弯曲文本检测算法
  • 创新点:共享骨干网络特征,检测分支回归文本框,识别分支直接对检测框内文本进行识别
  • 特点:速度快(15FPS+),端到端一体化,适合实时视频流文本检测+识别
  • 不足:对重度弯曲文本的处理能力有限

3.工业界主流落地算法(兼顾效果+部署)

经轻量化/改进后,工业界实际落地的核心算法覆盖全场景,重点兼顾速度、精度与部署性:

  1. EAST(轻量版):移动端/实时场景,适配水平/多方向规则文本检测
  2. DBNet/DBNet++/DBNet-Lite:工业界首选,覆盖所有场景,兼顾速度、精度、任意形状处理,支持端侧/云端部署
  3. PAN/PAN++:实时任意形状文本检测经典,仅次于DBNet的落地选择
  4. Mask TextSpotter v4:端到端检测+识别一体化,适合无需单独部署检测/识别的场景

4.OCR文本检测算法核心演进逻辑

算法发展围绕3大核心问题持续优化,形成清晰演进脉络:

  1. 形状建模:水平矩形框 → 旋转/四边形框 → 像素级掩码(任意形状)
  2. 速度效率:两阶段(提议框+回归) → 单阶段端到端 → 轻量化骨干+可微分后处理
  3. 任务一体化:单独检测 → 检测+识别端到端联合训练

注:DBNet是目前OCR文本检测的“集大成者”,为工业界落地事实标准;PAN作为PSENet的关键改进,是任意形状文本检测中“速度优化”的经典案例。

二、OCR 文本检测经典算法时间线

按时间轴 + 技术路线双视角整理,一句话速记,附官方/社区代码链接。


2.1 回归/锚框时代(2016-2017 · 四边形)

算法会议关键思路代码一句话点评
CTPNECCV’16竖条锚框 + Bi-LSTM 连接tianzhi0549/CTPN水平文本神器,弯曲场景直接跪
EASTCVPR’17单阶段直接回归 4 顶点argman/EAST180 FPS 成名,四边形假设误差大
SegLinkCVPR’17分段检测 + 链接合并dengdan/seglink超长行利器,后处理略繁琐

2.2 实例分割时代(2018-2019 · 任意形状)

算法会议关键思路代码一句话点评
PixelLinkAAAI’18像素分割 + 邻接预测ZJULearning/pixel_link无需锚框,CPU 连通域后处理
PSENetCVPR’19多尺度 kernel + BFS 扩张whai362/PSENet曲线文本 SOTA,速度拖后腿
PANICCV’19单层 kernel + 向量聚类whai362/PAN84 FPS + 80+% F-measure,轻量里程碑
DBNetAAAI’20可微分二值化MhLiao/DB工业落地首选,精度≈PSENet 速度×3

2.3 轮廓/组件时代(2020-2022 · 更细粒度)

算法会议关键思路代码一句话点评
TextRayECCV’20极坐标射线回归aim-uofa/TextRay单阶段输出任意多边形,角度突变稳
PCRCVPR’21由粗到细轮廓回归mmocr解决顶点顺序 & 自交,精度↑速度↓
FCENetCVPR’21傅里叶级数参数化轮廓mmocr数学优雅,50 阶拟合复杂曲线
TextBPNCVPR’22图卷积迭代变形框yudongwang/TextBPN再刷榜,但 30 FPS 左右

2.4 Transformer 时代(2021-今 · 全局建模)

算法会议关键思路代码一句话点评
SwinTextarXiv’21Swin Transformer backboneSwin-Transformer全局感受野,长文本断行缓解,显存高
TESTRCVPR’22检测+识别一体 TransformerTESTR端到端序列输出,无需 NMS,训练贵

2.5 工业界「短平快」组合

场景推荐搭配性能参考
速度优先DBNet + ResNet18单卡 100+ FPS,手机 30 FPS
精度优先PSENet-Res50 / FCENet-Res50比赛刷榜
端到端TESTR / Mask TextSpotter v3云 OCR 一条线

2.6 速记口诀

水平 EAST,曲线 PSENet,工业 DBNet,极速 PAN,傅里叶 FCENet,Transformer 看 TESTR。

三、代表性大模型 OCR 产品技术解析

3.1 DeepSeek-OCR2:视觉因果流引领阅读革命

核心创新:

DeepEncoder V2 架构:轻量级 LLM 替代 CLIP 编码器,实现视觉 - 语言深度融合

视觉因果流机制:
  • 双向注意力全局感知文档结构
  • 因果查询动态重排视觉 Token
  • 混合专家(MoE)语言模型解码
  • 性能表现:OmniDocBench v1.5 基准评估中达 91.09%,超越 GPT-4o 与 Gemini

3.2 LightOnOCR-2:轻量级模型的效率标杆

核心突破:
  • 端到端架构:直接输出结构化文本,无需后处理
  • RLVR 强化学习:自动化测试 + 奖励机制,持续优化识别精度
  • 推理效率:1B 参数模型比 9B 竞品快 3 倍,支持实时文档处理

3.3 混元 OCR:企业级场景的全能专家

核心能力:

  • 统一框架:支持文字检测、识别、复杂文档解析、开放字段抽取、视觉问答
  • 领域适配:医疗、金融、法律等垂直领域的知识沉淀,实现精准信息提取
  • 轻量化部署:支持云端、边缘、移动端的灵活部署,满足不同场景算力需求

paper

更多推荐