加载中...
OCR 将图像中的印刷或手写文字转化为可编辑的数字文本。从 1950 年代的邮政分拣机到今天手机扫描发票自动报销,OCR 已是最成熟的计算机视觉应用之一,准确率在标准印刷文档上接近 100%。

| 类型 | 计算机视觉技术 |
| 代表工具 | Tesseract、ABBYY FineReader、PaddleOCR |
| 成熟度 | 印刷体准确率接近 100%,手写体仍有差距 |
最早的 OCR 设备是 1955 年 Farrington Manufacturing 为美国银行支票分拣开发的专用机器,只能识别特定字体(E-13B 磁性墨水字体至今仍在用)。商用 OCR 软件由 Kurzweil Computer Products 在 1974 年推向市场,创始人 Ray Kurzweil 随后将公司卖给施乐。
Tesseract 是目前最知名的开源 OCR 引擎,最初由 HP 开发,1985 年起,2005 年开源,谷歌接手后持续维护至今。2016 年加入 LSTM 神经网络后,准确率大幅提升,支持 100 多种语言。商业方案中,ABBYY FineReader 以高精度著称,百度 OCR 和腾讯云 OCR 在中文场景下表现突出。[1]
当代 OCR 通常分四步:版面分析(区分文字区域、图表、表格)→ 文本行检测(找到每行文字的边界框,常用 EAST、DB-Net 等检测网络)→ 字符识别(用 CRNN + CTC 或 Transformer 序列模型把文字行图像转为文字)→ 后处理(语言模型纠错)。
手写汉字识别难度远高于印刷体,当前最佳系统在 CASIA-HWDB 数据集上字符错误率已低于 2%,但多变的连笔和个人书写习惯依然是瓶颈。

| 类型 | 计算机视觉技术 |
| 代表工具 | Tesseract、ABBYY FineReader、PaddleOCR |
| 成熟度 | 印刷体准确率接近 100%,手写体仍有差距 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧