光学字符识别
光学字符识别 (OCR) 将文本图像(扫描文档、标志照片、PDF)转换为机器可读、可编辑的文本。
概述
It is the bridge that makes the printed and handwritten world searchable and computable.
深入探讨
OCR 将看起来像字母的像素转换为计算机可以存储和编辑的实际字符代码。经典 OCR 分阶段工作:清理图像并消除倾斜,找到文本区域,将它们分割成线条和单独的字形,然后通过将每个字形的形状与已知模式进行匹配来对每个字形进行分类。现代 OCR 很大程度上是神经的:卷积网络读取视觉特征,序列模型(通常带有 CTC 损失或基于注意力的解码器)无需完美的字符分割即可预测整个字符串。这可以更好地处理草书、重叠字母和各种字体。像 Tesseract 这样的引擎,加上来自 Google、Amazon 和 Microsoft 的云服务,现在可以在干净打印上达到非常高的精度,并处理数十种语言和脚本。
技术洞察
一个重大突破是联结主义时间分类(CTC)。较旧的系统必须在识别单词之前将其分割成单独的字母——当字母接触或涂抹时很容易出错。 CTC 让循环网络或变压器网络输出图像每个水平切片上每个字符的概率,然后折叠重复和空白以生成最终单词。这消除了脆弱的分割步骤,并让模型从标记的图像文本对中自动学习像素和字符之间的对齐。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
光学字符识别的未来
OCR 正在融入更广泛的“文档人工智能”和视觉语言模型,这些模型可以读取页面并直接回答有关该页面的问题,从而跳过单独的文本提取步骤。预计可以更好地处理凌乱的笔迹、历史档案、低分辨率手机照片以及表格、表格和收据等复杂的布局。多语言和低资源脚本覆盖范围将不断扩大,设备上的 OCR 将变得更快,从而实现街道标志的实时翻译和相机看到的任何文本的即时捕获。
现实世界的实施
移动银行应用程序可读取纸质支票的帐户、路由和金额字段,以便用户可以通过照片存款
Google Lens 和 Apple Live Text 可让您实时复制照片中的文本或翻译外文菜单
将历史报纸和图书馆档案数字化,以便全文可通过关键字搜索
会计软件中的自动发票和收据处理可提取供应商、日期和总计
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Character Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Optical Character Recognition?
光学字符识别 (OCR) 将文本图像(扫描文档、标志照片、PDF)转换为机器可读、可编辑的文本。它是使印刷和手写的世界变得可搜索和可计算的桥梁。
OCR的核心工作是什么?
OCR 的定义任务是将描述字母的像素转换为计算机可以存储、搜索和编辑的实际文本代码。
哪种技术可以让现代 OCR 避免在识别之前将单词分割成单独的字母?
CTC 让网络预测图像切片中的字符并折叠结果,从而消除了脆弱的每个字母分割步骤。
为什么“去偏斜”是 OCR 管道中常见的预处理步骤?
扫描或拍摄的页面通常会稍微旋转;去倾斜可水平对齐文本,提高识别准确性。
以下哪一个是广泛使用的开源 OCR 引擎?
Tesseract是一款流行的开源OCR引擎,支持多种语言;其他的则用于不相关的目的。
为什么手写文本通常比打印文本更难进行 OCR 识别?
手写体在形状、倾斜和间距方面具有巨大的可变性,并且草书字母相互连接,使得分割和分类变得更加困难。