ビジュアルAIガイド

光学式文字認識

光学式文字認識 (OCR) は、テキストの画像 (スキャンした文書、看板の写真、PDF) を機械可読で編集可能なテキストに変換します。

2分の読書最終更新日

概要

It is the bridge that makes the printed and handwritten world searchable and computable.

ディープダイブ

OCR は、文字のように見えるピクセルを、コンピュータが保存および編集できる実際の文字コードに変換します。従来の OCR は段階的に機能しました。画像をクリーンにして歪みを補正し、テキスト領域を見つけて、線と個々のグリフに分割し、既知のパターンと形状を照合して各グリフを分類しました。最新の OCR は主にニューラルです。畳み込みネットワークが視覚的な特徴を読み取り、シーケンス モデル (多くの場合、CTC 損失またはアテンションベースのデコーダを使用) が、完全な文字セグメンテーションを必要とせずに文字列全体を予測します。これにより、筆記体、重なり合う文字、およびさまざまなフォントがはるかに適切に処理されます。 Tesseract などのエンジンに加え、Google、Amazon、Microsoft のクラウド サービスを利用することで、クリーン プリントで非常に高い精度を実現し、数十の言語とスクリプトを処理できるようになりました。

技術的な洞察

大きな進歩はコネクショニスト時間分類 (CTC) でした。古いシステムでは、単語を認識する前に単語を個別の文字に分割する必要があり、文字が触れたり汚れたりするとエラーが発生しやすくなりました。 CTC を使用すると、リカレント ネットワークまたはトランスフォーマー ネットワークが画像の各水平スライスで各文字の確率を出力し、リピートと空白を折りたたんで最終的な単語を生成できます。これにより、脆弱なセグメンテーションのステップが削除され、モデルはラベル付きの画像とテキストのペアからピクセルと文字の間の位置合わせを自動的に学習できるようになります。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

光学式文字認識の未来

OCR は、別のテキスト抽出ステップを省略して、ページを読み取り、そのページに関する質問に直接答える、より広範な「ドキュメント AI」およびビジョン言語モデルに統合されています。乱雑な手書き文字、履歴アーカイブ、低解像度の携帯電話の写真、表、フォーム、領収書などの複雑なレイアウトの強力な処理が期待されます。多言語および低リソースのスクリプトの対応範囲は拡大し続け、デバイス上の OCR は高速化され、道路標識のリアルタイム翻訳やカメラが捉えたあらゆるテキストの即時キャプチャが可能になります。

現実世界の実装

紙の小切手の口座、ルーティング、金額フィールドを読み取るモバイル バンキング アプリにより、ユーザーは写真で入金できるようになります

Google レンズと Apple Live Text により、写真からテキストをコピーしたり、外国のメニューをリアルタイムで翻訳したりできます

歴史的な新聞や図書館のアーカイブをデジタル化し、全文をキーワード検索できるようにする

仕入先、日付、合計を抽出する会計ソフトウェアでの請求書と領収書の自動処理

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Optical Character Recognition?

光学式文字認識 (OCR) は、テキストの画像 (スキャンした文書、看板の写真、PDF) を機械可読で編集可能なテキストに変換します。これは、印刷された世界と手書きの世界を検索可能にし、計算可能にする架け橋です。

OCRの主な仕事は何ですか?

OCR の特徴的なタスクは、文字を表すピクセルを、コンピューターが保存、検索、編集できる実際のテキスト コードに変換することです。

最新の OCR により、認識前に単語が別々の文字に分割されることを回避できるのはどの技術ですか?

CTC を使用すると、ネットワークが画像スライス全体で文字を予測し、結果を折りたたんで、脆弱な文字ごとのセグメンテーション ステップを排除します。

「デスキュー」が OCR パイプラインの一般的な前処理ステップであるのはなぜですか?

スキャンしたページや写真を撮ったページは、わずかに回転していることがよくあります。傾きを補正するとテキストが水平方向に整列され、認識精度が向上します。

広く使用されているオープンソース OCR エンジンは次のうちどれですか?

Tesseract は、多くの言語をサポートする人気のオープンソース OCR エンジンです。他のものは無関係な目的に役立ちます。

一般に、手書きのテキストは印刷されたテキストよりも OCR にとって難しいのはなぜですか?

手書きの形状、傾き、間隔には大きなばらつきがあり、筆記体文字はつながっているため、分割と分類が非常に困難になります。