OCR

AI概念
約1分で読めます

画像やスキャン文書、写真の中の文字を、コンピュータで編集・検索可能なテキストデータに変換する技術です。

別名
光学文字認識Optical Character Recognition

詳しい説明

OCR(Optical Character Recognition、光学文字認識)は、印刷物・手書き文字・スキャンされた文書・写真の中의 文字を、コンピュータが扱えるテキストデータとして抽出する技術です。初期は文字の形状を決められたパターンと照合する方式でしたが、今日ではCNNとRNN・トランスフォーマーを組み合わせたディープラーニングにより、複雑なレイアウト、多言語、手書き文字まで高い精度で認識します。文書のデジタル化、領収書・名刺の認識、車のナンバープレートの読み取り、医療・法律記録の変換などに使われており、Tesseract、Google Vision API、NAVER CLOVA OCR、AWS Textractなどが代表的なソリューションです。

ツール選定において重要な理由

OCRツールは、認識精度と同じくらい、どのような入力を得意とするかが重要です。鮮明な印刷物は大抵問題なく読み取れますが、表の多い帳票、手書き文字、低画質な写真、多言語混在の文書などでは、ツールによって性能に大きな差が生じます。表の構造を維持したまま抽出できるか、結果の座標情報を同時に取得できるか、処理量と単価が業務規模に見合っているかなどが、実務における選定基準となります。

ツールを選定する際の確認ポイント

  • 処理する文書タイプ(帳票・手書き・低画質写真)において精度が検証されているか
  • 韓国語を含む必要な言語を正確に認識できるか
  • 表や項目の位置座標、構造を合わせて抽出してくれるか
  • 大量処理時の速度と件数あたりのコストが、業務規模に適しているか

実際の適用例

経費精算の担当者が領収書の写真をアップロードすると、OCRが店名・金額・日付をテキストとして抽出し、会計システムに自動入力するように構築します。この際、金額欄や日付欄の位置情報を併せて提示してくれるツールを使用すれば、誤認識された項目だけを選択して検証するワークフローを作成できるため、手入力の時間を大幅に削減できます。

関連用語

コンピュータービジョンCNNディープラーニング