OCR
用語名をコピー
AI概念約1分で読めます
画像やスキャン文書、写真の中の文字を、コンピュータで編集・検索可能なテキストデータに変換する技術です。
別名
光学文字認識Optical Character Recognition
詳しい説明
OCR(Optical Character Recognition、光学文字認識)は、印刷物・手書き文字・スキャンされた文書・写真の中의 文字を、コンピュータが扱えるテキストデータとして抽出する技術です。初期は文字の形状を決められたパターンと照合する方式でしたが、今日ではCNNとRNN・トランスフォーマーを組み合わせたディープラーニングにより、複雑なレイアウト、多言語、手書き文字まで高い精度で認識します。文書のデジタル化、領収書・名刺の認識、車のナンバープレートの読み取り、医療・法律記録の変換などに使われており、Tesseract、Google Vision API、NAVER CLOVA OCR、AWS Textractなどが代表的なソリューションです。
ツール選定において重要な理由
OCRツールは、認識精度と同じくらい、どのような入力を得意とするかが重要です。鮮明な印刷物は大抵問題なく読み取れますが、表の多い帳票、手書き文字、低画質な写真、多言語混在の文書などでは、ツールによって性能に大きな差が生じます。表の構造を維持したまま抽出できるか、結果の座標情報を同時に取得できるか、処理量と単価が業務規模に見合っているかなどが、実務における選定基準となります。
ツールを選定する際の確認ポイント
- 処理する文書タイプ(帳票・手書き・低画質写真)において精度が検証されているか
- 韓国語を含む必要な言語を正確に認識できるか
- 表や項目の位置座標、構造を合わせて抽出してくれるか
- 大量処理時の速度と件数あたりのコストが、業務規模に適しているか
実際の適用例
経費精算の担当者が領収書の写真をアップロードすると、OCRが店名・金額・日付をテキストとして抽出し、会計システムに自動入力するように構築します。この際、金額欄や日付欄の位置情報を併せて提示してくれるツールを使用すれば、誤認識された項目だけを選択して検証するワークフローを作成できるため、手入力の時間を大幅に削減できます。
関連用語
コンピュータービジョン
コンピューターが画像や動画などの視覚的データを人間のように理解・分析し、意思決定を行えるようにするAI技術分野です。単なる画面ピクセルの分析にとどまらず、物体認識、状況の把握、3D空間の理解などを行います。
CNN畳み込み(Convolution)レイヤーによって画像の局所的なパターンを学習する、画像認識に特化したディープラーニングのニューラルネットワーク構造です。
ディープラーニング多層の人工ニューラルネットワークを通じてデータの複雑な非線形関係を学習する機械学習の一分野です。データから特徴量(Feature)を自ら抽出し、画像認識、自然言語処理、生成AIなど、高度な認知能力が必要とされる分野において中核技術として使用...