## 光学文字認識 **光学文字認識**(こうがくもじにんしき、英: Optical Character Recognition、略称: OCR)は、印刷物や手書きのテキストを機械が読み取り、編集可能なデジタルデータに変換する技術である。スキャナーやデジタルカメラで取得した画像から文字を識別し、テキストデータとして出力する。 ## 概要 OCRは、[[document-analysis|文書

英語からの翻訳

光学文字認識(OCR)は、タイプされた文字、手書き文字、または印刷された文字の画像を機械可読なテキストに変換するプロセスであり、人工知能におけるパターン認識の最も初期の実用的応用の一つである。

光学文字認識(OCR)は、画像、スキャン文書、またはテキストの写真からテキストを抽出し、ピクセルを機械可読かつ機械編集可能な文字に変換する技術である。これはコンピュータビジョン自然言語処理の交差点に位置する。なぜなら、動作するシステムは画像内のグリフを位置特定してセグメント化し、それらを言語の記号として解釈する必要があるからである。OCRはパターン認識の最初の商業的に有用な応用の一つであり、現代の深層学習時代より数十年先行している。

歴史

初期のOCRシステムは1950年代から1960年代に遡り、デビッド・シェパードの「Gismo」やレイ・カーツワイルの視覚障害者向け読書機(1976年)などのデバイスが、テンプレートマッチングと手作業による特徴量を使用して印刷フォントを認識した。1980年代から1990年代にかけて、もともとヒューレット・パッカードで開発され、後にGoogleによってオープンソース化されたTesseractなどのOCRソフトウェアは、統計的分類器と特徴抽出パイプラインに依存しており、これらは主に記号的人工知能と古典的機械学習に基づいて構築され、後に支配的となる層状表現学習ではなかった。クリーンなタイプ文字に対する精度は1990年代までに商業的に実用可能なレベルに達したが、手書き文字や雑然としたシーンはその後20年間困難な問題のままであった。

深層学習時代

畳み込みニューラルネットワークと、その後のリカレントおよびシーケンス・ツー・シーケンスアーキテクチャの導入により、OCRの精度は劇的に向上し、特に手書き文字や、道路標識や製品ラベルなどの自然シーンに埋め込まれたテキストで顕著であった。視覚的特徴抽出のためのCNNと、LSTMまたはアテンションベースのデコーダを組み合わせたアーキテクチャは、2010年代半ばまでに標準となった。コンピュータビジョンの多くと同様に、進歩は手作業によるパイプラインから、大規模なラベル付きデータセットで訓練されたエンドツーエンドのニューラルネットワークへの広範な移行に追従した。

視覚言語モデル時代

2020年代初頭以降、トランスフォーマーアーキテクチャに基づく汎用の視覚言語モデルマルチモーダルシステムが、OCRの機能の多くを吸収している。GeminiやGPT-4の変種を含む視覚能力を持つモデルは、専用のOCRパイプラインなしで、より広範な視覚理解タスクの一部として画像に埋め込まれたテキストを読み取ることができ、図、表、または文脈内の手書き文字が混在する文書では、専用のOCRシステムを上回る性能を発揮することが多い。これにより、個別タスクとしてのOCRと一般的な文書理解との境界が曖昧になったが、専用のOCRエンジンは、大規模なマルチモーダルモデルがコスト高または低速になる高スループット、低遅延、またはオフラインの文書処理において依然として広く使用されている。

応用と評価

OCRは、文書のデジタル化、検索可能なPDF作成、ナンバープレート認識、領収書や請求書の処理、郵便物の仕分け、視覚障害者および弱視者向けのアクセシビリティツール、そしてテキストを検索エンジンや大規模言語モデルの訓練コーパスに供給する取り込みパイプラインの基盤となっている。システムは通常、スキャンまたは撮影されたテキストのベンチマークデータセットに対する文字誤り率と単語誤り率で評価される。性能は言語、文字体系、印刷品質、手書きスタイルによって大きく異なり、筆記体の手書き文字や低リソースの文字体系は比較的弱点のままである。構成タスクとして、OCR品質は通常、汎用のベンチマークではなく、専用の文書およびシーンテキストデータセットで報告される。

制限事項

OCRエラーは、検索インデックスや自動データ入力などの下流システムに伝播する可能性があり、視覚的に類似した文字を利用してOCRベースのフィルタを回避する特殊な攻撃も存在する。暗黙的にOCRを実行するマルチモーダルモデルは、ソース画像と一致しないが類似したテキストを幻覚することもあり、これは古典的なOCRのセグメント化エラーとは異なる失敗モードである。

カテゴリ:computer-vision·natural-language-processing·industry
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴