コンピュータービジョン

AI概念
約1分で読めます

コンピューターが画像や動画などの視覚的データを人間のように理解・分析し、意思決定を行えるようにするAI技術分野です。単なる画面ピクセルの分析にとどまらず、物体認識、状況の把握、3D空間の理解などを行います。

別名
Computer VisionCV

詳しい説明

コンピュータービジョン(Computer Vision)は、デジタルの視覚データから意味のある情報を抽出し、実行可能なインサイトを導き出すAI技術です。かつては手動フィルターベースの画像処理が主流でしたが、現在は畳み込みニューラルネットワーク(CNN)やビジョントランスフォーマー(ViT)などのディープラーニング技術により、人間と同等レベルの認識精度を実現しています。自動運転車のリアルタイム障害物検知、医療画像の病気診断、製造工程の欠陥検査など、産業全般において「機械の目」としての役割を果たしており、最近ではテキストと視覚情報を同時に処理するマルチモーダルAIと融合し、さらに高度化しています。

ツール選択において重要な理由

コンピュータービジョンツールは、単に画像を認識するだけでなく、ビジネス自動化の核心となります。リアルタイムの処理速度(レイテンシー)と精度のバランスが重要であり、特に製造やセキュリティの分野では、照度の変化や角度などの過酷な環境でも安定して動作するモデルを選択することが、プロジェクトの成否を左右します。

確認すべき点

  • リアルタイム性:エッジ(Edge)デバイスで遅延なく動作する必要があるか確認してください。
  • データの効率性:保有する学習データが少なければCNNベースのモデルが、大量のデータがあればViTベースのモデルが有利です。
  • デプロイ環境:クラウドベースの処理か、現場の低スペック機器(Edge AI)で実行されるかを考慮してください。
  • 精度指標:mAP(mean Average Precision)や再現率(Recall)など、ドメインに適した性能指標を検討してください。

例

スマートリテールの「無人決済システム」は、顧客が手に取った商品をリアルタイムで認識してショッピングカートに入れ、医療AIはMRI撮影データから微細な腫瘍パターンを見つけ出し、専門医の診断をサポートします。

混同しやすい用語

画像処理(Image Processing)

ノイズ除去や明るさ調整など、画像の品質を改善または変換する技術であり、内容の「理解」よりも「視認性」に焦点を当てています。

コンピュータービジョン(Computer Vision)

画像の中の物体が何であるか、どのような行動が起きているかなど、文脈を把握して判断する高次元の技術です。

関連用語

ディープラーニングCNNOCR