データラベリング

データ
約1分で読めます

機械学習の教師あり学習のために、データに正解(ラベル)を付与する作業で、モデルの品質の土台となります。

別名
Data Labelingデータレイベリングアノテーション

詳しい説明

データラベリング(Data Labeling)は、機械学習の教師あり学習に使用するデータに正解(ラベル)を付与する作業です。画像内の物体の位置を枠(ボックス)で囲んで示したり、テキストに感情やカテゴリを割り当てたり、音声をテキストに書き起こしたりする作業が代表例です。モデルの性能は学習データの品質に大きく左右されるため、ラベルの正確性と基準の一貫性がモデルの精度を決定します。クラウドソーシング、社内専門家によるラベリング、モデルが一次ラベリングを行った後に人間が検収する半自動方式などが用いられ、Scale AIやLabelboxなどの専門プラットフォームが作業管理や品質検証をサポートします。

ツール選定において重要な理由

ラベリングツールの品質管理機能は、そのままモデルの精度に直結します。複数の作業者が一貫した基準でラベルを付与しているか、検収・合意プロセスがあるか、作業の進捗と正確性を追跡できるかが重要です。データのセキュリティが重要である場合は、外部のクラウドワーカーの代わりに社内でラベリングを行えるかどうかも検討する必要があります。

ツール選定時に確認すべき点

  • 作業者間のラベル合意・検収などの品質管理機能があるか
  • 取り扱うデータ形式(画像・テキスト・音声)をサポートしているか
  • モデルが一次ラベルを提案する半自動機能により、速度を向上させることができるか
  • 機密データの社内ラベリング・アクセス制御をサポートしているか

実際の適用例

自動運転のデータセットを作成する際、数万枚の道路画像内の車両・歩行者・信号機を枠で囲んで示します。作業者ごとに対象の基準が異なるとモデルが混乱するため、合意プロセスやガイドラインを提供するラベリングツールを使用してラベルの一貫性を確保します。

関連用語

機械学習ディープラーニング合成データ (Synthetic Data)