合成データ (Synthetic Data)

データ
約1分で読めます

AIアルゴリズムや統計モデルを通じて、現実世界の測定値ではなく人工的に生成されたデータであり、元のデータの統計的特性とパターンを維持することで分析やモデル学習に活用されます。

別名
人工データシミュレーションデータ仮想データ

詳しい説明

実際の出来事や人物から直接収集するのではなく、数学的なアルゴリズムを通じて生成した架空のデータです。元のデータの数値的分布や変数間の相関関係などの統計的構造を精密に模倣して生成されるため、実際のデータと類似した分析結果を導き出すことができます。個人識別情報(PII)を含まないため、GDPRやHIPAAなどの厳格な個人情報保護規制に抵触せず、医療や金融のようにデータアクセスが制限されている分野において学習用リソースを確保するために不可欠です。GAN(敵対的生成ネットワーク)やVAE(変分オートエンコーダ)などの生成AI技術を活用し、現実では収集が困難なエッジケース(Edge Case)を大量に生成することで、モデルの堅牢性を高めることができます。ガートナー(Gartner)は、2026年までにAIモデルの学習データの約75%が合成データで構成されるようになると予測しています。

ツール選択において重要な理由

データの確保が困難な初期モデルの開発段階や、個人情報保護が最優先されるエンタープライズ環境において重要な役割を果たします。合成データ生成ツールを選択する際は、単にデータを生成する機能だけでなく、生成されたデータが元の統計的特性をどれだけ適切に維持しているか(Fidelity:忠実度)や、元のデータが逆探知されないように保証するセキュリティ技術(差分プライバシー:Differential Privacyなど)が搭載されているかを確認する必要があります。

確認すべき点

  • 忠実度(Fidelity):合成データが実際のデータの統計的相関関係をどれだけ正確に維持しているか?
  • 有用성(Utility):合成データで学習したモデルが、実際の環境でも高い性能を発揮するか?
  • 個人情報保護(Privacy):差分プライバシー(Differential Privacy)の適用により、元の再識別を防止しているか?
  • バイアス管理(Bias mitigation):元データに含まれるバイアスを排除したり、特定のデータ群を強化したりできるか?

例

自動運転AIの学習のために、実際の道路で撮影することが困難な極端な気象状況(豪雪、暴風雨)や、夜間の歩行者の急な飛び出しシナリオを仮想画像として生成して学習させることができます。また、実際の癌患者の個人情報を公開することなく、数万人分の仮想患者の臨床データを生成して、新薬開発の予測モデルを学習させるためにも活用されます。

関連用語

生成AI