GAN

AI概念
約1分で読めます

生成器(ジェネレーター)と識別器(ディスクリミネーター)が競い合いながら、実写のようなデータを生成するディープラーニングアーキテクチャです。ディフュージョンモデルよりも生成速度が格段に速いため、リアルタイムの映像変換や高解像度復元などに主に活用されます。

別名
敵対的生成ネットワークGenerative Adversarial Network

詳しい説明

2014年にイアン・グッドフェロー(Ian Goodfellow)が提案したGAN은、生成器(Generator)と識別器(Discriminator)という2つのニューラルネットワークが互いに欺き、見破るプロセスを通じて、データの精巧さを高める技術です。生成器は本物に近い偽データを生成し、識別器はそれを鑑別しながら学習します。近年、テキストから画像への生成分野はディフュージョンモデルが主導していますが、GANは1回の演算で結果を出す高速な推論速度のおかげで、リアルタイムのフェイスフィルター、デジタルヒューマン制作、超解像(Super Resolution)、ペアのないデータ間の変換(CycleGAN)などの分野で依然として核心的な位置を占めています。ただし、学習過程で多様性を失う「モード崩壊(Mode Collapse)」現象を管理することが、ツール選定および活用の主要な基準となります。

ツール選定において重要な理由

ユーザーが「リアルタイム性」と「低い演算コスト」を重視する場合、GANベースのツールを選択する必要があります。最新のディフュージョンモデルは高品質ですが生成に数秒から数十秒かかるのに対し、GANはミリ秒(ms)単位の推論が可能であるため、モバイルアプリのリアルタイムフィルターやインタラクティブなサービスに適しています。

確認すべき点

  • リアルタイム生成(Low Latency)が必要な環境か?
  • 学習データが不足している、またはペア(Pair)のないデータ間の変換(例:馬の写真をシマウマの写真に)が必要か?
  • 生成ツールがモード崩壊(特定のイメージばかりを繰り返し生成する現象)を防止するアルゴリズムを備えているか?

例

SNOWやTikTokのリアルタイム顔変換フィルター、低解像度のCCTV映像を4Kにアップスケーリングするセキュリティソリューション、実在しない高解像度の人物写真を生成するデジタルヒューマンソリューションなどが代表例です。

混同しやすい用語

Diffusion Model

ノイズを段階的に除去しながら生成します。GANよりも生成速度は遅いものの、品質と多様性に優れています。

VAE (Variational Autoencoder)

データの特徴を圧縮してから復元する方式で生成します。GANよりも構造は安定していますが、生成物がややぼやける(Blurry)傾向があります。

関連用語

拡散モデル