Stable Diffusion

AI概念
約1分で読めます

Stability AIが公開したオープンソースのテキストから画像を生成するモデルで、潜在拡散モデル(Latent Diffusion Model)に基づいています。

別名
Stable DiffusionSD

詳しい説明

Stable Diffusionは、Stability AIが2022年に公開したオープンソースのテキストから画像を生成するモデルです。潜在拡散モデル(Latent Diffusion Model)をベースに、ノイズから開始して段階的に雑音を取り除きながら、テキストプロンプトに合った画像を生成します。最大の特徴は、モデルの重みが公開されており、個人のPCや自社サーバーで直接実行して微調整できる点です。これを土台に、Automatic1111やComfyUIなどのインターフェース、LoRAやControlNetといった拡張技術の生態系が形成され、イラスト、コンセプトアート、製品モックアップなどのクリエイティブワークに幅広く利用されています。

ツール選択において重要な理由

Stable Diffusion系のツールは重みが公開されているため、クラウドAPI型の生成ツールとは異なり、ローカル実行、自社ホスティング、詳細なカスタマイズが可能です。データを外部に送信したくない場合、特定の画風を学習させたい場合、または利用量ベースの課金の代わりに一度構築して無制限に生成したい場合の選択肢となります。ただし、GPUリソースと設定の負担が伴う点も考慮する必要があります。

導入前に確認すべき点

  • ローカル実行に必要なGPUメモリ(VRAM)を備えているか
  • 希望する画風や解像度を出せるチェックポイントやLoRAが公開されているか
  • 生成結果の商業利用に関するライセンス条件を確認したか
  • API型ツールと比較して、構築・運用コストが実際に有利であるか

実際の適用例

外部にデザイン案を送ることができない社内のデザインチームが、自社サーバーにStable Diffusionを構築し、自社製品の画像を学習させたLoRAを組み合わせて、統一されたトーンの製品コンセプト画像を大量に生成する、といった方法で活用されます。クラウド型の生成ツールでは難しい、データセキュリティと画風のコントロールを両立させた事例です。

関連用語

生成AIマルチモーダルテキストから画像生成LoRA