Stable Diffusion
用語名をコピー
AI概念約1分で読めます
Stability AIが公開したオープンソースのテキストから画像を生成するモデルで、潜在拡散モデル(Latent Diffusion Model)に基づいています。
別名
Stable DiffusionSD
詳しい説明
Stable Diffusionは、Stability AIが2022年に公開したオープンソースのテキストから画像を生成するモデルです。潜在拡散モデル(Latent Diffusion Model)をベースに、ノイズから開始して段階的に雑音を取り除きながら、テキストプロンプトに合った画像を生成します。最大の特徴は、モデルの重みが公開されており、個人のPCや自社サーバーで直接実行して微調整できる点です。これを土台に、Automatic1111やComfyUIなどのインターフェース、LoRAやControlNetといった拡張技術の生態系が形成され、イラスト、コンセプトアート、製品モックアップなどのクリエイティブワークに幅広く利用されています。
ツール選択において重要な理由
Stable Diffusion系のツールは重みが公開されているため、クラウドAPI型の生成ツールとは異なり、ローカル実行、自社ホスティング、詳細なカスタマイズが可能です。データを外部に送信したくない場合、特定の画風を学習させたい場合、または利用量ベースの課金の代わりに一度構築して無制限に生成したい場合の選択肢となります。ただし、GPUリソースと設定の負担が伴う点も考慮する必要があります。
導入前に確認すべき点
- ローカル実行に必要なGPUメモリ(VRAM)を備えているか
- 希望する画風や解像度を出せるチェックポイントやLoRAが公開されているか
- 生成結果の商業利用に関するライセンス条件を確認したか
- API型ツールと比較して、構築・運用コストが実際に有利であるか
実際の適用例
外部にデザイン案を送ることができない社内のデザインチームが、自社サーバーにStable Diffusionを構築し、自社製品の画像を学習させたLoRAを組み合わせて、統一されたトーンの製品コンセプト画像を大量に生成する、といった方法で活用されます。クラウド型の生成ツールでは難しい、データセキュリティと画風のコントロールを両立させた事例です。
関連用語
生成AI
大規模なデータを学習してデータのパターンや構造を理解し、それをもとにテキスト、画像、音声、コードなど、独創的な新しいコンテンツを生成する人工知能技術です。
マルチモーダルテキスト・画像・音声・動画など、2つ以上のデータ形式を同時に理解し処理するAIモデルです。
テキストから画像生成テキストによる説明を分析して視覚的な画像に変換する生成AI技術です。単なる画像生成にとどまらず、デザイン案やマーケティング用アセットの制作など、実務全般に活用されており、最近では画像内の文字(タイポグラフィ)の表現力や、商業利用における著作...
LoRA巨大モデルの既存の重みを固定したまま、学習可能な低ランク(Low-Rank)行列のみを追加することで、学習パラメータとハードウェア要求スペックを劇的に削減する効率的なファインチューニング(PEFT)手法です。