拡散モデル
用語名をコピー
AI概念約1分で読めます
ノイズから開始し、段階的に雑音(ノイズ)を取り除きながらデータを生成する、画像・動画生成の主流となるAI手法です。
別名
Diffusion Modelディフュージョンモデル
詳しい説明
拡散モデル(Diffusion Model)は、データに徐々にノイズを加えて破壊していくプロセスを逆方向に学習し、ランダムなノイズから開始して段階的にノイズを除去しながら新しいデータを生成するディープラーニングの手法です。現在、画像・動画・音声生成の主流となっており、Stable Diffusion、DALL·E、MidjourneyといったText-to-Image(テキストから画像への生成)ツールがこの原理を利用しています。かつて主流だったGAN(敵対的生成ネットワーク)よりも学習が安定しており、生成結果の多様性が高い傾向にありますが、多くのステップを要するため生成速度が比較的遅くなります。これを補うため、ステップ数を削減する高速化技術も合わせて発展しています。
ツール選定において重要な理由
画像・動画生成ツールの多くが拡散モデルをベースにしています。モデルの構造自体を直接操作することはほとんどありませんが、生成のステップ数(段階数)が速度と品質を左右することを知っておくと、ツールの生成速度・解像度・コストを理解し比較しやすくなります。素早いプレビューが重要か、最終的な品質が重要かによって、最適なツールが分かれます。
ツールを選ぶ際に確認すべき点
- 生成速度と出力品質のバランスがタスクに適しているか
- 希望する解像度や画風を安定して出力できるか
- 生成物の商用利用や著作権に関する条件が明確か
- 一部の領域のみを再生成するインペインティングなどの編集機能があるか
実際の適用例
マーケティング用画像を制作する際、拡散モデルベースのツールを使って少ないステップ数で高速にプレビュー画像を複数出力し、方向性を決定します。その後、選定した案のみを多いステップ数で再生成して品質を高めます。生成ステップ数を調整できるツールであれば、このような速度と品質のトレードオフを直接制御できます。
関連用語
Stable Diffusion
Stability AIが公開したオープンソースのテキストから画像を生成するモデルで、潜在拡散モデル(Latent Diffusion Model)に基づいています。
テキストから画像生成テキストによる説明を分析して視覚的な画像に変換する生成AI技術です。単なる画像生成にとどまらず、デザイン案やマーケティング用アセットの制作など、実務全般に活用されており、最近では画像内の文字(タイポグラフィ)の表現力や、商業利用における著作...
GAN生成器(ジェネレーター)と識別器(ディスクリミネーター)が競い合いながら、実写のようなデータを生成するディープラーニングアーキテクチャです。ディフュージョンモデルよりも生成速度が格段に速いため、リアルタイムの映像変換や高解像度復元などに主に...
生成AI大規模なデータを学習してデータのパターンや構造を理解し、それをもとにテキスト、画像、音声、コードなど、独創的な新しいコンテンツを生成する人工知能技術です。