AI用語集
人工知能の完全辞典
フォワードプロセス
元の画像に複数のタイムステップで反復的にガウスノイズを追加し、画像が純粋なノイズになるまで続ける学習フェーズ。モデル学習の基礎となります。
リバースプロセス(またはノイズ除去プロセス)
モデルがフォワードプロセスを逆転することを学ぶ生成フェーズ。ノイズを段階的に除去し、ランダムノイズ分布から明瞭な画像を再構築します。
拡散スケジュール
フォワードプロセスの各タイムステップで追加されるノイズの分散を定義する戦略。リバースプロセスでの生成品質と速度に影響を与えます。
ジャンプリサンプリング(潜在リサンプリング)
ノイズ除去プロセスの特定のタイムステップをスキップする高速推論手法。補間やリサンプリング技術を使用して生成ステップの総数を削減します。
条件付け(テキストto画像)
テキスト記述などの外部情報をノイズ除去プロセスに統合し、画像生成を特定のコンテンツに向けて導く手法。クロスアテンション機構を介して行われることが多いです。
潜在空間(潜在拡散)
拡散プロセスが画像のピクセルに直接適用されるのではなく、より低次元の潜在空間での圧縮表現に適用されるアプローチ。これにより計算コストを削減します。
分類器ガイダンス
事前学習された分類器を使用してターゲットクラス(例:'猫')の勾配を推定し、それを拡散モデルの勾配に追加して生成をそのクラスに向けて導く手法。
分類器なしガイダンス
外部の分類器を必要としない、より柔軟な条件付け手法。条件付きデータと非条件付きデータの両方で学習された単一モデルを使用してガイダンス勾配を計算します。
テキスト埋め込み (Text Embedding)
Transformerタイプのモデル(例:CLIP)によって生成されるテキストのベクトル表現で、拡散モデルを条件付けし、テキストの意味論を視覚的信号に変換するために使用されます。
ネガティブプロンプト
生成時に避けるべき概念やオブジェクトのリストをモデルに提供する技術で、ガイダンスプロセスを修正して、これらの不要な要素が出現する確率を最小化します。
Image-to-Image (Img2Img)
純粋なノイズではなく、既存の画像で生成プロセスを初期化する拡散モデルの応用で、基本的な構造を維持しながら画像を変換したりスタイライズしたりできます。