AI用語集
人工知能の完全辞典
Classifier-Free Guidance
外部の分類器を必要とせず、モデル自体を使ってコンディショニング信号に従うか無視するかを制御するガイダンス技術であり、プロンプトへの忠実度を向上させる。
IP-Adapter (Image Prompt Adapter)
参照画像をプロンプトとして使用できるモジュールで、その視覚的特徴をエンコードして拡散モデルの重みを変更せずに生成プロセスをガイドする。
GLIGEN (Grounded Language-to-Image Generation)
テキスト概念に境界ボックスを関連付け、生成された画像内のオブジェクトの位置とサイズを正確に空間的に制御できるフレームワーク。
Cross-Attention Guidance
テキストと画像間のクロスアテンションマップを活用して、生成された画像の特定の領域に対するプロンプトの特定部分の影響を強化または弱体化するメカニズム。
LoRA (Low-Rank Adaptation)
モデルのアテンション層に小さな低ランク行列を挿入する効率的なファインチューニング技術で、最小限のパラメータで新しいスタイルや概念を学習できる。
T2I-Adapter (Text-to-Image Adapter)
スケッチやセグメンテーションマップなどの追加の参照条件を使用して、事前学習済みの拡散モデルをガイドする軽量モジュールで、完全な再トレーニングを必要としない。
UNet Guidance
UNetアーキテクチャのノイズ除去予測に直接作用するガイダンスプロセスで、生成物を希望のコンディショニングに合わせるように勾配の方向を修正する。
Attention Refocusing
アテンションマップを変更して、プロンプトトークンの重要度を画像の別の領域にリダイレクトする方法で、生成された要素の構成を再編成できるようにする。
セマンティックガイダンス
外部セマンティックモデル(例:CLIP)を使用してガイダンス損失を計算し、生成された画像がプロンプトの意味と概念レベルで一致するように保証するアプローチ。
マルチモーダルガイダンス
テキスト、画像、マスク、深度マップなど複数のタイプのガイドを同時に組み合わせ、生成プロセスに対して階層的で多面的な制御を行う戦略。
ヌルテキスト反転
生成プロセスを逆にして最適化された「ヌルプロンプト」を見つけ、実画像にアーティファクトなしで正確な修正を可能にする画像編集技術。
SDEdit(確率微分方程式編集)
既存の画像にノイズを追加し、ガイド付きでノイズ除去を行い、実画像の編集をしながらその基礎となる構造を維持する方法。