Glossaire IA
Le dictionnaire complet de l'Intelligence Artificielle
Classifier-Free Guidance
Technique de guidage qui élimine le besoin d'un classificateur externe en utilisant le modèle lui-même pour suivre ou ignorer un signal de conditionnement, améliorant ainsi la fidélité au prompt.
IP-Adapter (Image Prompt Adapter)
Module qui permet d'utiliser une image de référence comme prompt, en encodant ses caractéristiques visuelles pour guider le processus de génération sans modifier les poids du modèle de diffusion.
GLIGEN (Grounded Language-to-Image Generation)
Framework qui ancre des boîtes de délimitation (bounding boxes) à des concepts textuels, permettant un contrôle spatial précis sur la position et la taille des objets générés dans une image.
Cross-Attention Guidance
Mécanisme qui exploite les cartes d'attention croisée entre le texte et l'image pour renforcer ou affaiblir l'influence de parties spécifiques du prompt sur des zones de l'image générée.
LoRA (Low-Rank Adaptation)
Technique de réglage fin efficace qui injecte de petites matrices de faible rang dans les couches d'attention du modèle, permettant d'apprendre de nouveaux styles ou concepts avec un minimum de paramètres.
T2I-Adapter (Text-to-Image Adapter)
Module léger qui guide un modèle de diffusion pré-entraîné en utilisant des conditions de référence supplémentaires (comme des croquis ou des cartes de segmentation) sans nécessiter un réentraînement complet.
UNet Guidance
Processus de guidage qui opère directement sur les prédictions de débruitage de l'architecture UNet, en modifiant la direction du gradient pour aligner la génération avec le conditionnement souhaité.
Attention Refocusing
Méthode qui modifie les cartes d'attention pour rediriger l'importance d'un token de prompt vers une autre région de l'image, permettant de réorganiser la composition des éléments générés.
Semantic Guidance
Approche qui utilise un modèle sémantique externe (ex: CLIP) pour calculer une perte de guidage, assurant que l'image générée reste alignée avec le sens du prompt à un niveau conceptuel.
Multi-Modal Guidance
Stratégie qui combine plusieurs types de guides (texte, image, masque, carte de profondeur) simultanément pour un contrôle hiérarchique et multi-facettes sur le processus de génération.
Null-Text Inversion
Technique d'édition d'images qui inverse le processus de génération pour trouver un 'prompt nul' optimisé, permettant des modifications précises sur des images réelles sans artefacts.
SDEdit (Stochastic Differential Equation Edit)
Méthode qui ajoute du bruit à une image existante puis la débruite avec un guide, permettant d'éditer des images réelles tout en conservant leur structure sous-jacente.