एआई शब्दावली
आर्टिफिशियल इंटेलिजेंस का पूर्ण शब्दकोश
Processus Forward
Phase d'entraînement où du bruit gaussien est ajouté de manière itérative à une image d'origine sur plusieurs pas de temps, jusqu'à ce que l'image devienne un bruit pur, servant de base à l'apprentissage du modèle.
Processus Reverse (ou de Dénombrement)
Phase de génération où le modèle apprend à inverser le processus forward en retirant le bruit étape par étape, reconstruisant ainsi une image claire à partir d'une distribution de bruit aléatoire.
Schedule de Diffusion
Stratégie définissant la variance du bruit ajouté à chaque pas de temps du processus forward, influençant la qualité et la vitesse de la génération lors du processus reverse.
Rééchantillonnage par Saut (Latent Resampling)
Méthode d'inférence accélérée qui saute certains pas de temps du processus de débruitage, en utilisant des techniques d'interpolation ou de rééchantillonnage pour réduire le nombre total d'étapes de génération.
Conditionnement (Text-to-Image)
Intégration d'une information externe, comme une description textuelle, dans le processus de débruitage pour guider la génération de l'image vers un contenu spécifique, souvent via des mécanismes d'attention croisée.
Espace Latent (Latent Diffusion)
Approche où le processus de diffusion ne s'applique pas directement aux pixels de l'image, mais à une représentation compressée de celle-ci dans un espace latent de plus faible dimension, réduisant ainsi les coûts computationnels.
Guidage par Classifier (Classifier Guidance)
Technique qui utilise un classificateur pré-entraîné pour estimer le gradient d'une classe cible (ex: 'chat'), et l'ajoute au gradient du modèle de diffusion pour orienter la génération vers cette classe.
Guidage Sans Classifier (Classifier-Free Guidance)
Méthode de conditionnement plus flexible qui n'a pas besoin d'un classificateur externe, en utilisant un modèle unique entraîné à la fois sur des données conditionnées et non conditionnées pour calculer un gradient de guidage.
Plongement de Texte (Text Embedding)
Représentation vectorielle d'un texte, générée par un modèle de type Transformer (ex: CLIP), qui est utilisée pour conditionner le modèle de diffusion et traduire la sémantique du texte en signaux visuels.
Negative Prompting
Technique consistant à fournir au modèle une liste de concepts ou d'objets à éviter lors de la génération, en modifiant le processus de guidage pour minimiser la probabilité d'apparition de ces éléments indésirables.
Image-to-Image (Img2Img)
Application des modèles de diffusion où le processus de génération est initialisé non pas avec du bruit pur, mais avec une image existante, permettant de la transformer ou de la styliser tout en préservant sa structure de base.