Glossaire IA
Le dictionnaire complet de l'Intelligence Artificielle
Spectrogramme de Mel
Représentation temps-fréquence du signal audio sur une échelle de Mel, qui imite la perception humaine de l'audition et est couramment utilisée comme entrée pour les modèles de diffusion audio.
Processus de Bruitage Audio
Étape avant du modèle de diffusion où du bruit gaussien est ajouté de manière itérative à un signal audio clair sur plusieurs pas de temps, jusqu'à ce que le signal devienne du bruit pur.
Processus de Débruitage Audio
Phase de génération où un réseau neuronal, souvent un U-Net, apprend à prédire et à soustraire le bruit ajouté à chaque étape pour reconstruire un signal audio cohérent à partir du bruit.
U-Net Audio
Architecture de réseau neuronal à encodeur-décodeur avec des connexions de saut, adaptée pour traiter les spectrogrammes et prédire le bruit à chaque étape du processus de débruitage audio.
Conditionnement Audio
Technique permettant de guider la génération audio en fournissant au modèle des informations supplémentaires, telles qu'une classe d'instrument, un texte descriptif ou une mélodie de référence.
Score Matching pour l'Audio
Méthode d'entraînement alternative où le modèle apprend à estimer le gradient (le score) de la distribution de probabilité du log des données audio par rapport à l'entrée bruitée.
Vocoder Neuronal
Réseau neuronal qui convertit une représentation acoustique, comme un spectrogramme de Mel généré par un modèle de diffusion, en une forme d'onde audio finale audible.
Latent Audio Diffusion
Approche où le processus de diffusion s'effectue dans un espace latent compressé de l'audio, plutôt que directement sur le signal ou le spectrogramme, réduisant les coûts computationnels.
Réglage Fin (Fine-tuning) Audio
Processus d'adaptation d'un modèle de diffusion audio pré-entraîné sur un jeu de données spécifique, comme les voix d'un locuteur particulier ou un style musical, pour spécialiser sa génération.
Stable Audio
Modèle de diffusion audio à point de diffusion latent (latent diffusion) capable de générer des échantillons audio de haute fidélité et de longue durée conditionnés par du texte.
AudioLDM
Famille de modèles de diffusion audio qui utilisent des embeddings de texte pré-entraînés (comme CLAP) pour conditionner la génération de sons, de musique ou de parole à partir de descriptions textuelles.
Diffusion sur Forme d'Onde
Variante des modèles de diffusion qui opère directement sur la forme d'onde audio brute dans le domaine temporel, évitant ainsi les pertes d'information liées à la transformation en spectrogramme.