VIP 👤
🏠 Accueil
Benchmarks
📊 Tous les Benchmarks 🦖 Dinosaure v1 🦖 Dinosaure v2 ✅ To-Do List Apps 🎨 Pages Libres 🎯 FSACB - Showcase 🌍 Traduction
Modèles
🏆 Top 10 Modèles 🆓 Modèles Gratuits 📋 Tous les Modèles ⚙️ Modes Kilo Code
Ressources
💬 Prompts IA 📖 Glossaire IA 🔗 Liens Utiles 🔌 API & Routeurs

Glossaire IA

Le dictionnaire complet de l'Intelligence Artificielle

242
catégories
3 353
sous-catégories
40 780
termes
📖
termes

Spectrogramme de Mel

Représentation temps-fréquence du signal audio sur une échelle de Mel, qui imite la perception humaine de l'audition et est couramment utilisée comme entrée pour les modèles de diffusion audio.

📖
termes

Processus de Bruitage Audio

Étape avant du modèle de diffusion où du bruit gaussien est ajouté de manière itérative à un signal audio clair sur plusieurs pas de temps, jusqu'à ce que le signal devienne du bruit pur.

📖
termes

Processus de Débruitage Audio

Phase de génération où un réseau neuronal, souvent un U-Net, apprend à prédire et à soustraire le bruit ajouté à chaque étape pour reconstruire un signal audio cohérent à partir du bruit.

📖
termes

U-Net Audio

Architecture de réseau neuronal à encodeur-décodeur avec des connexions de saut, adaptée pour traiter les spectrogrammes et prédire le bruit à chaque étape du processus de débruitage audio.

📖
termes

Conditionnement Audio

Technique permettant de guider la génération audio en fournissant au modèle des informations supplémentaires, telles qu'une classe d'instrument, un texte descriptif ou une mélodie de référence.

📖
termes

Score Matching pour l'Audio

Méthode d'entraînement alternative où le modèle apprend à estimer le gradient (le score) de la distribution de probabilité du log des données audio par rapport à l'entrée bruitée.

📖
termes

Vocoder Neuronal

Réseau neuronal qui convertit une représentation acoustique, comme un spectrogramme de Mel généré par un modèle de diffusion, en une forme d'onde audio finale audible.

📖
termes

Latent Audio Diffusion

Approche où le processus de diffusion s'effectue dans un espace latent compressé de l'audio, plutôt que directement sur le signal ou le spectrogramme, réduisant les coûts computationnels.

📖
termes

Réglage Fin (Fine-tuning) Audio

Processus d'adaptation d'un modèle de diffusion audio pré-entraîné sur un jeu de données spécifique, comme les voix d'un locuteur particulier ou un style musical, pour spécialiser sa génération.

📖
termes

Stable Audio

Modèle de diffusion audio à point de diffusion latent (latent diffusion) capable de générer des échantillons audio de haute fidélité et de longue durée conditionnés par du texte.

📖
termes

AudioLDM

Famille de modèles de diffusion audio qui utilisent des embeddings de texte pré-entraînés (comme CLAP) pour conditionner la génération de sons, de musique ou de parole à partir de descriptions textuelles.

📖
termes

Diffusion sur Forme d'Onde

Variante des modèles de diffusion qui opère directement sur la forme d'onde audio brute dans le domaine temporel, évitant ainsi les pertes d'information liées à la transformation en spectrogramme.

🔍

Aucun résultat trouvé