VIP 👤
🏠 Inicio
Pruebas de rendimiento
📊 Todos los benchmarks 🦖 Dinosaurio v1 🦖 Dinosaurio v2 ✅ Aplicaciones To-Do List 🎨 Páginas libres creativas 🎯 FSACB - Showcase definitivo 🌍 Benchmark de traducción
Modelos
🏆 Top 10 modelos 🆓 Modelos gratuitos 📋 Todos los modelos ⚙️ Kilo Code
Recursos
💬 Biblioteca de prompts 📖 Glosario de IA 🔗 Enlaces útiles 🔌 API y routers

Glosario IA

El diccionario completo de la Inteligencia Artificial

231
categorías
2.999
subcategorías
35.535
términos
📖
términos

Espectrograma de Mel

Representación tiempo-frecuencia de la señal de audio en una escala de Mel, que imita la percepción auditiva humana y se utiliza comúnmente como entrada para modelos de difusión de audio.

📖
términos

Proceso de Ruido de Audio

Etapa previa del modelo de difusión donde se añade ruido gaussiano de forma iterativa a una señal de audio limpia a lo largo de múltiples pasos de tiempo, hasta que la señal se convierte en ruido puro.

📖
términos

Proceso de Eliminación de Ruido de Audio

Fase de generación donde una red neuronal, a menudo una U-Net, aprende a predecir y sustraer el ruido añadido en cada paso para reconstruir una señal de audio coherente a partir del ruido.

📖
términos

U-Net de Audio

Arquitectura de red neuronal codificador-decodificador con conexiones de salto, adaptada para procesar espectrogramas y predecir el ruido en cada paso del proceso de eliminación de ruido de audio.

📖
términos

Condicionamiento de Audio

Técnica que permite guiar la generación de audio proporcionando al modelo información adicional, como una clase de instrumento, texto descriptivo o una melodía de referencia.

📖
términos

Emparejamiento de Puntuación para Audio

Método de entrenamiento alternativo donde el modelo aprende a estimar el gradiente (la puntuación) de la distribución de probabilidad logarítmica de los datos de audio con respecto a la entrada ruidosa.

📖
términos

Vocoder Neuronal

Red neuronal que convierte una representación acústica, como un espectrograma de Mel generado por un modelo de difusión, en una forma de onda de audio final audible.

📖
términos

Difusión de Audio Latente

Enfoque donde el proceso de difusión se realiza en un espacio latente comprimido del audio, en lugar de directamente sobre la señal o el espectrograma, reduciendo los costos computacionales.

📖
términos

Ajuste Fino (Fine-tuning) de Audio

Proceso de adaptación de un modelo de difusión de audio preentrenado en un conjunto de datos específico, como las voces de un hablante particular o un estilo musical, para especializar su generación.

📖
términos

Stable Audio

Modelo de difusión de audio con difusión latente capaz de generar muestras de audio de alta fidelidad y larga duración condicionadas por texto.

📖
términos

AudioLDM

Familia de modelos de difusión de audio que utilizan embeddings de texto preentrenados (como CLAP) para condicionar la generación de sonidos, música o habla a partir de descripciones textuales.

📖
términos

Difusión sobre Forma de Onda

Variante de los modelos de difusión que opera directamente sobre la forma de onda de audio cruda en el dominio temporal, evitando así las pérdidas de información relacionadas con la transformación en espectrograma.

🔍

No se encontraron resultados