Glosario IA
El diccionario completo de la Inteligencia Artificial
Espectrograma de Mel
Representación tiempo-frecuencia de la señal de audio en una escala de Mel, que imita la percepción auditiva humana y se utiliza comúnmente como entrada para modelos de difusión de audio.
Proceso de Ruido de Audio
Etapa previa del modelo de difusión donde se añade ruido gaussiano de forma iterativa a una señal de audio limpia a lo largo de múltiples pasos de tiempo, hasta que la señal se convierte en ruido puro.
Proceso de Eliminación de Ruido de Audio
Fase de generación donde una red neuronal, a menudo una U-Net, aprende a predecir y sustraer el ruido añadido en cada paso para reconstruir una señal de audio coherente a partir del ruido.
U-Net de Audio
Arquitectura de red neuronal codificador-decodificador con conexiones de salto, adaptada para procesar espectrogramas y predecir el ruido en cada paso del proceso de eliminación de ruido de audio.
Condicionamiento de Audio
Técnica que permite guiar la generación de audio proporcionando al modelo información adicional, como una clase de instrumento, texto descriptivo o una melodía de referencia.
Emparejamiento de Puntuación para Audio
Método de entrenamiento alternativo donde el modelo aprende a estimar el gradiente (la puntuación) de la distribución de probabilidad logarítmica de los datos de audio con respecto a la entrada ruidosa.
Vocoder Neuronal
Red neuronal que convierte una representación acústica, como un espectrograma de Mel generado por un modelo de difusión, en una forma de onda de audio final audible.
Difusión de Audio Latente
Enfoque donde el proceso de difusión se realiza en un espacio latente comprimido del audio, en lugar de directamente sobre la señal o el espectrograma, reduciendo los costos computacionales.
Ajuste Fino (Fine-tuning) de Audio
Proceso de adaptación de un modelo de difusión de audio preentrenado en un conjunto de datos específico, como las voces de un hablante particular o un estilo musical, para especializar su generación.
Stable Audio
Modelo de difusión de audio con difusión latente capaz de generar muestras de audio de alta fidelidad y larga duración condicionadas por texto.
AudioLDM
Familia de modelos de difusión de audio que utilizan embeddings de texto preentrenados (como CLAP) para condicionar la generación de sonidos, música o habla a partir de descripciones textuales.
Difusión sobre Forma de Onda
Variante de los modelos de difusión que opera directamente sobre la forma de onda de audio cruda en el dominio temporal, evitando así las pérdidas de información relacionadas con la transformación en espectrograma.