Glossário IA
O dicionário completo da Inteligência Artificial
Espectrograma de Mel
Representação tempo-frequência do sinal de áudio em uma escala Mel, que imita a percepção auditiva humana e é comumente usada como entrada para modelos de difusão de áudio.
Processo de Ruído de Áudio
Etapa inicial do modelo de difusão onde ruído gaussiano é adicionado iterativamente a um sinal de áudio limpo ao longo de vários passos de tempo, até que o sinal se torne ruído puro.
Processo de Desruído de Áudio
Fase de geração onde uma rede neural, frequentemente uma U-Net, aprende a prever e subtrair o ruído adicionado em cada etapa para reconstruir um sinal de áudio coerente a partir do ruído.
U-Net de Áudio
Arquitetura de rede neural codificador-decodificador com conexões de salto, adaptada para processar espectrogramas e prever o ruído em cada etapa do processo de desruído de áudio.
Condicionamento de Áudio
Técnica que permite guiar a geração de áudio fornecendo ao modelo informações adicionais, como uma classe de instrumento, um texto descritivo ou uma melodia de referência.
Score Matching para Áudio
Método de treinamento alternativo onde o modelo aprende a estimar o gradiente (o score) da distribuição de probabilidade do log dos dados de áudio em relação à entrada ruidosa.
Vocoder Neural
Rede neural que converte uma representação acústica, como um espectrograma de Mel gerado por um modelo de difusão, em uma forma de onda de áudio final audível.
Difusão de Áudio Latente
Abordagem onde o processo de difusão ocorre em um espaço latente comprimido do áudio, em vez de diretamente no sinal ou espectrograma, reduzindo os custos computacionais.
Ajuste Fino (Fine-tuning) de Áudio
Processo de adaptação de um modelo de difusão de áudio pré-treinado a um conjunto de dados específico, como as vozes de um locutor particular ou um estilo musical, para especializar a sua geração.
Stable Audio
Modelo de difusão de áudio de ponto de difusão latente (latent diffusion) capaz de gerar amostras de áudio de alta fidelidade e longa duração condicionadas por texto.
AudioLDM
Família de modelos de difusão de áudio que utilizam embeddings de texto pré-treinados (como CLAP) para condicionar a geração de sons, música ou fala a partir de descrições textuais.
Difusão em Forma de Onda
Variante dos modelos de difusão que opera diretamente na forma de onda de áudio bruta no domínio do tempo, evitando assim as perdas de informação relacionadas com a transformação em espectrograma.