Диффузионные модели для аудио
AudioLDM
Семейство моделей аудиодиффузии, которые используют предварительно обученные текстовые эмбеддинги (например, CLAP) для обусловленной генерации звуков, музыки или речи из текстовых описаний.
← Назад