Глоссарий ИИ
Полный словарь искусственного интеллекта
Спектрограмма Мела
Временно-частотное представление аудиосигнала по шкале Мела, которое имитирует человеческое восприятие слуха и часто используется в качестве входных данных для моделей диффузии аудио.
Процесс зашумления аудио
Предварительный этап модели диффузии, где к чистому аудиосигналу итеративно добавляется гауссовский шум на нескольких временных шагах, пока сигнал не превратится в чистый шум.
Процесс удаления шума из аудио
Этап генерации, при котором нейронная сеть, часто U-Net, учится предсказывать и вычитать добавленный шум на каждом шаге для восстановления последовательного аудиосигнала из шума.
U-Net для аудио
Архитектура нейронной сети типа кодер-декодер с соединениями пропуска, адаптированная для обработки спектрограмм и предсказания шума на каждом этапе процесса удаления шума из аудио.
Аудио-обусловливание
Техника для управления генерацией аудио путем предоставления модели дополнительной информации, такой как класс инструмента, описательный текст или опорная мелодия.
Сопоставление оценок для аудио
Альтернативный метод обучения, при котором модель учится оценивать градиент (оценку) распределения вероятности логарифма аудиоданных относительно зашумленного входа.
Нейронный вокодер
Нейронная сеть, которая преобразует акустическое представление, такое как спектрограмма Мела, сгенерированная моделью диффузии, в слышимую аудиоформу волны.
Латентная диффузия аудио
Подход, при котором процесс диффузии происходит в сжатом латентном пространстве аудио, а не непосредственно на сигнале или спектрограмме, что снижает вычислительные затраты.
Настройка (Fine-tuning) Аудио
Процесс адаптации предварительно обученной аудиодиффузионной модели к определённому набору данных, например к голосу конкретного диктора или музыкальному стилю, для специализации её генерации.
Stable Audio
Модель аудиодиффузии с латентной диффузией (latent diffusion), способная генерировать высококачественные и длинные аудиосэмплы, обусловленные текстом.
AudioLDM
Семейство моделей аудиодиффузии, которые используют предварительно обученные текстовые эмбеддинги (например, CLAP) для обусловленной генерации звуков, музыки или речи из текстовых описаний.
Диффузия по Форме Волны
Вариант моделей диффузии, который работает непосредственно с необработанной звуковой волной во временной области, тем самым избегая потерь информации, связанных с преобразованием в спектрограмму.