AI用語集
人工知能の完全辞典
メルスペクトログラム
メル尺度上のオーディオ信号の時周波数表現で、人間の聴覚知覚を模倣し、オーディオ拡散モデルの入力として一般的に使用されます。
オーディオノイズ付加プロセス
クリアなオーディオ信号に複数のタイムステップで反復的にガウスノイズを追加し、信号が純粋なノイズになるまで続ける拡散モデルの前処理ステップ。
オーディオデノイジングプロセス
ノイズから一貫したオーディオ信号を再構築するために、ニューラルネットワーク(通常U-Net)が各ステップで追加されたノイズを予測し減算することを学習する生成フェーズ。
オーディオU-Net
スペクトログラムを処理し、オーディオデノイジングプロセスの各ステップでノイズを予測するように適応された、ジャンプ接続を持つエンコーダ-デコーダニューラルネットワークアーキテクチャ。
オーディオコンディショニング
楽器クラス、記述テキスト、参照メロディなどの追加情報をモデルに提供してオーディオ生成を導く技術。
オーディオのスコアマッチング
モデルがノイズの入力に対するオーディオデータの対数確率分布の勾配(スコア)を推定することを学習する代替のトレーニング手法。
ニューラルボコーダ
拡散モデルによって生成されたメルスペクトログラムなどの音響表現を、最終的に聞くことができるオーディオ波形に変換するニューラルネットワーク。
潜在オーディオ拡散
信号やスペクトログラム上で直接行うのではなく、オーディオの圧縮された潜在空間で拡散プロセスを実行し、計算コストを削減するアプローチ。
オーディオ微調整
事前学習済みのオーディオ拡散モデルを特定のデータセット(例:特定の話者の声や音楽スタイル)に適応させ、その生成を特化させるプロセス。
Stable Audio
テキストによって条件付けされた、忠実度が高く長期間のオーディオサンプルを生成できる潜在的拡散(latent diffusion)オーディオモデル。
AudioLDM
事前学習済みテキスト埋め込み(CLAPなど)を使用して、テキスト記述から音、音楽、または音声の生成を条件付ける、オーディオ拡散モデルのファミリー。
波形拡散
スペクトログラムへの変換に関連する情報の損失を回避するために、時間領域で直接生のオーディオ波形上で動作する拡散モデルの変種。