AI 词汇表
人工智能完整词典
200
个类别
2,608
个子类别
30,011
个术语
个术语
梅尔频谱图
音频信号在梅尔尺度上的时频表示,模拟人类听觉感知,常用作音频扩散模型的输入。
个术语
音频加噪过程
扩散模型的前向步骤,在多个时间步上迭代地向清晰音频信号添加高斯噪声,直到信号变成纯噪声。
个术语
音频去噪过程
生成阶段,神经网络(通常是U-Net)学习预测并减去每一步添加的噪声,从噪声中重建连贯的音频信号。
个术语
音频U-Net
具有跳跃连接的编码器-解码器神经网络架构,适用于处理频谱图并预测音频去噪过程中每一步的噪声。
个术语
音频条件控制
通过向模型提供额外信息(如乐器类别、描述文本或参考旋律)来引导音频生成的技术。
个术语
音频分数匹配
替代训练方法,模型学习估计加噪输入相对于音频数据对数概率分布的梯度(分数)。
个术语
神经声码器
将声学表示(如扩散模型生成的梅尔频谱图)转换为最终可听音频波形的神经网络。
个术语
潜在音频扩散
在音频的压缩潜在空间中执行扩散过程的方法,而非直接在信号或频谱图上进行,从而降低计算成本。
个术语
音频微调
将预训练的音频扩散模型适配到特定数据集的过程,如特定说话者的声音或音乐风格,以专门化其生成能力。
个术语
Stable Audio
基于潜在扩散的音频扩散模型,能够生成高保真、长时长的文本条件音频样本。
个术语
AudioLDM
使用预训练文本嵌入(如CLAP)来调节从文本描述生成声音、音乐或语音的音频扩散模型系列。
个术语
波形扩散
直接在时域原始音频波形上操作的扩散模型变体,从而避免了转换为频谱图时的信息损失。
🔍