VIP 👤
🏠 首页
基准测试
📊 所有基准测试 🦖 恐龙 v1 🦖 恐龙 v2 ✅ 待办事项应用 🎨 创意自由页面 🎯 FSACB - 终极展示 🌍 翻译基准测试
模型
🏆 前 10 名模型 🆓 免费模型 📋 所有模型 ⚙️ 🛠️ 千行代码模式
资源
💬 💬 提示库 📖 📖 AI 词汇表 🔗 🔗 有用链接 🔌 AI API 与路由器

AI 词汇表

人工智能完整词典

200
个类别
2,608
个子类别
30,011
个术语
📖
个术语

梅尔频谱图

音频信号在梅尔尺度上的时频表示,模拟人类听觉感知,常用作音频扩散模型的输入。

📖
个术语

音频加噪过程

扩散模型的前向步骤,在多个时间步上迭代地向清晰音频信号添加高斯噪声,直到信号变成纯噪声。

📖
个术语

音频去噪过程

生成阶段,神经网络(通常是U-Net)学习预测并减去每一步添加的噪声,从噪声中重建连贯的音频信号。

📖
个术语

音频U-Net

具有跳跃连接的编码器-解码器神经网络架构,适用于处理频谱图并预测音频去噪过程中每一步的噪声。

📖
个术语

音频条件控制

通过向模型提供额外信息(如乐器类别、描述文本或参考旋律)来引导音频生成的技术。

📖
个术语

音频分数匹配

替代训练方法,模型学习估计加噪输入相对于音频数据对数概率分布的梯度(分数)。

📖
个术语

神经声码器

将声学表示(如扩散模型生成的梅尔频谱图)转换为最终可听音频波形的神经网络。

📖
个术语

潜在音频扩散

在音频的压缩潜在空间中执行扩散过程的方法,而非直接在信号或频谱图上进行,从而降低计算成本。

📖
个术语

音频微调

将预训练的音频扩散模型适配到特定数据集的过程,如特定说话者的声音或音乐风格,以专门化其生成能力。

📖
个术语

Stable Audio

基于潜在扩散的音频扩散模型,能够生成高保真、长时长的文本条件音频样本。

📖
个术语

AudioLDM

使用预训练文本嵌入(如CLAP)来调节从文本描述生成声音、音乐或语音的音频扩散模型系列。

📖
个术语

波形扩散

直接在时域原始音频波形上操作的扩散模型变体,从而避免了转换为频谱图时的信息损失。

🔍

未找到结果