VIP 👤
🏠 Accueil
基準測試
📊 Tous les Benchmarks 🦖 Dinosaure v1 🦖 Dinosaure v2 ✅ To-Do List Apps 🎨 Pages Libres 🎯 FSACB - Showcase 🌍 Traduction
Modèles
🏆 Top 10 Modèles 🆓 Modèles Gratuits 📋 Tous les Modèles ⚙️ Modes Kilo Code
Ressources
💬 Prompts IA 📖 人工智能詞彙表 🔗 Liens Utiles 🔌 AI API 同路由

AI 詞彙表

人工智能完整詞典

200
類別
2,608
子類別
30,011
術語
📖
術語

梅尔频谱图

音频信号在梅尔尺度上的时频表示,模拟人类听觉感知,常用作音频扩散模型的输入。

📖
術語

音频加噪过程

扩散模型的前向步骤,在多个时间步上迭代地向清晰音频信号添加高斯噪声,直到信号变成纯噪声。

📖
術語

音频去噪过程

生成阶段,神经网络(通常是U-Net)学习预测并减去每一步添加的噪声,从噪声中重建连贯的音频信号。

📖
術語

音频U-Net

具有跳跃连接的编码器-解码器神经网络架构,适用于处理频谱图并预测音频去噪过程中每一步的噪声。

📖
術語

音频条件控制

通过向模型提供额外信息(如乐器类别、描述文本或参考旋律)来引导音频生成的技术。

📖
術語

音频分数匹配

替代训练方法,模型学习估计加噪输入相对于音频数据对数概率分布的梯度(分数)。

📖
術語

神经声码器

将声学表示(如扩散模型生成的梅尔频谱图)转换为最终可听音频波形的神经网络。

📖
術語

潜在音频扩散

在音频的压缩潜在空间中执行扩散过程的方法,而非直接在信号或频谱图上进行,从而降低计算成本。

📖
術語

音频微调

将预训练的音频扩散模型适配到特定数据集的过程,如特定说话者的声音或音乐风格,以专门化其生成能力。

📖
術語

Stable Audio

基于潜在扩散的音频扩散模型,能够生成高保真、长时长的文本条件音频样本。

📖
術語

AudioLDM

使用预训练文本嵌入(如CLAP)来调节从文本描述生成声音、音乐或语音的音频扩散模型系列。

📖
術語

波形扩散

直接在时域原始音频波形上操作的扩散模型变体,从而避免了转换为频谱图时的信息损失。

🔍

搵唔到結果