قاموس الذكاء الاصطناعي
القاموس الكامل للذكاء الاصطناعي
مخطط ميل الطيفي
تمثيل للتردد الزمني لإشارة صوتية على مقياس ميل، والذي يحاكي الإدراك البشري للسمع ويستخدم عادة كمدخل لنماذج انتشار الصوت.
عملية تشويش الصوت
خطوة سابقة لنموذج الانتشار حيث يتم إضافة ضوضاء غاوسية بشكل متكرر إلى إشارة صوتية واضحة على مدى عدة خطوات زمنية، حتى تصبح الإشارة ضوضاء نقية.
عملية إزالة تشويش الصوت
مرحلة التوليد حيث تتعلم شبكة عصبية، غالبًا U-Net، التنبؤ بالضوضاء المضافة وطرحها في كل خطوة لإعادة بناء إشارة صوتية متماسكة من الضوضاء.
شبكة U-Net الصوتية
بنية شبكة عصبية من نوع المشفر-المفكك مع اتصالات تخطّي، مُكيّفة لمعالجة المخططات الطيفية والتنبؤ بالضوضاء في كل خطوة من عملية إزالة تشويش الصوت.
تكييف الصوت
تقنية لتوجيه توليد الصوت عن طريق تزويد النموذج بمعلومات إضافية، مثل فئة آلة موسيقية، نص وصفي، أو لحن مرجعي.
مطابقة النقاط للصوت
طريقة تدريب بديلة حيث يتعلم النموذج تقدير التدرج (النقطة) لتوزيع الاحتمالية للوغاريتم بيانات الصوت بالنسبة للمدخل المشوش.
المُرمّز الصوتي العصبي (Vocoder)
شبكة عصبية تحول تمثيلاً صوتيًا، مثل مخطط ميل طيفي تم إنشاؤه بواسطة نموذج انتشار، إلى شكل موجة صوتية نهائي مسموع.
انتشار الصوت الكامن
نهج يتم فيه تنفيذ عملية الانتشار في مساحة كامنة مضغوطة للصوت، بدلاً من الإشارة أو المخطط الطيفي مباشرة، مما يقلل من التكاليف الحسابية.
الضبط الدقيق للصوت
عملية تكييف نموذج انتشار صوتي مدرب مسبقًا على مجموعة بيانات محددة، مثل أصوات متحدث معين أو نمط موسيقي، لتخصيص عملية توليده.
ستابل أوديو
نموذج انتشار صوتي كامن (latent diffusion) قادر على توليد عينات صوتية عالية الدقة وطويلة المدة مشروطة بالنص.
أوديو إل دي إم
عائلة من نماذج الانتشار الصوتي التي تستخدم تضمينات نصية مدربة مسبقًا (مثل CLAP) لشرط توليد الأصوات أو الموسيقى أو الكلام من الأوصاف النصية.
الانتشار على شكل الموجة
نسخة من نماذج الانتشار تعمل مباشرة على شكل الموجة الصوتية الخام في المجال الزمني، متجنبة بذلك فقدان المعلومات المرتبط بالتحويل إلى مخطط طيفي (spectrogramme).