এআই গ্লসারি
কৃত্রিম বুদ্ধিমত্তার সম্পূর্ণ অভিধান
মেল স্পেকট্রোগ্রাম
মেল স্কেলে অডিও সিগন্যালের সময়-ফ্রিকোয়েন্সি উপস্থাপনা, যা মানুষের শ্রবণ উপলব্ধির অনুকরণ করে এবং অডিও ডিফিউশন মডেলের ইনপুট হিসেবে সাধারণত ব্যবহৃত হয়।
অডিও নয়েজিং প্রক্রিয়া
ডিফিউশন মডেলের ফরওয়ার্ড ধাপ যেখানে গাউসিয়ান নয়েজকে একটি ক্লিয়ার অডিও সিগন্যালে একাধিক টাইম স্টেপে পুনরাবৃত্তিমূলকভাবে যোগ করা হয়, যতক্ষণ না সিগন্যাল সম্পূর্ণ নয়েজে পরিণত হয়।
অডিও ডিনয়েজিং প্রক্রিয়া
জেনারেশন ফেজ যেখানে একটি নিউরাল নেটওয়ার্ক, প্রায়শই একটি U-Net, প্রতিটি ধাপে যোগ করা নয়েজ পূর্বাভাস এবং বিয়োগ করতে শেখে যাতে নয়েজ থেকে একটি সুসংগত অডিও সিগন্যাল পুনর্গঠন করা যায়।
অডিও U-Net
এনকোডার-ডিকোডার আর্কিটেকচার সহ স্কিপ কানেকশনযুক্ত নিউরাল নেটওয়ার্ক আর্কিটেকচার, যা স্পেকট্রোগ্রাম প্রসেসিং এবং অডিও ডিনয়েজিং প্রক্রিয়ার প্রতিটি ধাপে নয়েজ পূর্বাভাসের জন্য উপযুক্ত।
অডিও কন্ডিশনিং
মডেলকে অতিরিক্ত তথ্য প্রদানের মাধ্যমে অডিও জেনারেশন গাইড করার কৌশল, যেমন একটি ইন্সট্রুমেন্ট ক্লাস, বর্ণনামূলক টেক্সট বা রেফারেন্স মেলডি।
অডিওর জন্য স্কোর ম্যাচিং
বিকল্প ট্রেনিং পদ্ধতি যেখানে মডেল নয়েজড ইনপুটের সাপেক্ষে অডিও ডেটার লগ প্রোবাবিলিটি ডিস্ট্রিবিউশনের গ্রেডিয়েন্ট (স্কোর) অনুমান করতে শেখে।
নিউরাল ভোকোডার
নিউরাল নেটওয়ার্ক যা একটি অ্যাকোস্টিক উপস্থাপনা, যেমন ডিফিউশন মডেল দ্বারা জেনারেটেড মেল স্পেকট্রোগ্রাম, চূড়ান্ত শ্রবণযোগ্য অডিও ওয়েফর্মে রূপান্তর করে।
লেটেন্ট অডিও ডিফিউশন
একটি পদ্ধতি যেখানে ডিফিউশন প্রক্রিয়া সরাসরি সিগন্যাল বা স্পেকট্রোগ্রামে নয় বরং অডিওর একটি কম্প্রেসড লেটেন্ট স্পেসে সম্পাদিত হয়, যা কম্পিউটেশনাল খরচ হ্রাস করে।
ফাইন-টিউনিং অডিও
একটি পূর্ব-প্রশিক্ষিত অডিও ডিফিউশন মডেলকে একটি নির্দিষ্ট ডেটাসেটে অভিযোজনের প্রক্রিয়া, যেমন একটি নির্দিষ্ট বক্তার কণ্ঠস্বর বা একটি সঙ্গীত শৈলী, এর জেনারেশনকে বিশেষায়িত করার জন্য।
স্টেবল অডিও
লেটেন্ট ডিফিউশন ভিত্তিক একটি অডিও ডিফিউশন মডেল যা টেক্সট দ্বারা কন্ডিশন্ড উচ্চ-ফাইডেলিটি এবং দীর্ঘ সময়ের অডিও নমুনা তৈরি করতে সক্ষম।
অডিওএলডিএম
অডিও ডিফিউশন মডেলের একটি পরিবার যা টেক্সট ডেস্ক্রিপশন থেকে শব্দ, সঙ্গীত বা বক্তৃতা জেনারেশন কন্ডিশন করার জন্য পূর্ব-প্রশিক্ষিত টেক্সট এমবেডিং (যেমন CLAP) ব্যবহার করে।
ওয়েভফর্ম ডিফিউশন
ডিফিউশন মডেলের একটি বৈকল্পিক যা সরাসরি টাইম ডোমেনে কাঁচা অডিও ওয়েভফর্মে কাজ করে, এইভাবে স্পেক্ট্রোগ্রাম রূপান্তরের সাথে সম্পর্কিত তথ্য হ্রাস এড়ায়।