এআই গ্লসারি
কৃত্রিম বুদ্ধিমত্তার সম্পূর্ণ অভিধান
মাল্টি-মোডাল মডেল
একটি AI আর্কিটেকচার যা টেক্সট, ইমেজ, অডিও বা ভিডিওর মতো একাধিক আনস্ট্রাকচার্ড ডেটা টাইপকে একটি সাধারণ রিপ্রেজেন্টেশন স্পেসে একইসাথে প্রসেস, বুঝতে এবং জেনারেট করতে সক্ষম।
DALL-E
OpenAI দ্বারা ডেভেলপ করা টেক্সট থেকে ইমেজ জেনারেশন সিস্টেম, যা টেক্সচুয়াল ডেসক্রিপশন থেকে ফটোরিয়ালিস্টিক ইমেজ তৈরি করতে একটি VQ-VAE ট্রান্সফরমারকে ডিফিউশন মডেলের সাথে কম্বাইন করে।
ভিশন-ল্যাঙ্গুয়েজ ট্রান্সফরমার (ViLT)
একটি ট্রান্সফরমার আর্কিটেকচার যা ফিচার এক্সট্রাকশন ছাড়াই ইমেজ প্যাচ এবং টেক্সট টোকেনকে যৌথভাবে প্রসেস করে, ভিশন-ল্যাঙ্গুয়েজ টাস্কের জন্য এন্ড-টু-এন্ড লার্নিং সম্ভব করে।
মাল্টি-মোডাল ফাউন্ডেশন মডেল
বিভিন্ন মাল্টি-মোডাল ডেটার উপর লার্জ-স্কেলে প্রি-ট্রেইন করা মডেল, যা স্ক্র্যাচ থেকে ট্রেনিং ছাড়াই একাধিক ডাউনস্ট্রিম টাস্কের জন্য ফাইন-টিউন করা সক্ষম।
মাল্টি-মোডাল পারসেপটর
একটি ইউনিফাইড আর্কিটেকচার যা বিভিন্ন মোডালিটি (টেক্সট, ইমেজ, অডিও) কে একটি সিঙ্গেল লেটেন্ট স্পেসে টোকেন সিকোয়েন্স হিসেবে ট্রিট করে, তাদের ইন্টারঅ্যাকশন মডেল করতে ক্রস-অ্যাটেনশন ব্যবহার করে।
GPT-4V(ision)
GPT-4-এর মাল্টি-মোডাল ভার্সন যা ইনপুট হিসেবে ইমেজ এবং টেক্সট গ্রহণ করতে সক্ষম, ভিজ্যুয়াল কন্টেন্টে রিজনিং এবং কন্টেক্সচুয়ালাইজড টেক্সট রেসপন্স জেনারেট করতে হাইব্রিড আর্কিটেকচার ব্যবহার করে।
অডিও-ভিজ্যুয়াল স্পিচ রিকগনিশন (AVSR)
একটি মাল্টি-মোডাল সিস্টেম যা স্পিচ রিকগনিশনের রোবাস্টনেস ইমপ্রুভ করতে অডিও এবং ভিডিও সিগন্যাল (লিপ মুভমেন্ট) কম্বাইন করে, বিশেষ করে নয়েজি এনভায়রনমেন্টে।
ভিজ্যুয়াল ল্যাঙ্গুয়েজ মডেল (VLM)
মাল্টি-মোডাল মডেলের একটি ক্লাস যা ল্যাঙ্গুয়েজ ট্রান্সফরমার আর্কিটেকচারকে এক্সটেন্ড করে ভিজ্যুয়াল কন্টেন্ট বুঝতে এবং রিজন করতে, প্রায়শই ক্রস-অ্যাটেনশন মেকানিজমের মাধ্যমে।
কনট্রাস্টিভ প্রি-ট্রেনিং মাল্টি-মোডাল
স্ব-তত্ত্বাবধানাধীন প্রশিক্ষণের প্যারাডাইম যা লেটেন্ট স্পেসে পজিটিভ জোড়ার সাদৃশ্য সর্বাধিকীকরণ এবং নেগেটিভ জোড়ার সাদৃশ্য ন্যূনতমকরণের মাধ্যমে মডালিটিগুলির মধ্যে সারিবদ্ধ উপস্থাপনা শেখে।