قاموس الذكاء الاصطناعي
القاموس الكامل للذكاء الاصطناعي
نموذج متعدد الوسائط
بنية ذكاء اصطناعي قادرة على معالجة وفهم وتوليد أنواع متعددة من البيانات غير المهيكلة مثل النصوص والصور والصوت والفيديو في وقت واحد ضمن مساحة تمثيل مشتركة.
دال-إي
نظام لتوليد الصور من النصوص طورته OpenAI، يجمع بين محول VQ-VAE ونموذج انتشار لإنشاء صور واقعية من الأوصاف النصية.
محول الرؤية واللغة (ViLT)
بنية محول تعالج رقع الصور والرموز النصية بشكل مشترك دون استخلاص مسبق للميزات، مما يتيح التعلم الشامل للمهام المتعلقة بالرؤية واللغة.
نموذج أساسي متعدد الوسائط
نموذج مدرب مسبقًا على نطاق واسع على بيانات متعددة الوسائط ومتنوعة، قادر على التكيف (الضبط الدقيق) لمجموعة كبيرة من المهام اللاحقة دون الحاجة إلى تدريب من الصفر.
مدرك متعدد الوسائط
بنية موحدة تعالج الوسائط المختلفة (النص، الصورة، الصوت) كسلاسل من الرموز في مساحة كامنة واحدة، باستخدام آليات الانتباه المتقاطع لنمذجة تفاعلاتها.
جي بي تي-4 في (الرؤية)
نسخة متعددة الوسائط من GPT-4 قادرة على قبول الصور والنصوص كمدخلات، باستخدام بنية هجينة للاستدلال على المحتوى البصري وتوليد استجابات نصية سياقية.
التعرف على الكلام السمعي البصري (AVSR)
نظام متعدد الوسائط يجمع بين الإشارات الصوتية والمرئية (حركات الشفاه) لتحسين متانة التعرف على الكلام، خاصة في البيئات الصاخبة.
نموذج اللغة البصرية (VLM)
فئة من النماذج متعددة الوسائط التي توسع بنيات محولات اللغة لفهم المحتوى البصري والاستدلال عليه، غالبًا عبر آليات الانتباه المتقاطع.
التدريب المسبق التبايني متعدد الوسائط
نموذج تدريب ذاتي الإشراف يتعلم تمثيلات متوافقة بين الوسائط عن طريق تعظيم تشابه الأزواج الإيجابية وتقليل تشابه الأزواج السلبية في الفضاء الكامن.