Глоссарий ИИ
Полный словарь искусственного интеллекта
Modèle Multi-modal
Architecture d'IA capable de traiter, comprendre et générer simultanément plusieurs types de données non structurées comme le texte, les images, l'audio ou la vidéo dans un espace de représentation commun.
DALL-E
Système de génération d'images à partir de texte développé par OpenAI, combinant un transformateur VQ-VAE avec un modèle de diffusion pour créer des images photoréalistes à partir de descriptions textuelles.
Vision-Language Transformer (ViLT)
Architecture transformateur qui traite conjointement les patches d'images et les tokens textuels sans pré-extraction de caractéristiques, permettant un end-to-end learning pour les tâches vision-langage.
Modèle Fondation Multi-modal
Modèle pré-entraîné à grande échelle sur des données multi-modales diverses, capable d'être adapté (fine-tuné) pour une multitude de tâches downstream sans nécessiter d'entraînement from scratch.
Percepteur Multi-modal
Architecture unifiée qui traite différentes modalités (texte, image, audio) comme des séquences de tokens dans un seul espace latent, utilisant des cross-attentions pour modéliser leurs interactions.
GPT-4V(ision)
Version multi-modale de GPT-4 capable d'accepter des images et du texte en entrée, utilisant une architecture hybride pour raisonner sur le contenu visuel et générer des réponses textuelles contextualisées.
Audio-Visual Speech Recognition (AVSR)
Système multi-modal qui combine les signaux audio et vidéo (mouvements labiaux) pour améliorer la robustesse de la reconnaissance vocale, particulièrement dans des environnements bruyants.
Modèle de Langage Visuel (VLM)
Classe de modèles multi-modaux qui étendent les architectures de transformateurs de langage pour comprendre et raisonner sur le contenu visuel, souvent via des mécanismes d'attention croisée.
Контрастивное предобучение мультимодальное
Парадигма самоконтролируемого обучения, которая изучает выровненные представления между модальностями, максимизируя сходство положительных пар и минимизируя сходство отрицательных пар в латентном пространстве.