VIP 👤
🏠 Accueil
Benchmarks
📊 Tous les Benchmarks 🦖 Dinosaure v1 🦖 Dinosaure v2 ✅ To-Do List Apps 🎨 Pages Libres 🎯 FSACB - Showcase 🌍 Traduction
Modèles
🏆 Top 10 Modèles 🆓 Modèles Gratuits 📋 Tous les Modèles ⚙️ Modes Kilo Code
Ressources
💬 Prompts IA 📖 Glossaire IA 🔗 Liens Utiles 🔌 API & Routeurs

Glossaire IA

Le dictionnaire complet de l'Intelligence Artificielle

242
catégories
3 353
sous-catégories
40 780
termes
📖
termes

Modèle Multi-modal

Architecture d'IA capable de traiter, comprendre et générer simultanément plusieurs types de données non structurées comme le texte, les images, l'audio ou la vidéo dans un espace de représentation commun.

📖
termes

DALL-E

Système de génération d'images à partir de texte développé par OpenAI, combinant un transformateur VQ-VAE avec un modèle de diffusion pour créer des images photoréalistes à partir de descriptions textuelles.

📖
termes

Vision-Language Transformer (ViLT)

Architecture transformateur qui traite conjointement les patches d'images et les tokens textuels sans pré-extraction de caractéristiques, permettant un end-to-end learning pour les tâches vision-langage.

📖
termes

Modèle Fondation Multi-modal

Modèle pré-entraîné à grande échelle sur des données multi-modales diverses, capable d'être adapté (fine-tuné) pour une multitude de tâches downstream sans nécessiter d'entraînement from scratch.

📖
termes

Percepteur Multi-modal

Architecture unifiée qui traite différentes modalités (texte, image, audio) comme des séquences de tokens dans un seul espace latent, utilisant des cross-attentions pour modéliser leurs interactions.

📖
termes

GPT-4V(ision)

Version multi-modale de GPT-4 capable d'accepter des images et du texte en entrée, utilisant une architecture hybride pour raisonner sur le contenu visuel et générer des réponses textuelles contextualisées.

📖
termes

Audio-Visual Speech Recognition (AVSR)

Système multi-modal qui combine les signaux audio et vidéo (mouvements labiaux) pour améliorer la robustesse de la reconnaissance vocale, particulièrement dans des environnements bruyants.

📖
termes

Modèle de Langage Visuel (VLM)

Classe de modèles multi-modaux qui étendent les architectures de transformateurs de langage pour comprendre et raisonner sur le contenu visuel, souvent via des mécanismes d'attention croisée.

📖
termes

Contrastive Pre-training Multi-modal

Paradigme d'entraînement auto-supervisé qui apprend des représentations alignées entre modalités en maximisant la similarité de paires positives et minimisant celle de paires négatives dans l'espace latent.

🔍

Aucun résultat trouvé