VIP 👤
🏠 Главная
Бенчмарки
📊 Все бенчмарки 🦖 Динозавр v1 🦖 Динозавр v2 ✅ Приложения To-Do List 🎨 Творческие свободные страницы 🎯 FSACB - Ультимативный показ 🌍 Бенчмарк перевода
Модели
🏆 Топ-10 моделей 🆓 Бесплатные модели 📋 Все модели ⚙️ Режимы Kilo Code
Ресурсы
💬 Библиотека промптов 📖 Глоссарий ИИ 🔗 Полезные ссылки 🔌 API и маршрутизаторы

Глоссарий ИИ

Полный словарь искусственного интеллекта

235
категории
2 988
подкатегории
33 628
термины
📖
термины

Modèle Multi-modal

Architecture d'IA capable de traiter, comprendre et générer simultanément plusieurs types de données non structurées comme le texte, les images, l'audio ou la vidéo dans un espace de représentation commun.

📖
термины

DALL-E

Système de génération d'images à partir de texte développé par OpenAI, combinant un transformateur VQ-VAE avec un modèle de diffusion pour créer des images photoréalistes à partir de descriptions textuelles.

📖
термины

Vision-Language Transformer (ViLT)

Architecture transformateur qui traite conjointement les patches d'images et les tokens textuels sans pré-extraction de caractéristiques, permettant un end-to-end learning pour les tâches vision-langage.

📖
термины

Modèle Fondation Multi-modal

Modèle pré-entraîné à grande échelle sur des données multi-modales diverses, capable d'être adapté (fine-tuné) pour une multitude de tâches downstream sans nécessiter d'entraînement from scratch.

📖
термины

Percepteur Multi-modal

Architecture unifiée qui traite différentes modalités (texte, image, audio) comme des séquences de tokens dans un seul espace latent, utilisant des cross-attentions pour modéliser leurs interactions.

📖
термины

GPT-4V(ision)

Version multi-modale de GPT-4 capable d'accepter des images et du texte en entrée, utilisant une architecture hybride pour raisonner sur le contenu visuel et générer des réponses textuelles contextualisées.

📖
термины

Audio-Visual Speech Recognition (AVSR)

Système multi-modal qui combine les signaux audio et vidéo (mouvements labiaux) pour améliorer la robustesse de la reconnaissance vocale, particulièrement dans des environnements bruyants.

📖
термины

Modèle de Langage Visuel (VLM)

Classe de modèles multi-modaux qui étendent les architectures de transformateurs de langage pour comprendre et raisonner sur le contenu visuel, souvent via des mécanismes d'attention croisée.

📖
термины

Контрастивное предобучение мультимодальное

Парадигма самоконтролируемого обучения, которая изучает выровненные представления между модальностями, максимизируя сходство положительных пар и минимизируя сходство отрицательных пар в латентном пространстве.

🔍

Результаты не найдены