VIP 👤
🏠 Inicio
Pruebas de rendimiento
📊 Todos los benchmarks 🦖 Dinosaurio v1 🦖 Dinosaurio v2 ✅ Aplicaciones To-Do List 🎨 Páginas libres creativas 🎯 FSACB - Showcase definitivo 🌍 Benchmark de traducción
Modelos
🏆 Top 10 modelos 🆓 Modelos gratuitos 📋 Todos los modelos ⚙️ Kilo Code
Recursos
💬 Biblioteca de prompts 📖 Glosario de IA 🔗 Enlaces útiles 🔌 API y routers

Glosario IA

El diccionario completo de la Inteligencia Artificial

231
categorías
2.999
subcategorías
35.535
términos
📖
términos

Modelo Multi-modal

Arquitectura de IA capaz de procesar, comprender y generar simultáneamente múltiples tipos de datos no estructurados como texto, imágenes, audio o video en un espacio de representación común.

📖
términos

DALL-E

Sistema de generación de imágenes a partir de texto desarrollado por OpenAI, combinando un transformador VQ-VAE con un modelo de difusión para crear imágenes fotorrealistas a partir de descripciones textuales.

📖
términos

Vision-Language Transformer (ViLT)

Arquitectura transformadora que procesa conjuntamente los parches de imágenes y los tokens textuales sin pre-extracción de características, permitiendo un aprendizaje end-to-end para las tareas visión-lenguaje.

📖
términos

Modelo Fundación Multi-modal

Modelo pre-entrenado a gran escala en datos multi-modales diversos, capaz de ser adaptado (fine-tuned) para una multitud de tareas posteriores sin necesidad de entrenamiento desde cero.

📖
términos

Perceptor Multi-modal

Arquitectura unificada que procesa diferentes modalidades (texto, imagen, audio) como secuencias de tokens en un único espacio latente, utilizando cross-attentions para modelar sus interacciones.

📖
términos

GPT-4V(isión)

Versión multi-modal de GPT-4 capaz de aceptar imágenes y texto como entrada, utilizando una arquitectura híbrida para razonar sobre el contenido visual y generar respuestas textuales contextualizadas.

📖
términos

Audio-Visual Speech Recognition (AVSR)

Sistema multi-modal que combina señales de audio y video (movimientos labiales) para mejorar la robustez del reconocimiento de voz, particularmente en entornos ruidosos.

📖
términos

Modelo de Lenguaje Visual (VLM)

Clase de modelos multi-modales que extienden las arquitecturas de transformadores de lenguaje para comprender y razonar sobre el contenido visual, frecuentemente mediante mecanismos de atención cruzada.

📖
términos

Pre-entrenamiento Contrastivo Multimodal

Paradigma de entrenamiento auto-supervisado que aprende representaciones alineadas entre modalidades maximizando la similitud de pares positivos y minimizando la de pares negativos en el espacio latente.

🔍

No se encontraron resultados