Glosario IA
El diccionario completo de la Inteligencia Artificial
Modelo Multi-modal
Arquitectura de IA capaz de procesar, comprender y generar simultáneamente múltiples tipos de datos no estructurados como texto, imágenes, audio o video en un espacio de representación común.
DALL-E
Sistema de generación de imágenes a partir de texto desarrollado por OpenAI, combinando un transformador VQ-VAE con un modelo de difusión para crear imágenes fotorrealistas a partir de descripciones textuales.
Vision-Language Transformer (ViLT)
Arquitectura transformadora que procesa conjuntamente los parches de imágenes y los tokens textuales sin pre-extracción de características, permitiendo un aprendizaje end-to-end para las tareas visión-lenguaje.
Modelo Fundación Multi-modal
Modelo pre-entrenado a gran escala en datos multi-modales diversos, capaz de ser adaptado (fine-tuned) para una multitud de tareas posteriores sin necesidad de entrenamiento desde cero.
Perceptor Multi-modal
Arquitectura unificada que procesa diferentes modalidades (texto, imagen, audio) como secuencias de tokens en un único espacio latente, utilizando cross-attentions para modelar sus interacciones.
GPT-4V(isión)
Versión multi-modal de GPT-4 capaz de aceptar imágenes y texto como entrada, utilizando una arquitectura híbrida para razonar sobre el contenido visual y generar respuestas textuales contextualizadas.
Audio-Visual Speech Recognition (AVSR)
Sistema multi-modal que combina señales de audio y video (movimientos labiales) para mejorar la robustez del reconocimiento de voz, particularmente en entornos ruidosos.
Modelo de Lenguaje Visual (VLM)
Clase de modelos multi-modales que extienden las arquitecturas de transformadores de lenguaje para comprender y razonar sobre el contenido visual, frecuentemente mediante mecanismos de atención cruzada.
Pre-entrenamiento Contrastivo Multimodal
Paradigma de entrenamiento auto-supervisado que aprende representaciones alineadas entre modalidades maximizando la similitud de pares positivos y minimizando la de pares negativos en el espacio latente.