Glossário IA
O dicionário completo da Inteligência Artificial
Modelo Multimodal
Arquitetura de IA capaz de processar, compreender e gerar simultaneamente vários tipos de dados não estruturados, como texto, imagens, áudio ou vídeo, num espaço de representação comum.
DALL-E
Sistema de geração de imagens a partir de texto desenvolvido pela OpenAI, combinando um transformador VQ-VAE com um modelo de difusão para criar imagens fotorrealistas a partir de descrições textuais.
Vision-Language Transformer (ViLT)
Arquitetura de transformador que processa conjuntamente patches de imagens e tokens textuais sem pré-extração de características, permitindo uma aprendizagem end-to-end para tarefas de visão-linguagem.
Modelo Fundação Multimodal
Modelo pré-treinado em larga escala em dados multimodais diversos, capaz de ser adaptado (fine-tuned) para uma infinidade de tarefas downstream sem a necessidade de treinamento do zero.
Perceptor Multimodal
Arquitetura unificada que processa diferentes modalidades (texto, imagem, áudio) como sequências de tokens num único espaço latente, utilizando cross-attentions para modelar as suas interações.
GPT-4V(ision)
Versão multimodal do GPT-4 capaz de aceitar imagens e texto como entrada, utilizando uma arquitetura híbrida para raciocinar sobre o conteúdo visual e gerar respostas textuais contextualizadas.
Reconhecimento de Fala Audiovisual (AVSR)
Sistema multimodal que combina sinais de áudio e vídeo (movimentos labiais) para melhorar a robustez do reconhecimento de fala, particularmente em ambientes ruidosos.
Modelo de Linguagem Visual (VLM)
Classe de modelos multimodais que estendem as arquiteturas de transformadores de linguagem para compreender e raciocinar sobre o conteúdo visual, frequentemente através de mecanismos de atenção cruzada.
Pré-treinamento Contrastivo Multimodal
Paradigma de treinamento auto-supervisionado que aprende representações alinhadas entre modalidades, maximizando a similaridade de pares positivos e minimizando a de pares negativos no espaço latente.