VIP 👤
🏠 Início
Avaliações
📊 Todos os Benchmarks 🦖 Dinossauro v1 🦖 Dinossauro v2 ✅ Aplicações To-Do List 🎨 Páginas Livres Criativas 🎯 FSACB - Showcase Definitivo 🌍 Benchmark de Tradução
Modelos
🏆 Top 10 Modelos 🆓 Modelos Gratuitos 📋 Todos os Modelos ⚙️ Kilo Code
Recursos
💬 Biblioteca de Prompts 📖 Glossário de IA 🔗 Links Úteis 🔌 APIs e roteadores

Glossário IA

O dicionário completo da Inteligência Artificial

242
categorias
3.306
subcategorias
39.932
termos
📖
termos

Modelo Multimodal

Arquitetura de IA capaz de processar, compreender e gerar simultaneamente vários tipos de dados não estruturados, como texto, imagens, áudio ou vídeo, num espaço de representação comum.

📖
termos

DALL-E

Sistema de geração de imagens a partir de texto desenvolvido pela OpenAI, combinando um transformador VQ-VAE com um modelo de difusão para criar imagens fotorrealistas a partir de descrições textuais.

📖
termos

Vision-Language Transformer (ViLT)

Arquitetura de transformador que processa conjuntamente patches de imagens e tokens textuais sem pré-extração de características, permitindo uma aprendizagem end-to-end para tarefas de visão-linguagem.

📖
termos

Modelo Fundação Multimodal

Modelo pré-treinado em larga escala em dados multimodais diversos, capaz de ser adaptado (fine-tuned) para uma infinidade de tarefas downstream sem a necessidade de treinamento do zero.

📖
termos

Perceptor Multimodal

Arquitetura unificada que processa diferentes modalidades (texto, imagem, áudio) como sequências de tokens num único espaço latente, utilizando cross-attentions para modelar as suas interações.

📖
termos

GPT-4V(ision)

Versão multimodal do GPT-4 capaz de aceitar imagens e texto como entrada, utilizando uma arquitetura híbrida para raciocinar sobre o conteúdo visual e gerar respostas textuais contextualizadas.

📖
termos

Reconhecimento de Fala Audiovisual (AVSR)

Sistema multimodal que combina sinais de áudio e vídeo (movimentos labiais) para melhorar a robustez do reconhecimento de fala, particularmente em ambientes ruidosos.

📖
termos

Modelo de Linguagem Visual (VLM)

Classe de modelos multimodais que estendem as arquiteturas de transformadores de linguagem para compreender e raciocinar sobre o conteúdo visual, frequentemente através de mecanismos de atenção cruzada.

📖
termos

Pré-treinamento Contrastivo Multimodal

Paradigma de treinamento auto-supervisionado que aprende representações alinhadas entre modalidades, maximizando a similaridade de pares positivos e minimizando a de pares negativos no espaço latente.

🔍

Nenhum resultado encontrado