VIP 👤
🏠 Accueil
基準測試
📊 Tous les Benchmarks 🦖 Dinosaure v1 🦖 Dinosaure v2 ✅ To-Do List Apps 🎨 Pages Libres 🎯 FSACB - Showcase 🌍 Traduction
Modèles
🏆 Top 10 Modèles 🆓 Modèles Gratuits 📋 Tous les Modèles ⚙️ Modes Kilo Code
Ressources
💬 Prompts IA 📖 人工智能詞彙表 🔗 Liens Utiles 🔌 AI API 同路由

AI 詞彙表

人工智能完整詞典

200
類別
2,608
子類別
30,011
術語
📖
術語

多模态模型

能够同时处理、理解并生成多种非结构化数据(如文本、图像、音频或视频)的AI架构,在共同表示空间中进行操作。

📖
術語

DALL-E

由OpenAI开发的文本到图像生成系统,结合VQ-VAE变换器和扩散模型,从文本描述创建逼真的图像。

📖
術語

视觉语言变换器(ViLT)

同时处理图像块和文本标记的变换器架构,无需预提取特征,实现视觉语言任务的端到端学习。

📖
術語

多模态基础模型

在多样化多模态数据上大规模预训练的模型,能够适应(微调)多种下游任务,无需从头开始训练。

📖
術語

多模态感知器

统一架构,将不同模态(文本、图像、音频)作为潜在空间中的标记序列处理,使用交叉注意力建模它们的交互。

📖
術語

GPT-4V(ision)

GPT-4的多模态版本,能够接受图像和文本输入,使用混合架构对视觉内容进行推理并生成情境化的文本响应。

📖
術語

视听语音识别(AVSR)

结合音频和视频信号(唇部运动)的多模态系统,提高语音识别的鲁棒性,特别是在嘈杂环境中。

📖
術語

视觉语言模型(VLM)

扩展语言变换器架构以理解和推理视觉内容的多模态模型类别,通常通过交叉注意力机制实现。

📖
術語

对比预训练多模态

一种自监督训练范式,通过在潜在空间中最大化正样本对的相似度并最小化负样本对的相似度,来学习跨模态对齐的表示。

🔍

搵唔到結果