AI 词汇表
人工智能完整词典
200
个类别
2,608
个子类别
30,011
个术语
个术语
多模态模型
能够同时处理、理解并生成多种非结构化数据(如文本、图像、音频或视频)的AI架构,在共同表示空间中进行操作。
个术语
DALL-E
由OpenAI开发的文本到图像生成系统,结合VQ-VAE变换器和扩散模型,从文本描述创建逼真的图像。
个术语
视觉语言变换器(ViLT)
同时处理图像块和文本标记的变换器架构,无需预提取特征,实现视觉语言任务的端到端学习。
个术语
多模态基础模型
在多样化多模态数据上大规模预训练的模型,能够适应(微调)多种下游任务,无需从头开始训练。
个术语
多模态感知器
统一架构,将不同模态(文本、图像、音频)作为潜在空间中的标记序列处理,使用交叉注意力建模它们的交互。
个术语
GPT-4V(ision)
GPT-4的多模态版本,能够接受图像和文本输入,使用混合架构对视觉内容进行推理并生成情境化的文本响应。
个术语
视听语音识别(AVSR)
结合音频和视频信号(唇部运动)的多模态系统,提高语音识别的鲁棒性,特别是在嘈杂环境中。
个术语
视觉语言模型(VLM)
扩展语言变换器架构以理解和推理视觉内容的多模态模型类别,通常通过交叉注意力机制实现。
个术语
对比预训练多模态
一种自监督训练范式,通过在潜在空间中最大化正样本对的相似度并最小化负样本对的相似度,来学习跨模态对齐的表示。
🔍