AI用語集
人工知能の完全辞典
236
カテゴリ
3,245
サブカテゴリ
39,334
用語
用語
マルチモーダルモデル
テキスト、画像、オーディオ、ビデオなど、複数の種類の非構造化データを共通の表現空間で同時に処理、理解、生成できるAIアーキテクチャ。
用語
DALL-E
OpenAIが開発したテキストからの画像生成システム。VQ-VAEトランスフォーマーと拡散モデルを組み合わせ、テキストの説明から写真のようにリアルな画像を作成する。
用語
ビジョン-ランゲージトランスフォーマー(ViLT)
特徴量の事前抽出なしに画像パッチとテキストトークンを共同処理するトランスフォーマーアーキテクチャ。ビジョン-ランゲージタスクのためのエンドツーエンド学習を可能にする。
用語
マルチモーダルファウンデーションモデル
様々なマルチモーダルデータで大規模に事前学習されたモデルで、ゼロから学習することなく多くのダウンストリームタスクに適応(ファインチューニング)できる。
用語
マルチモーダルパーセプター
異なるモダリティ(テキスト、画像、オーディオ)を単一の潜在空間のトークンシーケンスとして処理する統一アーキテクチャ。クロスアテンションを使用してそれらの相互作用をモデリングする。
用語
GPT-4V(ision)
GPT-4のマルチモーダル版で、画像とテキストを入力として受け取ることができる。ハイブリッドアーキテクチャを使用して視覚的コンテンツについて推論し、文脈化されたテキスト回答を生成する。
用語
オーディオ・ビジュアル音声認識(AVSR)
音声認識の堅牢性を向上させるために、音声信号とビデオ信号(唇の動き)を組み合わせるマルチモーダルシステム。特にノイズの多い環境で有効。
用語
ビジョンランゲージモデル(VLM)
視覚的コンテンツを理解し推論するために言語トランスフォーマーアーキテクチャを拡張したマルチモーダルモデルのクラス。多くの場合、クロスアテンションメカニズムを介して。
用語
マルチモーダル対比事前学習
潜在空間において正のペアの類似度を最大化し、負のペアの類似度を最小化することで、モダリティ間で整列された表現を学習する自己教師あり学習のパラダイム。
🔍