マルチモーダルAI

まるちもーだるえーあい

意味

マルチモーダルAIとは、画像・音声・テキスト・動画など異なる感覚情報(モーダリティ)を同時に取り込み、相互に関連付けて理解・生成を行う人工知能技術です。従来の単一モーダル(例:テキストのみ)に比べ、情報源が多様であるため、文脈の把握や推論が人間の感覚に近い形で実現できます。この種のAIは、マルチモーダル表現学習やクロスモーダル注意機構を用いて、各モーダル間の共通表現空間を構築し、異種データ間の相互変換や補完的推論を可能にします。また、マルチタスク学習により、少数のラベルしかない領域でも汎用的な知識を転移できる点が特徴です。

類義語

マルチモーダル人工知能、視覚言語モデル、VLM

マルチモーダルAIの詳しい解説・事例・出典を見る →
最終更新: