CLIP埋め込み
くりっぷうめこみ
意味
CLIP埋め込みとは、OpenAIが開発した深層学習モデルであるCLIPを用いて、画像やテキストを共通の多次元ベクトル空間上の点として数値化して表現する技術です。CLIPはContrastive Language-Image Pre-trainingの略称で、膨大な画像とテキストのペアを事前学習することで、画像の内容とそれに対応する自然言語の記述を同じ意味空間内で関連付ける能力を獲得しています。この埋め込み表現を用いることで、コンピュータは画像と文章の間の意味的な近接性を数学的に計算できるようになり、画像検索やゼロショット画像分類、画像生成の条件付けなど、多岐にわたるマルチモーダルタスクにおいて中核的な役割を果たしています。異なるメディアを同じ指標で扱うことで、コンピュータによる高度な意味理解を可能にする現代の重要なAI基盤技術です。
類義語
画像埋め込み、テキスト埋め込み