Paged Attention
ぺーじどあてんしょん
意味
PagedAttentionとは、大規模言語モデルにおけるテキスト生成処理の効率を高めるために開発された、メモリ管理技術およびそのアルゴリズムの名称です。従来の処理方式では、生成されるテキストの長さに応じて連続した広大なメモリ領域を事前に確保する必要がありましたが、この技術ではオペレーティングシステムの仮想記憶におけるページング機構に着想を得て、メモリを小さなブロック単位に分割して動的に割り当てます。これにより、メモリの断片化や無駄な領域の発生を防ぎ、限られたハードウェア資源を効率的に活用することが可能となります。