【ブイエルエルエム】
vLLM とは?
最終更新:
💡 AIへの注文を、メモリと順番を工夫してさばく
大規模言語モデルの推論とサービス提供を効率化するオープンソースのライブラリ。KVキャッシュの管理や継続的バッチ処理などにより、複数の生成要求を処理しやすくする。性能と対応機能はモデル・機器・設定に依存する。
📌 このページのポイント
vLLMって、文章を書くAIの名前?
どうして、メモリの使い方が大切なの?
モデルは文章を少しずつ生成するとき、前のトークンから計算した情報をKVキャッシュとして保持するよ。生成が進むとこの情報が増える。vLLMの特徴であるPagedAttentionは、キャッシュをブロックに分け、連続していない物理メモリにも置けるようにするんだ。必要な分を割り当てやすくする工夫で、メモリが不要になるわけではないよ。
継続的バッチ処理って、順番待ちとは違うの?
複数の要求をまとめて処理する組を、生成の途中でも入れ替えられる仕組みだよ。終わった要求を外し、新しい要求を加えて、計算資源を使いやすくする。全員の文章生成が終わるまで次の組を待つ方式との違いだね。ただし、混雑の程度や設定によって待ち時間は変わるよ。
使えば、どのAIでも何倍も速くなる?
アプリから呼び出すときは、何を確認するの?
まとめ:ざっくりこれだけ覚えればOK!
「vLLM」って出てきたら「LLMへのたくさんの要求を効率よく処理する仕組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「vLLM」 = LLMの推論・配信ライブラリの名称
💬 LLMはLarge Language Model(大規模言語モデル)。vLLMはプロジェクトの名前として覚えよう。