【もでるすいろん】

モデル推論 とは?

最終更新:
💡 鍛え上げたAIを「実際に使う」実行フェーズ

学習済みのAIモデルに入力データを与え、予測や生成の結果を得る処理。通常の推論では、学習済みのパラメータを更新せずに計算する。

📌 このページのポイント
学習したモデルで推論する 学習:例からパラメータを調整 学習用データ 学習済み モデル 学習したモデルを利用 推論:結果を得る 学習済み モデル 新しい入力 予測・生成結果 通常はパラメータを 更新しない 時間・費用はモデルや入出力の量で変わる
一般的な学習と推論の違い。矢印はデータの入力、モデルの利用、結果の出力を表す。
ひよこ ひよこ
推論って「AIが考える」こと?学習と何が違うの?
ペンギン先生 ペンギン先生
学習はデータを使ってモデルのパラメータを調整すること。推論は、その学習済みモデルに入力を与えて予測や生成を行うことだよ。通常はパラメータを更新しないけれど、必ず軽い・速い処理になるわけではないんだ。
ひよこ ひよこ
生成AIの答えが返るまでの時間は何で決まるの?
ペンギン先生 ペンギン先生
モデルの規模、入力と出力の長さ、ハードウェア、混雑や実行方法などが関係するよ。自己回帰型のLLMは通常、前のトークンをもとに次を生成する。GPUを増やせば必ず比例して速くなる、というものではないんだ。
ひよこ ひよこ
どんな指標を見ればいい?
ペンギン先生 ペンギン先生
要求してから最初のトークンが返るまでがTTFT、応答全体を待つ時間もレイテンシの指標だよ。一方、サーバーが1秒に処理するトークン数などはスループット。1人の待ち時間と、全体でさばける量を分けて見るんだ。
ひよこ ひよこ
推論を速くするには?
ペンギン先生 ペンギン先生
複数の要求をまとめるバッチ処理、量子化、蒸留した小さなモデルなどが候補だよ。ただし、バッチを大きくすると全体の処理量が増えても、個々の応答が遅くなる場合がある。品質・待ち時間・メモリ・費用を実際の条件で確かめよう。
ひよこ ひよこ
学習じゃないのに、メモリが足りなくなるの?
ペンギン先生 ペンギン先生
モデルのパラメータ以外にも作業用メモリが必要だよ。たとえばLLMのKVキャッシュは、過去のトークンから計算したキーと値を保存して再利用する。一般的な動的キャッシュは系列が長いほど増え、同時に扱う要求の数も必要量に影響する。固定長や古い部分を外す方式もあるので、実装を確認しよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「モデル推論」って出てきたら「学習済みAIを実際に動かして答えを出す処理」と思えればだいたいOK!
📖 おまけ:英語の意味
「Model Inference」 = モデルによる推論・推定
💬 Inferenceは「推論・推定」の意味。統計学では「データからモデルのパラメータを推定すること」も指すが、AI文脈では「学習済みモデルを使って予測すること」を意味するよ

参考資料

← 用語集にもどる