【トライトンインファレンスサーバー】
Triton Inference Server とは?
最終更新:
💡 複数のモデルを、共通の窓口から呼び出す推論サーバー
NVIDIAのオープンソースの推論提供ソフトウェア。学習済みモデルをバックエンドで実行し、HTTP/RESTやgRPCなどで受けた要求へ結果を返す。対応するモデル形式やGPU・CPU環境を確認して利用する。
📌 このページのポイント
普通のWebサーバーじゃダメなの?
「動的バッチング」って何なの?
同じモデルへの複数の要求をまとめる機能だよ。状態を持たないモデル向けに設定し、まとめるための最大待ち時間などを選ぶ。待たずに送る設定もあるし、いつもまとめれば最速になるわけではない。処理量と応答の待ち時間を測って調整するんだ。
モデルアンサンブルって機能も聞いたけど、それはどういう意味なの?
Tritonのensembleは、モデル間の入力と出力のデータの流れを定義する仕組みだよ。たとえば前処理→推論→後処理を一つの入口で呼び出せる。モデルの予測を平均して精度を上げることだけを指す言葉ではなく、各段階の入力や出力を対応づける必要があるんだ。
利用するときは何を確かめるの?
📖 おまけ:英語の意味
「Triton Inference Server」 = トライトン推論サーバー
💬 Inferenceは推論、Serverは要求を受けて結果を提供する側のソフトウェアだよ。ここではNVIDIAの製品を指しているんだ