【すいろんえんどぽいんと】

推論エンドポイント とは?

最終更新:
💡 アプリからAIの推論を利用する窓口

アプリから入力を受け取り、学習済みAIモデルの推論を利用できるようにするAPIの窓口。通信方式、公開範囲、認証、応答方法はサービスや構成によって異なる。

📌 このページのポイント
推論エンドポイント:推論を使う窓口 アプリ 推論APIの 接続先 入力を受ける モデルを 実行 要求 入力 結果 出力 公開範囲・認証・拡張方法は構成による
同期APIの構成例。外部公開や自動拡張は必須ではなく、サービスと設定に応じて選ぶ。
ひよこ ひよこ
推論エンドポイントって何をするものなの?
ペンギン先生 ペンギン先生
アプリから入力を受け取り、学習済みモデルの推論を利用できるようにするAPIの窓口だよ。HTTPで呼び出すものが一例。全てが同じ通信方式や、即座に結果を返す方式とは限らないんだ
ひよこ ひよこ
モデルをファイルで配布するのと何が違うの?
ペンギン先生 ペンギン先生
ファイルで受け取るなら、使う側でモデルの実行環境を用意する。エンドポイントなら提供側が推論を実行するよ。ただ、アプリ側でも認証や入力形式を合わせる必要がある。誰でもアクセスできる公開URLとは限らず、私設のネットワークからだけ使う構成もあるんだ
ひよこ ひよこ
アクセスが増えたら自動で対応するの?
ペンギン先生 ペンギン先生
自動スケーリングに対応するサービスもあるけれど、対応していることと設定済みであることは違うよ。例えばSageMaker AIでは対象を登録し、台数の範囲や拡張の方針を設定する。エンドポイントを作っただけで、あらゆる負荷に対応できるわけではないんだ
ひよこ ひよこ
モデルを更新するときはどうするの?
ペンギン先生 ペンギン先生
提供される機能によっては、旧版を残して一部の通信を新版へ移すカナリア方式が使えるよ。SageMaker AIでは監視する指標とアラームなどを設定する。段階的に切り替えても品質を保証するものではないので、出力やエラー、応答時間を確かめるんだ
ひよこ ひよこ
リアルタイム推論とバッチ推論はどう選ぶの?
ペンギン先生 ペンギン先生
対話的に応答が必要ならリアルタイム方式、大量の入力をまとめて処理し後から結果を受け取れるならバッチ方式を検討するよ。SageMaker AIのBatch Transformは常設のエンドポイントを必要としない。推論の全てが、リアルタイムのAPI呼び出しになるわけではないんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「推論エンドポイント」って出てきたら「アプリからAIの推論を利用するAPIの窓口」と思えばだいたいOK!
📖 おまけ:英語の意味
「Inference Endpoint」 = 推論エンドポイント
💬 「推論(inference)」を受け付ける「接点(endpoint)」という意味だよ

参考資料

← 用語集にもどる