【すいろんえんどぽいんと】

推論エンドポイント とは?

公開:
💡 眠れるAIを起こして外部に繋ぐ窓口
📌 このページのポイント
推論エンドポイント Webアプリ モバイルアプリ 外部サービス 推論エンドポイント POST /predict HTTP / gRPC 認証・スケーリング 推論 学習済みモデル GPU インスタンス v1.2.0 オートスケール対応 予測結果を返す(JSON) HTTPリクエスト
推論エンドポイントのイメージ
ひよこ ひよこ
推論エンドポイントって何をするものなの?
ペンギン先生 ペンギン先生
学習済みのAIモデルAPIとして外部に公開する窓口だよ。アプリがHTTPリクエストを送ると、モデルが推論して結果を返してくれるんだ。
ひよこ ひよこ
モデルをそのまま配布するのと何が違うの?
ペンギン先生 ペンギン先生
モデルをファイルで配布すると使う側で実行環境を用意しないといけないんだよ。エンドポイントなら「URLにリクエストを投げるだけ」で使えるから、アプリ開発者がAIの内部を意識しなくて済むんだ。
ひよこ ひよこ
スケーリングってどういうことなの?
ペンギン先生 ペンギン先生
アクセスが急増したとき自動でサーバーを増やして対応することだよ。AWS SageMakerやGoogle Vertex AIのマネージドサービスを使えば、この自動スケーリングが最初から組み込まれているんだ。
ひよこ ひよこ
バージョン管理も大事なの?
ペンギン先生 ペンギン先生
すごく大事だよ。モデルを新バージョンに切り替えるとき、古いバージョンを残しながらトラフィックを少しずつ移す「カナリアリリース」ができるんだ。いきなり全切り替えして性能が下がるリスクを避けられるね。
ひよこ ひよこ
レイテンシを下げるためにどんな工夫をするの?
ペンギン先生 ペンギン先生
モデルをGPUの近くに配置する、量子化で軽量化する、バッチ処理でリクエストをまとめるなどの方法があるよ。用途によってリアルタイム推論かバッチ推論かを選ぶことも大事なんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「推論エンドポイント」って出てきたら「AIモデルAPIとして外部に公開する窓口」と思えればだいたいOK!
📖 おまけ:英語の意味
「Inference Endpoint」 = 推論エンドポイント
💬 「推論(inference)」を受け付ける「接点(endpoint)」という意味だよ
← 用語集にもどる