【えっじすいろん】

エッジ推論 とは?

最終更新:
💡 データの近くで、学習済みモデルを実行する

学習済みのモデルを使って、入力から予測や生成などの結果を出す推論を、端末やデータの発生場所に近い機器で実行すること。通信を減らせる一方、処理時間や使えるモデルは機器と実装による。

📌 このページのポイント
エッジ推論:データの近くで実行 入力 端末・現場の機器 モデル 結果 CPU / GPU / NPUなど 通信の待ち時間を減らせる 計算にも時間とメモリが必要 外部送信はアプリ全体で確認 学習場所と推論場所は別に考える
入力を受け、機器の中で学習済みモデルを実行して結果を出す例。遅延ゼロやアプリ全体の無通信を意味せず、学習が必ずクラウドで行われるとも限らない。
ひよこ ひよこ
クラウド推論とは何が違うの?
ペンギン先生 ペンギン先生
入力を遠くのサーバーへ送って処理する代わりに、端末や現場の機器で推論するよ。通信の待ち時間を減らせるけれど、入力の処理やモデルの計算には時間がかかる。遅延がゼロになる、という意味ではないんだ。
ひよこ ひよこ
NPUがなければ動かない?
ペンギン先生 ペンギン先生
CPUやGPUでも実行できるモデルがあるよ。NPUなどの加速器を使えるかは、機器だけでなくモデルの処理や実行環境の対応にもよる。モデルの大きさ、使えるメモリ、処理時間などを合わせて確認するんだ。
ひよこ ひよこ
モデルを小さくすれば、同じ結果が出る?
ペンギン先生 ペンギン先生
量子化などでモデルのサイズや計算の負担を減らせる場合があるよ。ただし精度が変わることもあり、どれだけ小さく速くなるかは手法とモデルによる。常にメモリが10分の1、元の精度のまま、と決めずに用途に合うか評価するんだ。
ひよこ ひよこ
データは絶対に端末から出ない?
ペンギン先生 ペンギン先生
推論の入力を外へ送らず処理する構成は可能だけれど、アプリ全体の保証とは別だよ。例えばLiteRTのPlay services実装は入力を端末で処理する一方、更新や性能指標の送信で通信する。保存、ログ、結果の送信、ほかの機能も確認する必要があるんだ。
ひよこ ひよこ
学習も通信も、すべて端末の中で済む?
ペンギン先生 ペンギン先生
エッジ推論は推論を行う場所の話だよ。別の場所で学習したモデルを端末へ配布することもある。モデルを用意すれば通信なしで処理できる構成も、クラウドと組み合わせる構成もあるので、更新や必要なデータの取得を含めて考えるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「エッジ推論」って出てきたら「端末や現場など、データの近くでモデルの推論を実行すること」と思えばだいたいOK!
📖 おまけ:英語の意味
「Edge Inference」 = エッジ側での推論
💬 Edgeはデータの発生場所に近い端末や機器、Inferenceは学習済みモデルから結果を出す推論を指すよ。学習場所やアプリ全体の通信とは分けて考えよう。

参考資料

← 用語集にもどる