【えっじすいろん】
エッジ推論 とは?
最終更新:
💡 データの近くで、学習済みモデルを実行する
学習済みのモデルを使って、入力から予測や生成などの結果を出す推論を、端末やデータの発生場所に近い機器で実行すること。通信を減らせる一方、処理時間や使えるモデルは機器と実装による。
📌 このページのポイント
クラウド推論とは何が違うの?
入力を遠くのサーバーへ送って処理する代わりに、端末や現場の機器で推論するよ。通信の待ち時間を減らせるけれど、入力の処理やモデルの計算には時間がかかる。遅延がゼロになる、という意味ではないんだ。
NPUがなければ動かない?
モデルを小さくすれば、同じ結果が出る?
量子化などでモデルのサイズや計算の負担を減らせる場合があるよ。ただし精度が変わることもあり、どれだけ小さく速くなるかは手法とモデルによる。常にメモリが10分の1、元の精度のまま、と決めずに用途に合うか評価するんだ。
データは絶対に端末から出ない?
推論の入力を外へ送らず処理する構成は可能だけれど、アプリ全体の保証とは別だよ。例えばLiteRTのPlay services実装は入力を端末で処理する一方、更新や性能指標の送信で通信する。保存、ログ、結果の送信、ほかの機能も確認する必要があるんだ。
学習も通信も、すべて端末の中で済む?
エッジ推論は推論を行う場所の話だよ。別の場所で学習したモデルを端末へ配布することもある。モデルを用意すれば通信なしで処理できる構成も、クラウドと組み合わせる構成もあるので、更新や必要なデータの取得を含めて考えるんだ。
まとめ:ざっくりこれだけ覚えればOK!
「エッジ推論」って出てきたら「端末や現場など、データの近くでモデルの推論を実行すること」と思えばだいたいOK!
📖 おまけ:英語の意味
「Edge Inference」 = エッジ側での推論
💬 Edgeはデータの発生場所に近い端末や機器、Inferenceは学習済みモデルから結果を出す推論を指すよ。学習場所やアプリ全体の通信とは分けて考えよう。