【えーあいすいろんちっぷ】

AI推論チップ とは?

最終更新:
💡 学習済みのAIを、効率よく動かすためのチップ

学習済みAIモデルを実行する推論処理を効率化する半導体。推論専用の設計とGPU・TPUの違い、性能を比較する条件を説明します。

📌 このページのポイント
AI推論:学習済みモデルを動かす学習済みモデル+ 入力推論を実行予測・生成の結果GPU・TPUなど学習にも推論にも推論向けの設計例:Inferentia対応モデルと、比較する条件を確認
学習済みモデルの実行を推論と呼びます。GPUと推論向けチップの消費電力や性能を一律に順位付けした図ではありません。
ひよこ ひよこ
AIの学習と推論は、何が違うの?
ペンギン先生 ペンギン先生
学習はデータからモデルの内部の値を調整すること。推論は、そのモデルを使って入力への予測や生成を行うことだよ。推論チップは、この実行を効率化する設計に注目した言葉なんだ。
ひよこ ひよこ
GPUは学習、専用チップは推論、と分ける?
ペンギン先生 ペンギン先生
GPUも推論に使えるよ。推論向けに作られたAWS Inferentiaのようなチップがある一方、GoogleのTPUは学習にも推論にも使う。名前だけで、すべてを二つに分けるものではないんだ。
ひよこ ひよこ
専用なら、どのモデルでも速くて安い?
ペンギン先生 ペンギン先生
対応する計算やモデル、メモリ、ソフトウェアによるよ。例えばInferentiaで動かすには、AWS Neuronというソフトウェアを使う。使いたいモデルが対応し、目的の応答時間や処理量を満たすかを確認するんだ。
ひよこ ひよこ
電力がGPUの10分の1になるって本当?
ペンギン先生 ペンギン先生
一律にそうとは言えないよ。同じモデルでも、計算精度や入力の長さ、同時に処理する数で結果は変わる。速度、費用、消費電力のどれを比べるかと、その条件をそろえて評価しよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「AI推論チップ」って出てきたら「学習済みのAIを効率よく動かすための半導体」と思えばだいたいOK!
📖 おまけ:英語の意味
「AI inference chip」 = AIの推論処理向けの半導体
💬 Inferenceは、学習済みモデルを使って予測や生成を行う処理を指します。学習が一度だけで終わるという意味ではありません。

参考資料

← 用語集にもどる