【あだぷたーれいやー】
アダプターレイヤー とは?
最終更新:
💡 小さな追加モジュールで、モデルを適応させる
事前学習モデルに小さな学習用モジュールを加えて、少ないパラメータでタスクへ適応させる手法。ボトルネック構造、残差接続、学習対象、LoRAとの違いを解説します。
📌 このページのポイント
アダプターレイヤーは、大きなAIモデルをもう一度全部学習するもの?
小さなモジュールの中は、どうなっている?
Transformerの層と層の間に、必ず一つずつ置く?
配置は方式によるよ。Houlsbyらの構成では、各Transformer層内の注意機構やフィードフォワード処理の後に挿入する。層と層の間だけに置く、と固定して覚えないようにしよう。
学習するのは、アダプターだけ?
LoRAは、そのアダプターを新しくしたもの?
もっと詳しく知りたい人へ
追加パラメータは、必ずモデル全体の数%?
固定の割合ではありません。ボトルネックの幅、挿入する場所と数、追加で学習する層などで変わります。論文の特定の実験結果を、すべてのモデルやタスクに共通する数値として扱わないようにします。
アダプターだけ保存すれば、どんなモデルでも使える?
通常は対応する基盤モデルと構成が必要です。モデルの種類や版、層の形、挿入位置、前処理などを合わせて利用します。アダプターの差し替えによるタスク切り替えも、対応する構成で成り立つ仕組みです。
📖 おまけ:英語の意味
「Adapter Layer」 = 適応のための層
💬 Houlsbyらの2019年の論文は、NLP向けのパラメータ効率のよい転移学習としてアダプターを提案しています。ここでは、システム間の接続を合わせる一般的なアダプターとは文脈を分けて説明します。