【ドメインてきおう】
ドメイン適応 とは?
最終更新:
💡 学習元と利用先の、データの違いに適応する
学習元と使う先のデータ分布の違いに、モデルを適応させる考え方。ラベルの有無、適応と評価、DANNの例を解説します。
📌 このページのポイント
- 学習元と利用先のデータ分布の違いを扱う
- ラベル付きの学習元と、ラベルなしの利用先を使う方式がある
- 使えるデータやラベルに合わせて、方法を選ぶ
- 適応しただけで必ず改善するわけではなく、利用先で評価する
ここでは、学習に使ったデータと利用先のデータの分布の違いを扱うよ。たとえば画像の対象を認識する課題で、明るい場所の画像と暗い場所の画像では見え方が変わる。そうした違いにモデルを適応させる考え方なんだ。
元のモデルを、そのまま使えないの?
使える場合もあるけれど、学習時と違う条件では性能が変わることがあるよ。まず利用先でどんな結果が出るか確認し、どんなデータが使えるかを考える。同じ種類の課題でも、条件まで同じとは限らないんだ。
利用先の正解データも必要?
方式によるよ。DANNという研究では、正解ラベルのある学習元のデータと、ラベルのない利用先のデータを使う。これは、利用先の正解ラベルを学習に使わないドメイン適応の例なんだ。
正解を知らずに、何を調整するの?
適応させれば、性能は上がる?
必ずとはいえないよ。使えるデータ、違いの性質、方法が課題に合うかを確認する。図は適応の考え方で、昼と夜の認識が必ず同じ精度になる保証ではない。利用先を代表するデータで、実際の結果を評価しよう。
もっと詳しく知りたい人へ
利用先のデータが一切なくても、同じ方法が使える?
ここで説明したDANNの例は、学習中にラベルなしの利用先データを使います。利用先をまったく見ずに未知の環境への対応を目指す設定とは違います。手法の説明を読むときは、どのデータを使える前提かを確認します。
別のデータで追加学習すれば、全部ドメイン適応?
追加学習は広い手段です。ドメイン適応では特に学習元と利用先の分布の違いに着目します。課題そのものの変更等も含む転移学習や、一般的なファインチューニングのすべてを同じ意味で呼ぶわけではありません。
まとめ:ざっくりこれだけ覚えればOK!
「ドメイン適応」って出てきたら「学習元と使う先のデータの違いに、モデルを適応させる考え方」と思えばだいたいOK!
📖 おまけ:英語の意味
「Domain Adaptation」 = データの領域の違いへの適応
💬 ここでのドメインは、データの分布や収集条件等に関わる領域です。Webサイトのドメイン名やDNSを切り替える意味ではありません。