【とくちょうりょうすとあ】
特徴量ストア とは?
最終更新:
💡 AIが使う「食材」を整理して、学習と推論へ届ける
機械学習の入力になる特徴量を管理し、学習や推論へ提供する基盤。定義や値を再利用し、過去の値とオンライン用の値を目的に応じて取り出す。
📌 このページのポイント
どんな「食材」を入れるの?
たとえば購入予測に使う「過去30日の購入回数」のような特徴量だよ。特徴量の定義や値を整理して、複数のモデルで使いやすくする。生データを集めて加工する処理まで、どの製品でも全部自動で担当するわけではないよ。
学習と推論では、同じ倉庫を使うの?
学習には、いつの値を使えばいい?
予測したい時点で使えた情報を考えるんだ。たとえば先月の購入を予測する学習に、翌月までの購入回数を混ぜると未来の情報が漏れるよ。時刻を基に過去の特徴量を取り出すpoint-in-time joinが役立つけれど、データの時刻や後から補われた値の扱いも確認しよう。
導入すれば、学習と推論のズレはなくなる?
定義の共有や再利用はズレを減らす助けになるけれど、保証にはならないよ。計算のコード、データの更新、欠損値、時刻の設定などを合わせて確かめる必要がある。特徴量の変更履歴を残し、実際に学習用と推論用へ渡る値を比較できるようにしよう。
小さいチームでも必要かな?
人数だけで決めるより、同じ特徴量の重複計算や共有、過去の学習データの再現、推論への提供に困っているかを見よう。Feastのような仕組みが役立つ一方、保存先や更新処理を管理する負担も増える。既存の仕組みで足りるかと合わせて判断するといいよ。
もっと詳しく知りたい人へ
Feastのpoint-in-time joinなら、後から補ったデータも自動で除外される?
イベント時刻の比較だけでは、その時点より後に作成・修正された値が返る場合があります。現在のFeastには作成時刻で絞るfilter_by_created_timestampもありますが、作成時刻の列の正しさや保存先の対応が必要です。何を「当時使えた情報」とするかを決め、公式資料で設定を確認しましょう。
まとめ:ざっくりこれだけ覚えればOK!
「特徴量ストア」って出てきたら「AIに渡す特徴データを、整理して共有する食材倉庫」と思えばだいたいOK!
📖 おまけ:英語の意味
「Feature Store」 = 特徴量の保管庫
💬 Feature(特徴量)をStore(保管する場所)に集約するという意味。データのスーパーマーケットのようなイメージだよ