【とくちょうりょうえんじにありんぐ】
特徴量エンジニアリング とは?
最終更新:
💡 データの意味を、学習に使える手掛かりへ
予測したいことに合わせて、機械学習へ入力する特徴量を作り、変換・選択する作業。データの意味を生かし、学習と評価を分けて効果を確かめる。
📌 このページのポイント
- 入力する特徴量を作る・変換する・選ぶ作業
- カテゴリの数値化、尺度の調整、欠損値の補完などがある
- 評価用データを、変換ルールの学習に混ぜない
- 特徴量を増やすだけでなく、評価して効果を確かめる
特徴量エンジニアリングって何をするの?
例えば住宅価格を予測するなら、住所から駅までの距離を作ったり、建築年から築年数を計算したりするよ。元のデータを、予測に役立つ手掛かりへ整える作業なんだ。役立つかどうかは、別のデータで評価して確かめよう。
文字を0と1にしたら、One-Hot?
One-Hotは、カテゴリごとに列を作る方法だよ。色が赤・青・緑なら、それぞれの列に該当する色だけ1、ほかは0を入れる。単に赤を0、青を1、緑を2と番号にする方法とは違うんだ。数値の尺度をそろえる処理や、欠損値を補う処理もあるよ。
全部のデータで、平均を計算していい?
学習用と評価用を先に分けよう。平均で欠損値を補う場合や標準化する場合、ルールを決めるための計算には学習用だけを使う。評価用には同じルールを適用するんだ。評価用の情報が混ざると、未知のデータへの性能をよく見積もりすぎることがあるよ。
特徴量を増やせば、必ず精度が上がる?
増やせばよいとは限らないよ。不要な情報や、予測する時点では分からない情報も入り得る。モデルと目的に合う表現を選び、評価方法をそろえて比べよう。学習手法が変わっても、入力の意味や使える情報を確認することは大切だね。
まとめ:ざっくりこれだけ覚えればOK!
「特徴量エンジニアリング」って出てきたら「予測に使える手掛かりを、データから作って整える作業」と思えばだいたいOK!
📖 おまけ:英語の意味
「Feature Engineering」 = 特徴量の設計・加工
💬 Featureはモデルに入力する特徴量。目的に合う入力表現を設計することだよ。