【でーたぜんしょり】
データ前処理 とは?
最終更新:
💡 データの意味を確かめ、分析に使える形に整える
分析や機械学習の目的に合わせてデータを整える作業。欠損・スケール・カテゴリの扱い、外れ値の注意、評価データを混ぜない手順を解説します。
📌 このページのポイント
- 欠損や形式、単位の違いを確認し、目的に合う処理を選ぶ
- スケーリングやカテゴリの変換は、モデルに合わせる
- 外れ値を機械的に消さず、意味や影響を確認する
- 学習で決める前処理に、評価用データを混ぜない
データを集めたら、そのままAIに渡せる?
そのまま使えるとは限らないよ。欠けた値や違う単位、文字のカテゴリなどを確認して、分析やモデルが扱える形に整える。これがデータ前処理だ。使うモデルによって、必要な処理も変わる。
欠損値は、全部0にすればよい?
0が本当の値と区別できなくなる場合があるね。行や列を除く、平均・中央値などで補う、欠損自体を示す方法がある。何が欠けているのか、どの情報を失うのかを考えて選ぼう。
数値の大きさも、そろえるの?
モデルによるよ。Min-Maxスケーリングは学習データの最小・最大などを使って尺度を変える。標準化は平均を引き、標準偏差で割る方法だ。どちらも外れ値の影響を受けるので、標準化なら外れ値に強いとは言えない。
文字のカテゴリや、極端な値はどうする?
カテゴリを複数の0・1の列にするOne-Hotなど、モデルに合う表現を選ぶ。極端な値が入力ミスなのか、重要な事例なのかも調べよう。大きいから消す、番号にすれば順序も正しい、とは限らないんだ。
評価用のデータも含めて平均を計算してよい?
評価を先に見たことになるので避けよう。まず学習用と評価用を分け、補完値や尺度などを学習用だけで決める。評価用には同じ設定で変換だけを行う。検証の分け方も目的に合わせるんだ。
もっと詳しく知りたい人へ
Min-Max変換なら、新しい値も必ず0〜1?
学習時の範囲をもとに変換する場合、新しい値がその範囲を超えると、変換後も0未満や1超になることがあります。クリップする設定などは別の選択です。学習時に求めた設定を、評価や予測にも一貫して使います。
前処理は、仕事の80%を占める?
作業時間の割合はデータの状態や目的によって変わります。一律の割合としては扱いません。欠損の原因や単位などを確認したうえで、選んだ処理と理由を記録すると、結果の解釈や後の再現に役立ちます。
まとめ:ざっくりこれだけ覚えればOK!
「データ前処理」って出てきたら「分析やAIに使える形へデータを整える下準備」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Preprocessing」 = データの分析・学習前に行う処理
💬 preは前、processingは処理という意味です。欠損値を埋める、数値の尺度をそろえるなど、本処理の目的に合う表現へ整える作業を指します。