【でーたぜんしょり】

データ前処理 とは?

最終更新:
💡 データの意味を確かめ、分析に使える形に整える

分析や機械学習の目的に合わせてデータを整える作業。欠損・スケール・カテゴリの扱い、外れ値の注意、評価データを混ぜない手順を解説します。

📌 このページのポイント
前処理:評価用を設定の学習に混ぜない目的に合う方法で、学習用と評価用を分ける学習用設定を決める評価用設定に混ぜない学習用だけで求めた同じ設定例:補完値・スケールの基準学習用を変換評価用は変換だけ欠損・外れ値の意味とモデルに合う処理を確認
前処理の設定を学習する場合の手順です。評価用から設定を決め直さず、同じ規則を使います。すべてのデータに同じ前処理を固定順で行う意味ではありません。
ひよこ ひよこ
データを集めたら、そのままAIに渡せる?
ペンギン先生 ペンギン先生
そのまま使えるとは限らないよ。欠けた値や違う単位、文字のカテゴリなどを確認して、分析やモデルが扱える形に整える。これがデータ前処理だ。使うモデルによって、必要な処理も変わる。
ひよこ ひよこ
欠損値は、全部0にすればよい?
ペンギン先生 ペンギン先生
0が本当の値と区別できなくなる場合があるね。行や列を除く、平均・中央値などで補う、欠損自体を示す方法がある。何が欠けているのか、どの情報を失うのかを考えて選ぼう。
ひよこ ひよこ
数値の大きさも、そろえるの?
ペンギン先生 ペンギン先生
モデルによるよ。Min-Maxスケーリングは学習データの最小・最大などを使って尺度を変える。標準化は平均を引き、標準偏差で割る方法だ。どちらも外れ値の影響を受けるので、標準化なら外れ値に強いとは言えない。
ひよこ ひよこ
文字のカテゴリや、極端な値はどうする?
ペンギン先生 ペンギン先生
カテゴリを複数の0・1の列にするOne-Hotなど、モデルに合う表現を選ぶ。極端な値が入力ミスなのか、重要な事例なのかも調べよう。大きいから消す、番号にすれば順序も正しい、とは限らないんだ。
ひよこ ひよこ
評価用のデータも含めて平均を計算してよい?
ペンギン先生 ペンギン先生
評価を先に見たことになるので避けよう。まず学習用と評価用を分け、補完値や尺度などを学習用だけで決める。評価用には同じ設定で変換だけを行う。検証の分け方も目的に合わせるんだ。
もっと詳しく知りたい人へ

Min-Max変換なら、新しい値も必ず0〜1?

学習時の範囲をもとに変換する場合、新しい値がその範囲を超えると、変換後も0未満や1超になることがあります。クリップする設定などは別の選択です。学習時に求めた設定を、評価や予測にも一貫して使います。

前処理は、仕事の80%を占める?

作業時間の割合はデータの状態や目的によって変わります。一律の割合としては扱いません。欠損の原因や単位などを確認したうえで、選んだ処理と理由を記録すると、結果の解釈や後の再現に役立ちます。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「データ前処理」って出てきたら「分析やAIに使える形へデータを整える下準備」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Preprocessing」 = データの分析・学習前に行う処理
💬 preは前、processingは処理という意味です。欠損値を埋める、数値の尺度をそろえるなど、本処理の目的に合う表現へ整える作業を指します。

参考資料

← 用語集にもどる