【でーたくれんじんぐ】
データクレンジング とは?
最終更新:
💡 ルールと根拠を確かめて、データを整える
データの誤り・重複・欠損などを調べ、目的に合う状態へ整える作業。外れ値の扱い、補完の限界、変更の記録を解説します。
📌 このページのポイント
- 表記・形式・重複・欠損などの問題を調べて扱いを決める
- 珍しい値が、必ず入力ミスや削除対象とは限らない
- 補完した値は、実際に確認した値と区別する
- 用途に合う基準を決め、変更前と変更の理由を残す
クレンジングは、空欄を埋めること?
それだけではない。誤り、表記や形式の違い、重複、欠損などを調べる。例えば日付の形式をそろえたり、同じ記録が二重に入っていないか確認したりする。どの問題があるか、まずデータを観察しよう。
同じ名前なら、重複を消せる?
同姓同名の別人かもしれないよ。同じ人でも、別の日の注文なら別の記録だ。何を同じ記録と見なすかを決め、IDや対象の項目を使って確認する。ツールの重複削除も、比較する列と残す行の指定で結果が変わる。
空欄は、平均値で埋めればいい?
値や用途による。平均などで推定して補完する方法もあるが、本人の住所が空欄だから東京都と決めるような埋め方はできない。調べ直す、欠損のまま区別する、分析対象から外すなども検討し、推定値を事実と混ぜないようにする。
外れ値は、全部おかしな値?
入力ミスだけでなく、本当の珍しい出来事かもしれない。元の記録、単位、入力の条件などを確認する。大きな値という理由だけで削除すると、重要な例外や分析したい現象を失うことがあるよ。
全部、自動で直すの?
形式の統一など、規則が明確な処理は自動化できる。意味が曖昧な値や照合できない記録は、人が確認する場合もある。元データを残し、どの規則で何を変えたかを追えるようにして、修正で問題が増えていないか確かめる。
どこまで直せば、完了?
用途で決める。必要な項目、許容する欠損や誤り、例外の扱いを先に合意する。一律に欠損1%や重複0.5%を満たせばよいわけではない。直した結果と残る問題を確認して、利用する側へ伝えよう。
もっと詳しく知りたい人へ
AI用のデータなら、補完すれば精度が上がる?
必ず上がるとは限りません。補完の方法や欠損の理由で結果が変わります。scikit-learnでは定数・平均・中央値・最頻値や、ほかの項目から推定する補完などを提供しています。対象の意味と評価方法を確かめ、学習と評価のデータを適切に分けます。 平均などをデータから求める場合は、評価用データまで使って補完の規則を学習すると、評価を楽観的に見積もる原因になります。
表記ゆれは、全部同じ文字へ置き換える?
項目の意味と必要な区別を確認します。例えば識別子の先頭の0や、名称の記号が意味を持つ場合があります。読みやすさだけで一律に削除せず、変換の規則と、対象外の扱いを決めます。
まとめ:ざっくりこれだけ覚えればOK!
「データクレンジング」って出てきたら「データの誤りや不整合などを調べ、目的に合う状態へ整える作業」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Cleansing / Data Cleaning」 = データを整える・きれいにすること
💬 文字を見やすくするだけでなく、用途に合わせて誤りや不整合を扱う作業を指します。分析やAIの結果は、データの品質だけで決まるわけではありません。