【でーたとくめいか】
データ匿名化 とは?
最終更新:
💡 データの中身は活かしつつ「誰のもの?」を消す技術だよ
個人を特定できるデータを加工し、個人が識別されない状態にすること。氏名を消すだけでは不十分な場合があり、残った情報や他のデータとの組み合わせも考えて評価する。
📌 このページのポイント
- 氏名の削除や年齢・住所の一般化などで、個人の特定につながる情報を減らす
- 加工後も、他のデータとの照合による再識別のリスクを評価する
- IDに置き換えて対応表などで識別できる仮名化は、匿名化とは区別する
- データの有用性との両立や、利用する国・制度の要件も考える
データ匿名化って何をするの?
個人を特定できるデータを加工して、「誰のデータか」が識別されない状態にすることだよ。個人を特定せずに統計分析などへ活用するために使う。ただし、名前を消せばどんな用途にも安全に使える、というわけではないんだ。
具体的にはどう加工するの?
氏名や電話番号を削除したり、「35歳」を「30代」、「港区」を「東京都」にするように情報を大まかにしたりするよ。数値にノイズを加える方法などもある。どの手法も、それを使っただけで匿名性が確保されるとは限らず、データや利用方法に合わせた評価が必要なんだ。
IDに置き換える仮名化とは違うの?
仮名化は、対応表などの追加情報があれば個人を識別できる形に置き換えることだよ。氏名をIDにしただけでは、匿名化を達成したとは言えない。追加情報の管理は大切だけれど、それを別に保管することと、識別されないデータにすることは分けて考えよう。
年齢と地域だけなら、誰かわからないよね?
その組み合わせが珍しかったり、他のデータと照合できたりすると、個人が特定される場合があるよ。残す情報や提供先なども含めて再識別のリスクを評価するんだ。一方で、年齢を全部「成人」にすると年代別の分析ができなくなるように、加工でデータの有用性が下がることもある。
匿名化できれば、法律上の確認はいらなくなる?
制度ごとの確認が必要だよ。たとえば日本の個人情報保護法上の「匿名加工情報」は、定められた基準で加工し、加工方法などの情報を適切に管理するほか、情報の項目の公表や本人を識別する行為の禁止などのルールがある。日常語の「匿名化」と、法律上の区分を同じ意味で使わないようにしよう。
まとめ:ざっくりこれだけ覚えればOK!
「データ匿名化」って出てきたら「個人が特定されないようにデータを加工すること」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Anonymization」 = データの匿名化
💬 anonymous(匿名の)に由来する言葉。名前を隠すだけでなく、残った情報からも誰のデータか識別されないようにすることを表すよ。