【さぶんぷらいばしー】
差分プライバシー とは?
最終更新:
💡 一人分のデータが分析結果に与える影響を抑える
一人分のデータの有無などが分析結果の出る確率に与える影響を、数学的に制限する枠組み。統計結果などに適切なランダムノイズを加える方法があり、保護の強さと分析の精度を調整する。
📌 このページのポイント
- 一人分のデータが変わっても、各結果が出る確率の変化を制限する
- 統計結果へのノイズ追加など、定義を満たす仕組みを使う
- 保護の強さと分析精度にはトレードオフがある
- 同じデータを繰り返し分析するときは、累積するプライバシー損失も管理する
差分プライバシーって、何をしてるの?
例えばアンケートの人数を集計して公開するときに、計算結果へランダムなノイズを加える方法があるよ。一人分の回答の有無が公開結果に与える影響を抑え、回答への参加から個人について余計な情報が分かることを制限するんだ。
ノイズを混ぜたら正しい分析ができなくなりそうだけど?
ノイズで誤差が出るので、元の統計と同じ精度になる保証はないよ。どんな集計か、データの量や設定によって使いやすさが変わる。一般に保護を強めるほど、必要なノイズが増えて精度は下がりやすいんだ。
ノイズを少し足せば、誰のことも分からなくなるの?
適当なノイズを足すだけでは定義を満たすとは限らないよ。ε(イプシロン)などのパラメータや、何を一人分の違いとするかを決め、条件を満たす仕組みが必要なんだ。近似的な定義ではδ(デルタ)も使う。すべての個人情報の推測を不可能にする保証ではないよ。
何度も分析してよいの?
まとめ:ざっくりこれだけ覚えればOK!
「差分プライバシー」って出てきたら「一人分のデータの影響を抑えながら、全体を分析するための枠組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Differential Privacy」 = 差分のプライバシー
💬 一人分のデータが異なる二つのデータ集合を比べ、その違いが分析結果の出る確率へ与える影響を制限する考え方だよ