【でーたれいく】
データレイク とは?
最終更新:
💡 さまざまなデータをため、用途に合わせて使う保管基盤
構造化・半構造化・非構造化など、さまざまなデータをまとめて保持し、分析などに利用するためのデータ保管基盤。元の形式のデータを保存でき、用途に合わせて加工したデータの層も設けられる。データの所在・品質・アクセス権などの管理が必要。
📌 このページのポイント
データレイクって何をためる場所なの?
データウェアハウスとの違いは?
データウェアハウスは分析向けに構造や内容を整えたデータを扱うのが基本。データレイクは元の形式のデータも保管し、読み取るときに構造を解釈する使い方ができるよ。ただし、レイクの中にも加工したデータを置けるし、レイクを直接分析する構成もあるんだ。
全部そのままためればいいの?
何があるか分からず、信頼して使えない状態はデータスワンプと呼ばれるよ。カタログで所在や意味を管理し、品質やアクセス権を整えることが大切。保存するだけでは、使える分析基盤は完成しないんだ。
データの層を分けるのはなぜ?
元のデータ、用途に合わせて変換したデータ、分析向けに整えたデータを区別できるからだよ。AWSの構成例にもRaw・Transformed・Curatedの層がある。これは設計例で、全てのレイクが同じ層名や順番に従う必要はないんだ。
データレイクなら必ず安くなる?
保存や加工、検索、運用などの条件で費用は変わるよ。元の形式を保持できることと、あらゆる構成で費用が下がることは別。用途に必要なデータや処理、保存期間などを決めて考えよう。
まとめ:ざっくりこれだけ覚えればOK!
「データレイク」って出てきたら「さまざまなデータをため、用途に合わせて使う保管基盤」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Lake」 = データの湖
💬 lakeは「湖」。さまざまなデータをまとめて保持するイメージだよ。無計画に全てをためるという設計指示ではないんだ。