【でーたれいく】

データレイク とは?

最終更新:
💡 さまざまなデータをため、用途に合わせて使う保管基盤

構造化・半構造化・非構造化など、さまざまなデータをまとめて保持し、分析などに利用するためのデータ保管基盤。元の形式のデータを保存でき、用途に合わせて加工したデータの層も設けられる。データの所在・品質・アクセス権などの管理が必要。

📌 このページのポイント
ためたデータを用途に合わせて使う CSV JSON 画像 データレイク 分析 元のデータ 加工した層 所在・品質・アクセス権を管理 保存だけで、分析基盤は完成しない
CSV・JSON・画像から保管基盤へ、用途に応じて分析する例。生データだけでなく加工した層も置ける。数値や唯一の構成を示す図ではない。
ひよこ ひよこ
データレイクって何をためる場所なの?
ペンギン先生 ペンギン先生
例えば業務データのCSV、ログのJSON、画像などをまとめて保持する基盤だよ。元の形式を残せるので、後から別の分析にも利用しやすい。データベースは必ず同じ形式しか保存できない、という区別ではないんだ。
ひよこ ひよこ
データウェアハウスとの違いは?
ペンギン先生 ペンギン先生
データウェアハウスは分析向けに構造や内容を整えたデータを扱うのが基本。データレイクは元の形式のデータも保管し、読み取るときに構造を解釈する使い方ができるよ。ただし、レイクの中にも加工したデータを置けるし、レイクを直接分析する構成もあるんだ。
ひよこ ひよこ
全部そのままためればいいの?
ペンギン先生 ペンギン先生
何があるか分からず、信頼して使えない状態はデータスワンプと呼ばれるよ。カタログで所在や意味を管理し、品質やアクセス権を整えることが大切。保存するだけでは、使える分析基盤は完成しないんだ。
ひよこ ひよこ
データの層を分けるのはなぜ?
ペンギン先生 ペンギン先生
元のデータ、用途に合わせて変換したデータ、分析向けに整えたデータを区別できるからだよ。AWSの構成例にもRaw・Transformed・Curatedの層がある。これは設計例で、全てのレイクが同じ層名や順番に従う必要はないんだ。
ひよこ ひよこ
データレイクなら必ず安くなる?
ペンギン先生 ペンギン先生
保存や加工、検索、運用などの条件で費用は変わるよ。元の形式を保持できることと、あらゆる構成で費用が下がることは別。用途に必要なデータや処理、保存期間などを決めて考えよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「データレイク」って出てきたら「さまざまなデータをため、用途に合わせて使う保管基盤」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Lake」 = データの湖
💬 lakeは「湖」。さまざまなデータをまとめて保持するイメージだよ。無計画に全てをためるという設計指示ではないんだ。

参考資料

← 用語集にもどる