データ基盤はなぜ作り直されてきたか
業務のデータを分析に使うには、なぜ専用の基盤が要り、その形はなぜ何度も作り直されてきたのか
- 到達点
- データウェアハウス、データレイク、クラウドのデータウェアハウス、レイクハウスといった基盤を、「どこに置くか・どう計算するか・どう正しさを保つか」という繰り返し現れる問題への一つの答えとして読み、それぞれが何を得て何を諦めたかを説明できる状態
- 扱わないこと
- 個別製品の機能と操作は扱わない(Databricks・Snowflake・BigQuery・Iceberg の各シリーズで扱う)/製品の優劣の比較は扱わない(別の単発記事で扱う)/ストリーム処理の詳細と機械学習の基盤は扱わない(終章で位置づけだけを示す)
- OLTPとOLAPを、なぜ別々のデータベースで動かすのか
注文の登録のような業務の処理と売上の集計のような分析は、一回に触るデータの量が桁で違い、同じ資源で動かすと分析が業務の処理を遅らせる。分けると業務は守れるが、分析は遅れたコピーを読む。両方を一つで扱う HTAP でも、干渉を小さく抑えた設計は分析用のコピーを別に持つ。
- 第2回準備中