CDCが必要な理由と核心原理
バッチ方式とupdated_atベースの増分収集の限界を確認し、 CDCがデータ変更をより迅速かつ正確に追跡できる理由を理解します。
- Insert・Update・Delete変更イベントの収集
- BatchとCDCの違い
- 分析、検索同期、監査ログなどの実務での活用事例
DebeziumベースのCDCを初めて学び、どこから始めればよいか途方に暮れている方のための講座です。 MySQLの変更データをKafkaにリアルタイムで収集し、PostgreSQLまで転送する全プロセスを実際に手を動かして学習します。 CDCの基本原理から設定、運用のノウハウまで身につけ、リアルタイムデータパイプラインを自ら構築できるようになります。
2名 が受講中です。
難易度 初級
受講期間 無制限
MySQL–Debezium–Kafka–PostgreSQL リアルタイムCDCパイプラインの完成
Debezium MySQL Connectorの運用
運用データは絶えず変化しているのに、毎回テーブル全体を検索していますか? データベースの変更をリアルタイムに近い形で検知し、伝達する CDC(Change Data Capture)の基本原理から実際の構築まで、段階的に扱います。
単に設定値を入力するだけでは終わりません。 なぜCDCが必要なのか、各コンポーネントがデータをどのように伝達するのか、 運用時には何を考慮すべきかを学びます。what needs to be considered in operations.
概念を理解したうえで実際に構成し、最後には運用の観点までつなげます。
バッチ方式とupdated_atベースの増分収集の限界を確認し、 CDCがデータ変更をより迅速かつ正確に追跡できる理由を理解します。
CDCの出発点となるMySQL Binlogの構造と変更データの記録方式を学び、Debeziumがこれをどのように読み取るのかを流れに沿って学習します。
Kafkaが変更イベントを安定して保存・伝達する仕組みと、Kafka ConnectがSourceとSinkを接続する構造を学びます。
Docker Composeベースのローカル環境で、変更データがPostgreSQLまで 伝達される一連のパイプラインを自ら構築します。
パイプラインを一度実行するだけにとどまらず、運用環境で必要となるSnapshot、Offset、メッセージ変換、障害復旧のシナリオを扱います。
大規模サービスのデータフローを設計・運用してきた現役データエンジニアです。
機能を列挙するのではなく、なぜこの構造を選択するのか、どこで問題が発生しやすいのか、データエンジニアならどのような視点で問題を解決すべきなのかに重点を置いています。
以下の環境と基本概念を準備しておくと、実習をよりスムーズに進められます。
CDCを初めて学ぶ方から、実務のパイプラインを拡張したい方まで、一緒に学べます。
学習対象は
誰でしょう?
DebeziumとCDCに初めて触れ、何から勉強すればよいのか途方に暮れている開発者
バッチ収集の遅延とデータ欠損の問題をリアルタイムパイプラインで解決したいデータエンジニア
Kafkaを学んだものの、実際のデータパイプラインを最初から最後まで構築したことがない方
前提知識、
必要でしょうか?
ローカル実習のためのDockerとGitの基本的な使い方
KafkaのTopic、Partition、Producer、Consumerなどの基本概念
全体
48件 ∙ (5時間 10分)
1. 講義紹介
00:56
2. CDCとは何か
01:37
3. 実習するCDCパイプラインの構造
01:53
4. 実習環境
03:56
5. Batch方式の限界
02:14
7. バッチ VS CDC
01:53
同じ分野の他の講座を見てみましょう!
期間限定セール
¥825,458
50%
¥9,797