大数据架构三期
大数据架构三期课程,面向企业级数据平台与实时计算架构师培养。
课程概述
三期课程覆盖离线数仓、实时计算、数据湖与湖仓一体、数据治理等核心主题,构建从采集到应用的全链路大数据工程能力。
课程亮点
- 离线数仓: Hive、Spark SQL、维度建模
- 实时计算: Flink、Kafka Streams、CEP
- 湖仓一体: Iceberg、Hudi、Delta Lake
- 数据治理: 元数据、血缘、数据质量
课程大纲
第一阶段:离线数仓建设
- 数仓分层模型:ODS / DWD / DWS / ADS
- 维度建模:星型与雪花模型
- Hive 调优与存储格式选型
- Spark SQL 大规模数据处理
sql
-- Hive 分层建表示例
CREATE TABLE dwd_order_detail (
order_id BIGINT,
user_id BIGINT,
product_id BIGINT,
amount DECIMAL(18,2),
create_time TIMESTAMP
)
PARTITIONED BY (dt STRING)
STORED AS ORC;第二阶段:实时计算引擎
- Flink 架构与流式语义
- Watermark 与窗口机制
- Kafka 高吞吐消息管道
- CEP 复杂事件处理
java
// Flink 窗口聚合示例
DataStream<Order> orders = env.addSource(new KafkaSource<>())
.keyBy(Order::getUserId)
.window(TumblingEventTimeWindows.of(Time.minutes(5)))
.aggregate(new OrderAmountAggregator());第三阶段:湖仓一体与存储
- Iceberg 表格式与时间旅行
- Hudi 增量更新与 Upsert
- Delta Lake 事务日志机制
- 统一元数据与跨引擎查询
第四阶段:数据治理与平台化
- 元数据管理与数据血缘
- 数据质量监控体系
- 权限模型与脱敏策略
- DataOps 流水线与调度平台