Skip to content

大数据架构三期

大数据架构三期课程,面向企业级数据平台与实时计算架构师培养。

课程概述

三期课程覆盖离线数仓、实时计算、数据湖与湖仓一体、数据治理等核心主题,构建从采集到应用的全链路大数据工程能力。

课程亮点

  • 离线数仓: Hive、Spark SQL、维度建模
  • 实时计算: Flink、Kafka Streams、CEP
  • 湖仓一体: Iceberg、Hudi、Delta Lake
  • 数据治理: 元数据、血缘、数据质量

课程大纲

第一阶段:离线数仓建设

  • 数仓分层模型:ODS / DWD / DWS / ADS
  • 维度建模:星型与雪花模型
  • Hive 调优与存储格式选型
  • Spark SQL 大规模数据处理
sql
-- Hive 分层建表示例
CREATE TABLE dwd_order_detail (
    order_id     BIGINT,
    user_id      BIGINT,
    product_id   BIGINT,
    amount       DECIMAL(18,2),
    create_time  TIMESTAMP
)
PARTITIONED BY (dt STRING)
STORED AS ORC;

第二阶段:实时计算引擎

  • Flink 架构与流式语义
  • Watermark 与窗口机制
  • Kafka 高吞吐消息管道
  • CEP 复杂事件处理
java
// Flink 窗口聚合示例
DataStream<Order> orders = env.addSource(new KafkaSource<>())
    .keyBy(Order::getUserId)
    .window(TumblingEventTimeWindows.of(Time.minutes(5)))
    .aggregate(new OrderAmountAggregator());

第三阶段:湖仓一体与存储

  • Iceberg 表格式与时间旅行
  • Hudi 增量更新与 Upsert
  • Delta Lake 事务日志机制
  • 统一元数据与跨引擎查询

第四阶段:数据治理与平台化

  • 元数据管理与数据血缘
  • 数据质量监控体系
  • 权限模型与脱敏策略
  • DataOps 流水线与调度平台