← 全部专题

6 篇公开文章

大数据与数据工程

从业务事件接入、分析表和批处理,到实时计算、批流对账与故障恢复,用六篇文章与真实组件实验构建可信指标。

系列阅读

  1. 大数据专题(一):从业务数据库到数据平台,一条分析链路如何形成

    以视频播放事件为主线,拆解事务与分析、批处理与流处理的职责,先建立指标口径和可核对的参考答案,再连接 Kafka、Spark、Flink 与 Iceberg。

  2. 大数据专题(二):Kafka 数据接入,分区、消费进度与可靠重放

    从视频播放事件的接入与积压出发,理解分区键、消费位置、提交顺序和幂等边界,用真实 Kafka 实验观察恢复消费与主动回放。

  3. 大数据专题(三):从文件到分析表,Parquet、数仓分层与 Iceberg

    用同一批播放事件观察列式文件与分析表的不同职责,串起事实与维度、数仓分层、分区裁剪、小文件、Schema 演进和历史快照查询。

  4. 大数据专题(四):Spark 批处理,一条 SQL 如何变成分布式计算

    沿着播放明细关联视频维度的执行过程理解 Stage、Task、Shuffle、Join 和 AQE,用百万条热点数据观察真实计划与运行指标。

  5. 大数据专题(五):Flink 实时计算,乱序事件如何得到正确结果

    用真实 Kafka 与 Flink 链路观察事件时间、Watermark、窗口更新、状态与 Checkpoint,验证迟到事件和 TaskManager 故障后的结果。

  6. 大数据专题(六):让指标可信,批流对账、历史补数与故障恢复

    把 Kafka、Spark、Flink 和 Iceberg 实验串成可验证的数据链路,明确实时与离线口径,完成缺失检测、历史补数、幂等重跑和结果验收。