大数据专题(五):Flink 实时计算,乱序事件如何得到正确结果
用真实 Kafka 与 Flink 链路观察事件时间、Watermark、窗口更新、状态与 Checkpoint,验证迟到事件和 TaskManager 故障后的结果。
按发布时间倒序排列。
共 6 篇文章 · 当前 1–6 篇
用真实 Kafka 与 Flink 链路观察事件时间、Watermark、窗口更新、状态与 Checkpoint,验证迟到事件和 TaskManager 故障后的结果。
从视频播放事件的接入与积压出发,理解分区键、消费位置、提交顺序和幂等边界,用真实 Kafka 实验观察恢复消费与主动回放。
用同一批播放事件观察列式文件与分析表的不同职责,串起事实与维度、数仓分层、分区裁剪、小文件、Schema 演进和历史快照查询。
以视频播放事件为主线,拆解事务与分析、批处理与流处理的职责,先建立指标口径和可核对的参考答案,再连接 Kafka、Spark、Flink 与 Iceberg。
把 Kafka、Spark、Flink 和 Iceberg 实验串成可验证的数据链路,明确实时与离线口径,完成缺失检测、历史补数、幂等重跑和结果验收。
沿着播放明细关联视频维度的执行过程理解 Stage、Task、Shuffle、Join 和 AQE,用百万条热点数据观察真实计划与运行指标。