- 博客(87)
- 收藏
- 关注
原创 数据湖表格式三剑客:Hudi vs Iceberg vs Paimon 深度解析与选型指南
Hudi/Iceberg/Paimon 是当前数据湖表格式最主流的三个开源方案,本文将从架构设计、核心机制、适用场景等方面进行剖析对比,给出场景选型建议。
2026-06-25 18:46:58
350
原创 浅聊Flink实时关联计算的不适用场景
Flink计算引擎已成为大数据实时计算领域的事实标准,还有哪些应用场景不适合使用Flink进行实时加工与关联计算?本文将简单介绍、剖析以及选型推荐。
2026-06-24 19:11:19
645
原创 告别数据重复与丢失:Flink Exactly-Once 原理解析
在流式计算领域,“如何保证数据不丢不重”一直是技术攻坚的核心难题。本文将从背景动机出发,深入剖析 Flink exactly-once 的核心原理、Checkpoint Barrier 对齐机制、端到端 exactly-once 的实现路径。
2026-05-31 23:39:22
736
原创 告别 Lambda 架构!Flink 批流一体底层原理解析
本文将深入剖析 Flink 批流一体的底层机制,Flink 以“批是流的特例(有界流)”为核心理念,通过 DataStream API 和 SQL 的全面统一,实现了真正意义上的“批流一体”。
2026-05-29 18:49:39
441
原创 Flink技术实践-90%都会踩的状态坑
Flink状态管理是有状态计算的核心,但80%的线上故障与其相关。本文从状态管理的本质出发,系统拆解Flink状态管理的核心机制,汇总生产环境中最常见的五大坑点,提供可落地的调优方案,并对实时场景下状态管理的演进方向进行展望。
2026-04-06 23:38:07
1364
原创 Bitmap 与布隆过滤器:大数据场景下的原理与取舍
Bitmap 和布隆过滤器都利用 bit 级表示来降低存储成本,Bitmap 适合精确表示整数集合,尤其适合 ID 连续或可压缩映射的场景,布隆过滤器适合大规模存在性判断,尤其适合快速排除不存在的数据。
2026-08-04 19:11:14
90
原创 浅析StarRocks 表设计:表类型、分布策略与索引
StarRocks 表设计的关键,不是记住每个 DDL 参数,而是建立“写入语义 → 数据分布 → 索引裁剪”的链路思维。表类型回答数据如何进入和更新,分区分桶回答数据如何落盘和并发扫描,排序键与索引回答查询如何少读数据。
2026-08-03 18:21:37
333
原创 读懂 StarRocks 架构:FE、BE、CN 与 MPP 查询链路协同
StarRocks 是新一代高性能 MPP数据库,本文将从工程实践角度,系统拆解 StarRocks 的 FE、BE、CN三大核心节点,深入元数据管理机制、列式存储引擎,以及 MPP 执行链路流程。
2026-08-01 16:55:08
346
原创 Starrocks架构特性与OLAP选型
StarRocks 是一款面向实时分析场景的高性能 MPP(大规模并行处理)OLAP 数据库,本文从技术架构、核心特性等维度进行介绍,并横向对比ClickHouse/Doris/Trino等主流引擎,提供OLAP选型指南。
2026-07-30 23:38:02
369
原创 为什么越来越多团队把 StarRocks 作为实时分析底座
StarRocks 作为实时分析底座,越来越受欢迎,核心原因不是“又多了一个 OLAP 引擎”,而是它刚好踩中了实时数仓现在最痛的几个点:数据要新、查询要快、并发要稳、建模不能太折腾、成本还得可控。
2026-07-29 23:29:20
172
原创 Hudi + StarRocks 查询加速:原理与实践
StarRocks + Hudi的组合为Lakehouse架构提供了一条高效的查询加速路径:通过External Catalog实现零ETL接入,配合物化视图和Data Cache提升热点查询性能。
2026-07-27 22:09:02
384
原创 Hudi技术内幕:Clustering原理与实践
Hudi 作为数据湖领域的核心开源框架,其Clustering(聚簇)功能是优化查询性能的关键手段,本文将深入剖析Clustering的执行原理和调度机制,并结合生产经验给出最佳使用实践。
2026-07-22 18:12:28
352
原创 Hudi技术内幕:Compaction原理与实践
Compaction 作为 Hudi 的核心 Table Service,负责将 Delta Log 与 Base File 合并,是平衡读写性能的关键机制,本文将介绍Compaction原理与实践。
2026-07-21 18:02:47
362
原创 Flink DataStream API 进阶使用与避坑指南
window/watermark/state作为Flink DataStream API 进阶必备特性,本文将详细介绍对应使用以及常见踩坑点。
2026-07-20 18:13:40
369
原创 Flink DataStream API多流操作与实践
Flink DataStream 多流操作主要包括 union、connect、广播流、窗口 Join、Interval Join、CoGroup 和 Side Output,本文将逐一介绍。
2026-07-19 17:51:31
319
原创 深入浅出 Flink DataStream API:原理与使用
Apache Flink 的 DataStream API 是构建有状态流处理应用的核心编程接口,提供了更细粒度的控制能力,适合处理复杂事件驱动、自定义状态逻辑及精确时间语义等场景。
2026-07-18 09:23:15
355
原创 聊聊Flink的几种血缘方案
数据血缘是实时数据治理的核心能力,能够追踪数据从产生、流转到消费的完整链路,本文简单介绍FLink作业从代码编写到提交运行过程中不同阶段实现的几种血缘方案。
2026-07-16 18:38:11
379
原创 主流CDC 组件对比选型指南
变更数据捕获(CDC)是构建实时数据管道的核心技术,本文将对比介绍4款主流的CDC组件特性与使用场景,并给出不同场景选型建议。
2026-07-15 23:03:34
353
原创 Flink CDC 深度解析:从原理到实践的全链路指南
Flink CDC(Change Data Capture)是 Apache Flink 生态中面向实时数据集成的核心组件,它通过捕获数据库的增量变更,实现了低延迟、高可靠的端到端数据同步。本文将从 CDC 技术背景出发,深入剖析 Flink CDC 的架构设计与核心算法(增量快照算法),全面对比其优缺点与适用场景。
2026-07-14 18:04:38
779
1
原创 Hudi技术内幕:Schema Evolution原理与实践
Schema Evolution(表结构演变)是数据湖场景中不可回避的核心能力,本文将介绍Hudi Schema Evolution提供的能力、机制原理与实践。
2026-07-10 17:33:31
340
原创 Hudi技术内幕: Concurrency Control原理与实践
Hudi在多并发场景下提供并发控制能力来保障数据一致性与读写稳定性,本文将详细介绍Hudi的Concurrency Control机制原理与使用建议。
2026-07-09 18:29:35
351
原创 Hive卸数至HBase:Spark反而比MapReduce慢?
Hive数据批量卸数到Hbase,MR与Spark谁更高效,结果会让你出乎意料,本文将对比介绍MR与Spark在Hive卸数HBase场景下的机制原理。
2026-07-08 19:37:47
468
原创 深入解读Flink UI 的 DAG 图
Flink Web UI 的 DAG 图不仅仅是一个"好看的拓扑图",它是理解作业运行机制的核心入口,本文将逐层解析 DAG 视图的数据来源与结构含义。
2026-07-07 17:08:07
350
原创 Flink JDBC Connector 深度解析:从原理到最佳实践
Flink JDBC Connector作为流批一体架构中的关键组件,是连接流处理引擎与关系型数据库的核心桥梁,广泛应用于实时数仓写入、维表关联查询、CDC数据同步等场景,本文将详细介绍原理与实践。
2026-07-03 14:46:30
230
原创 Flink DataStream API vs Flink SQL:核心异同对比
Flink SQL 与 DataStream API 在适用场景上各有千秋,本文将从多维度对比分析二者的异同与选型使用。
2026-07-02 23:19:57
646
原创 Flink SQL 从编写到提交运行的全过程解析
相比DataStream API直接构建Transformation的方式,FlinkSQL在前端多了一整套基于Calcite的查询优化体系,本文将完整拆解FlinkSQL的编译执行链路。
2026-07-01 23:48:06
382
原创 Flink 作业图演变全解析:从用户代码到物理执行图
从用户代码到物理执行图,Flink经历四个关键阶段的图转换,理解这四层转换,能帮助我们在正确的层次做正确的事情:在代码层设置好 UID 和语义、在 JobGraph 层理解链化逻辑以排查性能、在 ExecutionGraph 层配置容错策略、在物理层调优网络和资源。
2026-06-30 22:57:06
370
原创 Flinksql内置函数不够用?一文弄懂UDF
Flink SQL 自定义函数是连接"SQL 声明式表达能力"与"Java/Scala 过程式编程灵活性"的桥梁,本文将介绍 Flink SQL 自定义函数的内部机制原理与使用建议。
2026-06-29 19:29:58
247
原创 Hudi Metadata Table 与 Hive Sync (HMS)怎么选?
Hudi开启了Hive Sync是不是就不需要Metadata Table了?两者是否有重复、冲突?本文将介绍二者的关系与实践指南。
2026-06-28 16:36:58
773
原创 Hudi技术内幕:Metadata Table原理与实践
Metadata Table的设计哲学——将元数据作为一等公民来管理,将原本散落在文件系统中的元信息聚合为一张高效可查的MOR表,显著提升了查询规划(Query Planning)速度和写入效率。
2026-06-27 22:42:56
316
原创 Hudi技术内幕:深入解析Index索引机制
Hudi 通过索引机制,将"查找记录位于哪个文件"这一操作的复杂度从O(N)(全文件扫描)降低到O(1)或O(logN),本文将深入剖析 Hudi 索引的工作原理、各类索引的实现机制与对比选型。
2026-06-26 19:20:00
337
原创 深入解析 Flink Kafka Connector:原理、配置与最佳实践
Flink Kafka Connector是使用最广泛的连接器之一,是连接Flink与Kafka的桥梁,本文将深入剖析Connector的内部原理,详解关键配置项,并结合生产实践给出调优建议。
2026-06-23 18:28:26
572
原创 Hudi技术内幕:RecordPayload到RecordMerger
Hudi的Record Payload机制是实现数据增量处理、去重合并的关键抽象,本文将介绍Record Payload的核心机制原理、不同实现类型的适用场景,以及最佳实践。
2026-06-22 18:49:31
363
原创 Hudi技术内幕:Key Generation原理与实践
Key Generation作为Hudi数据湖表的基础能力,贯穿于数据写入、索引、查询优化的全链路,本文将介绍Hudi中Key Generation、KeyGenerator以及生产实践。
2026-06-21 17:55:29
166
原创 深入理解Flink类型:从TypeInformation到DataType
本文将深入剖析Flink的两套类型体系:服务于DataStream/DataSet API的TypeInformation,以及服务于Table API & SQL的DataType。
2026-06-18 18:06:29
366
原创 Flink Connector Formats深度解析:从原理到实践
Flink通过Connector + Format分层设计实现了关注点分离,连接器管理 I/O,Format 管理编解码;本文将介绍Flink Connector Formats的设计背景、核心原理以及Formats 配置使用。
2026-06-16 19:06:49
403
原创 Hudi技术内幕:Write Operations 深度解析
Hudi作为数据湖领域的核心组件,Write Operations是决定数据写入行为、性能和一致性的关键配置,本文将深入剖析 Hudi Write Operations的工作机制与最佳实践建议。
2026-06-14 22:09:33
380
原创 Flink Resource Providers 深度解析:机制原理、部署模式与最佳实践
Flink Resource Providers是连接Flink计算引擎与底层基础设施的关键纽带,本文将系统性地剖析 它的核心原理、分类详解、部署模式与场景实践。
2026-06-12 18:26:32
427
1
原创 Hudi技术内幕:Query Types全解析
本文介绍了Hudi提供的五种查询类型,为不同数据场景提供灵活视图:Snapshot、ReadOptimized、Incremental、TimeTravel、CDC,以及各自特性、选型与实践。
2026-06-10 19:11:34
169
原创 Hudi技术内幕:Table Types全解析
Hudi 提供两种表类型:COW表是「写时付出代价,读时直接享受」的策略,适合写入频率较低但对查询性能要求高的场景;MOR表是「写时快速追加,读时按需付出」的策略,适合高频写入且可以通过 Compaction 策略平衡读写的场景。
2026-06-09 18:32:08
249
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅