自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(125)
  • 收藏
  • 关注

原创 flink分区

Flink 分区是指‌‌,核心作用是决定上游数据如何路由到下游并行实例,以支持并行计算、负载均衡及状态一致性。‌‌。

2026-07-25 22:22:27 143

原创 dolphindb 内存分区表crud

在DolphinDB中,内存分区表是一种高效的存储方式,适用于快速读写操作的场景。当你需要向内存分区表新增数据时,可以使用append!函数或者insert!函数来实现。这两种方法各有特点,可以根据你的具体需求选择使用。

2026-07-25 13:09:48 153

原创 dolphindb 内存表crud

在DolphinDB中,内存表(Memory Table)是一种高效的数据结构,特别适用于快速的数据插入和查询。如果你想要向内存表中新增数据,你可以使用。语句用于向表中插入新的行。如果你知道要插入的数据,可以直接使用这个语句。通过以上方法,你可以有效地向DolphinDB的内存表中新增数据。如果你想要在表中插入数据,如果记录已存在则更新该记录,可以使用。语句,具体选择哪种语句取决于你的需求。为1的记录已存在,则更新该记录的。如果不存在,则插入新记录。例如,如果你有一个名为。

2026-07-25 12:49:54 137

原创 dolphindb 分区表crud

在DolphinDB中,如果你想要向一个分区表(partitioned table)中新增一条数据,可以使用。分区表在DolphinDB中是一种高效的数据组织方式,它可以帮助你根据时间或其它维度快速查询数据。的分区表,该表按照日期进行分区。通过以上方法,你可以有效地向DolphinDB的分区表中插入数据。如果你需要插入多条数据,使用批量插入可以提高效率。参数表示自动根据分区键将数据分散到不同的分区中。分别代表你想要插入数据的各个字段。函数用于批量加载数据到表中,其中。插入一条新的交易记录。

2026-07-25 12:20:46 196

原创 dolphindb 分布式表crud语句

在 DolphinDB 中,写入操作通常是在事务中完成的。如果你在多个操作中使用了。通过以上步骤,你可以有效地将数据写入到 DolphinDB 的分布式表中。如果你已经有了一个包含数据的表对象,你可以直接使用。首先,你需要有一个分布式表。你可以先将数据加载到本地表,然后使用。或其他修改数据的操作,确保最后调用。函数将数据追加到分布式表中。语句在分布式数据库中创建。将这个本地表转换为分布式表。你也可以使用 SQL 的。创建一个本地表,然后。

2026-07-24 22:59:45 228

原创 dolphindb 内存分区表

DolphinDB 内存分区表是‌‌,旨在通过细粒度锁机制提升并发读写性能并利用多核并行计算,‌‌且服务重启后数据丢失。‌‌。

2026-07-24 22:28:47 161

原创 dolphindb 维度表

‌存储机制‌:位于分布式文件系统(DFS)中,但‌不进行数据分区‌;查询触发时自动将全表载入内存缓存,后续访问直接读内存。‌适用场景‌:存储主数据/字典表(如股票代码映射、车间信息、参数配置),数据量通常较小(建议百万行以内),更新频率低。‌性能特点‌:支持LEFT JOIN高效打宽流表或事实表;首次加载有 I/O 开销,之后近乎零延迟;若数据持续增长未清理可能导致内存膨胀。‌限制‌:不支持分区裁剪;并发写入需配置;旧版本重启后缓存不自动释放需手动清理。‌‌。

2026-07-24 22:16:34 167

原创 dolphindb 分区表

DolphinDB 分区表是将数据按指定列(分区列)分割存储于不同分区(内存或磁盘/分布式)的大表结构,核心目的是通过‌‌提升查询效率、支持海量数据管理及并行计算。‌‌。

2026-07-24 21:53:05 191

原创 dolphindb 内存表

在 DolphinDB 中,内存表是一种非常灵活且高效的数据结构,适用于快速数据处理和实时分析。内存表的数据存储在内存中,这使得数据的读写速度非常快,但同时也意味着数据在服务器重启后会丢失。如果你需要持久化数据,可以使用持久化表(例如磁盘表或分布式表)。要创建内存表,你可以使用函数,并通过指定表的类型为TABLE来创建内存表。

2026-07-24 21:49:24 208

原创 dolphindb 分布式表

‌存储机制‌:数据落盘持久化,分布在不同数据节点的磁盘上,通过dfs://路径标识;逻辑上统一访问,物理上分片存储。‌关键优势‌:水平扩展至 PB 级容量、多副本高可用、查询自动触发 MapReduce 并行计算、支持事务 ACID 特性(v1.30.6+)。‌适用场景‌:海量时序数据(如 IoT、金融行情)、需长期持久化且单节点内存无法承载的大规模数据分析。‌‌。

2026-07-24 21:41:26 348

原创 spark driver任务调度详解

在Apache Spark中,任务调度是一个关键的组成部分,它确保了Spark作业能够在集群上高效地执行。Spark的任务调度器(Task Scheduler)主要负责将应用程序分解成任务(Task),并将这些任务分配给集群中的工作节点(Worker Nodes)执行。

2026-07-23 21:31:35 227

原创 spark核心组件

启动后,Driver 会向集群管理器(如 YARN ResourceManager 或 Standalone Master)注册应用程序,申请运行所需的资源(Executor)。一旦资源就绪,Executor 进程启动并向 Driver 反向注册,Driver 随即开始将代码逻辑转化为 Job,进而划分为 Stage 和 Task,分发到各个 Executor 上执行。负责运行用户的 main 方法,创建 SparkContext,协调整个应用的执行,负责任务划分和调度。

2026-07-23 20:19:14 223

原创 hadoop yarn调度器分配container

在Hadoop YARN中,容器(Container)是YARN用来运行应用程序的抽象单位。YARN调度器(Scheduler)负责为应用程序分配资源,包括CPU、内存等,以运行这些容器。

2026-07-23 16:49:22 157

原创 hadoop yarn文件切片配置的几种方式

在Hadoop YARN中,处理大文件或进行大数据处理时,有时需要将大文件切割成小块,以提升数据处理效率和并行度。YARN本身并不直接提供文件切分的工具,但可以通过几种方式来实现这一需求,特别是在使用MapReduce或Spark等框架时。

2026-07-23 16:15:50 242

原创 flink datastream调用8种分区策略实例

你可以实现自定义的分区逻辑,通过方法。这需要你提供一个自定义的分区器。.map(value -> value) // 示例操作// 设置并行度为8其中是一个实现了接口的类。

2026-07-23 13:20:28 188

原创 flink selector

‌。

2026-07-23 12:27:59 171

原创 kafka幂等详解

通过启用生产者的幂等性配置、合理使用键值对、避免在消息内容中包含可能导致重复的标识符,以及在需要时使用事务,可以有效地确保Kafka中的消息只被处理一次,即使在面对网络故障或服务重启的情况下也能保持消息处理的正确性和一致性。这些措施共同确保了系统的健壯性和可靠性。

2026-07-22 23:58:03 434

原创 zookeeper 节点leader选举逻辑

ZooKeeper 三节点集群中“第二个节点成为 Leader"并非固定规则,而是‌‌,因‌‌导致的选举结果。‌‌。

2026-07-22 21:18:41 312

原创 kafka消息丢失与消息重复消费

在使用Spring Boot结合Kafka时,消息丢失和重复消费是常见的问题,特别是在分布式系统中。

2026-07-22 18:28:42 236

原创 kafka broker不设置分区key,会将同一topic的消息存放到不同的分区,但读取数据不能将不同分区的数据一次性查询出来怎么解决

在使用Apache Kafka时,如果不设置分区键(partition key),Kafka 会根据消息的键(key)或消息本身的内容来决定将消息发送到哪个分区。如果没有指定消息的key,Kafka通常会采用默认的分区策略,这可能会导致消息被均匀地分配到不同的分区中。

2026-07-21 22:10:23 215

原创 flink rocksdb 配置memtable大小

在使用Apache Flink的RocksDBStateBackend时,配置RocksDB的memtable大小是一个常见的需求,特别是在处理大规模状态数据时。RocksDB的memtable是用来存储键值对数据,直到它们被写入到磁盘上的SSTable文件中的。调整memtable的大小可以影响状态更新的性能和吞吐量。

2026-07-21 19:33:53 201

原创 Flink教程(5)-Flink常用API

reduce操作实质上就是不断地将数据源中两个值合并为同一类型的一个值,reduce函数连续应用于输入数据流中的所有值,直到只剩下一个值(聚合之后的结果)。根据指定的key对流数据元素进行分区,底层基于hash算法,hashCode相同的key被分到同一个分区,即分到下游算子并行节点中的一个。作为一款通用的数据处理框架,flink既可以处理静态的历史数据集,也可以处理实时的流式数据。此外,Flink还提供了类型提取系统,自动分析函数的输入类型和输出类型,以获得对应的序列化器和反序列化器。

2026-07-21 12:35:36 243

原创 StreamExecutionEnvironment.getExecutionEnvironment()返回的环境

‌运行时的 TaskManager/JobManager 进程或网络组件,仅是‌。实际运行时资源由 Flink 集群根据此环境生成的。区分在于:IDE 本地运行时返回。(单 JVM 模拟),提交至集群时返回。‌,具体构成如下:‌‌。(携带集群配置上下文)

2026-07-21 12:16:37 145

原创 flink state实例

‌:首先,你需要定义一个状态描述符(如。

2026-07-20 23:18:05 198

原创 flink 对齐与非对齐,窗口,状态state原理详解

‌‌ 适用于需要精确控制处理时间和不希望有重叠数据的场景。‌‌ 适用于需要处理重叠数据以捕捉更复杂模式或趋势的场景。选择合适的窗口类型取决于你的具体需求,比如是否需要处理重叠数据,以及你的应用对延迟的容忍度等。在Flink中灵活使用这些窗口类型可以有效地处理各种流数据问题。

2026-07-20 14:17:58 179

原创 flink数据流中的不同分区

在使用Apache Flink进行流处理时,数据流的不同分区通常是通过并行度(Parallelism)和键控分区(Keyed Partitioning)来管理的。理解这些概念对于有效地管理和优化你的Flink作业至关重要。

2026-07-20 11:56:18 172

原创 flink Barrier原理与工作流程

Flink 的 Barrier 机制确保了即使在并行和分布式环境中,流处理的一致性和正确性也能得到保证。通过精确控制数据的同步和处理的顺序,Flink 能够高效地处理大规模的实时数据流。这种机制是 Flink 在流处理领域中实现强一致性和低延迟的关键技术之一。

2026-07-20 10:54:54 245

原创 Flink实战(10)-checkpoint容错保证

Checkpoint 能生成快照(Snapshot)。若 Flink 程序崩溃,重新运行程序时可以有选择地从这些快照进行恢复。Checkpoint 是 Flink 可靠性的基石。基于 checkpoint 机制的快照。

2026-07-20 10:35:47 189

原创 flink Task Slots and Resources详解

Apache Flink 是一个开源流处理框架,用于在内存中进行高速、高吞吐量的数据处理。在 Flink 中,任务执行涉及到多个概念,其中 Task Slots 和资源管理是核心组件。理解它们可以帮助你更好地配置和优化 Flink 作业的执行。

2026-07-19 23:34:15 90

原创 flink state记录方法

在Apache Flink中,状态(State)是处理流数据或批处理数据时非常重要的概念,它允许你在计算过程中保持和访问数据。Flink提供了多种状态后端来支持不同的状态需求,例如键控状态(Keyed State)和算子状态(Operator State)。

2026-07-19 22:49:20 168

原创 flink BackPressure 功能的持续流模型

Flink 的‌‌(Continuous Streaming Model)是其核心架构基础,而‌‌(反压)机制则是该模型在高吞吐、低延迟场景下保持稳定的关键保障。两者共同构成了 Flink 处理无限数据流的弹性能力。

2026-07-19 22:18:22 203

原创 flink窗口类型

你可以通过实现Trigger// 实现相关方法,如 onElement, onEventTime, onProcessingTime 等Flink 的窗口操作提供了极大的灵活性,允许开发者根据具体需求选择合适的时间或计数窗口,或者实现基于事件驱动的复杂逻辑。通过合理选择和使用这些窗口类型和触发器,可以有效地处理各种流数据场景。

2026-07-19 22:02:30 159

原创 flink 增量迭代与增量聚合

‌解集(Solution Set)‌:代表迭代过程中的“当前全局状态”或“已收敛结果”。初始化为输入数据集,每轮迭代后包含截至目前的最佳计算结果(如最短路径值、连通分量 ID 等),随迭代逐步逼近最终答案。‌工作集(Workset)‌:仅包含上一轮发生变化的“热点数据”(即增量部分),用于驱动下一轮计算,规模通常远小于解集。‌更新逻辑‌:步函数输出‌增量解集(Delta)‌,Flink 框架自动将其与当前解集基于指定 Key 执行‌Upsert 语义。

2026-07-19 21:15:18 197

原创 rocksdb原理

RocksDB 是 Meta(原 Facebook)开源的高性能嵌入式键值存储引擎,基于 ‌‌(日志结构合并树)架构设计,专为快速存储设备(如 SSD)优化。

2026-07-19 15:56:15 220

原创 flink的低延迟原理详解

Apache Flink 是一个开源流处理框架,旨在提供低延迟和高吞吐量的数据处理能力。为了实现低延迟,Flink 设计了一系列核心机制和原理。

2026-07-19 14:06:36 212

原创 storm Acker容错,worker容错,Supervisor容错,ZooKeeper容错

在Apache Storm的分布式计算环境中,容错机制的配置和实现是非常重要的,以确保系统的稳定性和可靠性。下面将分别介绍Storm中的几种主要容错机制:Acker容错、Worker容错、Supervisor容错以及ZooKeeper容错。

2026-07-18 16:55:11 204

原创 storm Acker机制消息重复处理

Apache Storm是一个分布式实时计算系统,它通过流处理数据。Storm中的Acker机制是用于确保消息处理的可靠性,特别是在保证exactly-once语义方面非常重要。在Storm中,Acker机制通过确认(acknowledgment)和超时(timeout)机制来防止消息的丢失或重复处理。

2026-07-18 16:22:43 197

原创 storm Tuple详解

‌本质‌:命名的值列表(Named List of Values),字段无需显式声明类型,动态解析;逻辑上类似数据库一行记录或 Key-Value 映射,但底层按‌索引顺序‌存储值列表。‌组成‌:由‌字段名(Fields)‌和‌字段值(Values)‌构成,支持基本类型(int, long, double, boolean, string 等)、字节数组及实现接口的自定义对象。‌定位。

2026-07-18 14:22:58 294

原创 storm核心实时机制

Apache Storm 的实时性指其‌‌,通过常驻内存计算、零磁盘 I/O 交互及 ACK 机制保障数据可靠流转。‌‌。

2026-07-18 13:22:27 201

原创 storm 实时性

在Storm中,每个组件(例如Spout或Bolt)都可以有自己的本地状态。这意味着每个组件实例可以维护自己的数据集,例如缓存数据、计数器、临时结果等。这些状态是本地化的,即每个组件的实例在自己的JVM(Java虚拟机)中管理其状态,而不是通过远程调用进行管理。

2026-07-18 13:15:53 163

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除