- 博客(392)
- 收藏
- 关注
原创 StarRocks StreamLoad 持续写入导致 be 内存增长
背景:Flink 消费 Kafka 通过 StreamLoad 持续写入 StarRocks,be 节点内存持续增长直至到达 be进程内存资源上限,任务中断。
2026-06-28 12:15:40
317
原创 Data row is smaller than a column index, internal schema representation is probably out of sync with
背景: FlinkCDC 任务异常,业务新增字段。
2026-06-22 20:34:14
257
原创 SQL json_table 行转列方法
是 LATERAL JOIN 语义——左侧每一行,右侧展开出多行。json_table 摊开 JSON 数组。把逗号字符串转成 JSON 数组。数据源、遍历粒度、输出列。JOIN 形成最终结果。
2026-06-04 12:10:35
223
原创 Paimon Lookup Join 详解
Paimon Lookup Join 是一种基于快照查询的维表关联方式,专为 Paimon 的 LSM 存储特性设计。它采用请求-响应模式,当主表数据到达时触发对维度表的点查询,返回维度表最新快照数据,而非实时关联。维度表需配置 merge-engine 为 deduplicate 或 partial-update,且 changelog-producer 必须设为 lookup。查询延迟取决于 compaction 频率,通过参数可控制是否等待 compaction 完成。相比传统双流 Join,Look
2026-05-23 09:22:06
470
1
原创 一个问题给到大模型经历了哪些?
请教一下:一个问题给到你,会发生什么请详细介绍一下中间过程这个问题问得很好——从你按下发送键到我回复出现在屏幕上,中间发生了一整条精密的流水线。我拆成:Hermes Agent 层(工程调度)和 LLM 推理层(模型计算),层层剥开。
2026-05-20 14:54:00
70
原创 docker mysqld: Can‘t create/write to file ‘/tmp/ibOrYaxI‘ (OS errno 13 - Permission denied)
mysql 容器恢复启动异常。新指定挂载空临时目录文件。
2026-04-20 16:39:37
49
原创 You can‘t specify target table ‘xxx‘ for update in FROM clause
因为在 DELETE 语句的子查询中直接引用了要删除的同一张表,MySQL 不允许这种操作。
2026-04-14 10:52:07
29
原创 “specify container image platform“ requires API version 1.41, but the Docker daemon API version is 1
【代码】“specify container image platform“ requires API version 1.41, but the Docker daemon API version is 1。
2026-02-10 17:41:09
59
原创 同步异常: Incorrect datetime value: ‘1970-01-01 00:00:00‘ for column ‘xxxx‘
【代码】Data truncation: Incorrect datetime value: ‘1970-01-01 00:00:00‘ for column ‘first_recharge_time‘
2026-01-23 18:31:57
590
原创 window java.lang.UnsatisfiedLinkError: org.apache.hadoop.io.nativeio.NativeIO$POSIX
spark window 本地任务异常
2026-01-08 11:48:34
98
原创 Paimon changelog-producer 与 merge-engine
Paimon表的changelog-producer用于生成数据变更日志,支持四种模式:None、Input、Lookup和full-compaction。None模式不存储额外数据,适用于批处理场景;Input模式直接传递输入消息,适合数据库binlog场景;Lookup模式查找旧值生成完整变更日志,适合有计算逻辑的表;full-compaction模式在完全合并文件时生成变更日志,代价较高。不同模式根据业务需求选择,以平衡时效性和资源开销。
2025-11-04 12:14:33
446
原创 dolphinscheduler 依赖节点不通过
dolphinscheduler 节点依赖,某个依赖报依赖不通过。master、worker、 api 程序执行添加。但 ds 所在的服务器时间是正确的。
2025-08-13 14:42:05
278
原创 DWS层新增指标处理方案
业务逻辑确认: 与业务方或需求方深入沟通,清晰定义新指标的计算公式、统计口径(维度、粒度)、业务含义、是否允许为空、默认值是什么。数据来源确认: 确定计算该指标所需的最细粒度数据来源:是否完全依赖现有 DWS 层数据即可计算?(最理想情况,影响最小)是否需要依赖 DWD (Data Warehouse Detail) 层的明细数据?(需要向下追溯)是否需要依赖 ODS (Operational Data Store) 层或其他外部数据源?(影响较大,需评估数据质量和接入)历史数据要求。
2025-06-12 18:11:31
907
原创 记一次 Starrocks be 内存异常宕机
突发性 be 内存飙高,直至被系统 kill 掉,be 内存如下:其中指标打满,重启也是如此看到被 kill 了每次重启 be 都会去拉起 tablet: 3544744及。
2025-05-29 16:20:53
1295
原创 StarRocks 异常 Table creation timed out.
【代码】StarRocks 异常 Table creation timed out.
2025-04-22 16:16:48
330
原创 SparkSQL query optimization
Spark, in recent years, has become the go-to distributed computation framework for a lot of different use cases. From only providing map-reduce funtionalities, it has introduced other modules: from machine learning, to graph data, to SQL.Today we will focu
2025-03-02 17:56:54
1245
转载 揭露数据不一致的利器 —— 实时核对系统
随着企业业务发展,以及微服务化大趋势下单体服务的拆分,服务间的通信交互越来越多。与单体服务不同,微服务间的数据往往需要通过额外的手段来保障一致性,例如事务消息、异步任务补偿等。除了从机制上最大程度保障以外,如何观测并及时发现数据不一致也非常重要。本文介绍 Shopee Financial Products 团队设计和开发的实时核对系统(Real-time Checking System)
2025-03-02 11:02:17
402
翻译 Recommender System using ALS in Pyspark
【代码】Recommender System using ALS in Pyspark。
2024-09-12 01:59:19
299
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅