自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(156)
  • 收藏
  • 关注

原创 Doris专题31-SQL手册-基础元素

指代数据库对象(表、列、索引等)的名称。若标识符包含特殊字符或为保留关键字,必须用反引号 (

2026-04-20 20:30:06 460

原创 Doris专题30-共用表与列转行

特性公用表表达式 (CTE)列转行 (Lateral View)核心目的逻辑组织:提升 SQL 的可读性和维护性数据形态转换:将列(集合)转换为行关键语法LATERAL VIEW 函数名 AS ...主要搭配配合复杂的SELECT子查询配合生成器函数(如EXPLODE数据量影响通常不改变行数(除非子查询本身聚合)通常增加行数(一行变多行)Doris 限制不支持递归 CTE需注意列别名数量匹配。

2026-04-20 19:48:15 261

原创 Doris专题29-分析函数

要素说明关键语法分区 (Partition)将结果集划分为多个组(行组),函数独立应用于每个组。排序 (Order)定义分区内的行顺序。对于RANKLAG等函数至关重要。窗口范围 (Frame)定义当前行周围的行范围(滑动窗口)。当前行 (Current Row):计算的基准点。窗口滑动累积计算:起始行固定,结束行滑动到当前行(如移动平均:起始和结束行都随当前行滑动(如。

2026-04-20 19:41:16 398

原创 Doris专题28-聚合多维分析

定义:指定特定维度组合进行汇总,比 ROLLUP/CUBE 更灵活。适用场景:仅需部分维度组合时,避免计算不必要的汇总,提升效率。示例会生成:年+品类年仅总计功能适用场景优势ROLLUP层级汇总(如时间、地理)简洁,避免冗余汇总CUBE全维度组合分析(如市场调查)覆盖所有可能组合自定义部分维度组合(如仅需年+品类)灵活,减少计算资源消耗。

2026-04-18 16:52:42 246

原创 Doris专题27-mysql兼容性与join连接

Apache Doris高度兼容MySQL协议和语法,但存在一些重要差异。理解这些差异对于从MySQL迁移到Doris或进行混合部署至关重要。fill:#333;color:#333;color:#333;fill:none;JOIN类型INNER JOINLEFT JOINRIGHT JOINFULL JOINCROSS JOIN返回匹配行左表全量 + 右表匹配右表全量 + 左表匹配左右全量合并笛卡尔积存在匹配则返回左表行存在匹配则返回右表行无匹配则返回左表行。

2025-12-07 17:44:34 1322

原创 Doris专题26-数据导出

特性EXPORTMySQL Dump执行方式同步异步同步SQL支持支持任意SQL不支持Select结果集不支持导出分区支持支持不支持并发导出支持(受SQL限制)支持(Tablet粒度)不支持数据格式MySQL专有格式导出位置S3, HDFS, 本地S3, HDFS, 本地本地适用场景复杂计算、同步任务大数据量单表、异步任务兼容MySQL生态、小数据量数据交换/迁移:使用SELECT INTO OUTFILE或EXPORT,输出开放格式MySQL兼容。

2025-12-07 11:13:35 929 1

原创 Doris专题25-事务

fill:#333;color:#333;color:#333;fill:none;成功失败事务开始执行SQL语句执行结果?提交事务回滚事务数据持久化数据恢复原状事务特性:原子性:操作要么完全成功,要么完全失败一致性:保证数据从一个一致状态转换到另一个一致状态隔离性:多个事务并发执行时互不干扰持久性:事务提交后数据永久保存。

2025-10-24 11:45:00 990

原创 Doris专题24- 数据删除

删除方式适用场景性能特点数据恢复DELETE 语句条件删除、小范围删除受数据量影响,生成新版本不可恢复TRUNCATE清空表或分区元数据操作,速度快不可恢复删除标记批量删除、CDC同步高性能,逻辑删除逻辑删除可查询分区删除过期数据清理极快,元数据操作不可恢复临时分区替换原子覆盖写原子性,无数据缺失替换后不可恢复。

2025-10-22 09:00:00 2174

原创 Doris专题23- 数据更新-主键与聚合模型

特性主键模型聚合模型明细模型行级更新✅ 支持❌ 不支持❌ 不支持部分列更新✅ 支持❌ 不支持删除支持并发控制✅ 有限支持✅ 有限支持或。

2025-10-21 18:15:00 782

原创 Doris专题22- 数据更新-概述

部分列更新存在“读放大”和“写放大”,建议使用 SSD 硬盘并开启行存以减少随机 IO。Apache Doris 提供三种表模型,分别适用于不同的业务场景和更新需求。查询时过滤 DORIS_DELETE_SIGN=0。后台 Compaction 物理清理。

2025-10-20 22:02:52 1167

原创 Doris专题21- 数据导入-高并发导入优化

事务开销大:每个导入都创建独立事务,需要FE解析SQL和生成执行计划版本爆炸:每个导入生成新版本,增加后台compaction压力资源浪费:频繁的小批量导入导致系统资源利用率低性能提升:小批量导入性能提升10-15倍资源优化:减少FE解析开销和版本数增长扩展性:支持更高并发写入场景。

2025-10-18 12:00:00 1074

原创 Doris专题20- 数据导入-导入时数据转换

Apache Doris 在数据导入时提供了强大的数据转换能力,可以简化 ETL 流程,减少对外部工具的依赖。

2025-10-17 13:15:00 665

原创 Doris专题19- 数据导入-异常数据处理与导入高可用

多数派写入:平衡数据可靠性和系统可用性最小写入副本数:提高系统在部分节点故障时的可用性多层次保障:结合重试、负载均衡、事务机制。

2025-10-16 06:15:00 1118

原创 Doris专题18- 数据导入-复杂数据类型

Apache Doris 支持多种复杂数据类型,用于处理半结构化数据、集合数据和特殊场景数据。这些数据类型扩展了传统关系型数据库的能力,使其能够更好地适应现代数据分析需求。灵活性:VARIANT和JSON类型处理半结构化数据集合操作:ARRAY、MAP、STRUCT类型处理复杂数据结构高效统计:HLL和BITMAP类型优化特定计算场景。

2025-10-15 08:15:00 944

原创 Doris专题17- 数据导入-文件格式

Apache Doris 支持多种文件格式的数据导入,每种格式都有其特定的使用场景和配置参数。本笔记详细记录了 ORC、Parquet、JSON 和 CSV 格式的导入方法和最佳实践。结构化数据:优先选择 ORC 或 Parquet,性能最佳半结构化数据:使用 JSON,支持灵活的数据结构通用表格数据:使用 CSV,兼容性最好大数据量:ORC/Parquet + 压缩,节省存储和带宽。

2025-10-14 16:30:00 1746

原创 Doris专题16- 数据导入-MySQL Load

MySQL Load 是 Apache Doris 中一种同步导入方式,通过 MySQL 协议的LOAD DATA语法导入本地文件。小规模数据快速导入需要同步确认结果的场景从 MySQL 生态迁移的用户。

2025-10-13 14:30:00 1209

原创 Doris专题15- 数据导入-insert into

直接插入具体数值:通过查询结果插入数据。

2025-10-12 14:30:00 1395

原创 Doris专题14- 数据导入-Routine Load

Routine Load 是 Apache Doris 提供的流式数据导入方式,用于持续消费 Kafka Topic 中的数据。

2025-10-11 06:00:00 827

原创 Doris专题13- 数据导入-Broker Load

Broker Load 是 Apache Doris 提供的一种异步数据导入方式,通过 MySQL API 发起,Doris 会主动从远程存储系统拉取数据。

2025-10-10 08:15:00 1106

原创 Doris专题12- 数据导入-Stream Load

Stream Load 是 Apache Doris 提供的一种同步数据导入方式,通过 HTTP 协议将本地文件或数据流导入到 Doris 中。

2025-10-09 11:00:00 1038

原创 Doris专题11- 数据导入概览

场景特征推荐方案备选方案注意事项实时应用写入控制并发数,避免FE压力Kafka实时流根据数据格式选择Flink流处理原生集成,性能最佳本地大文件多文件并发上传HDFS批量数据TVF方式适合TB级数据CDC数据同步Flink CDC支持DELETE操作外部数据源灵活查询过滤。

2025-10-08 22:15:00 893

原创 Doris专题10- 数据库建表最佳实践

fill:#333;color:#333;color:#333;fill:none;有更新无更新需要预聚合原始数据查询业务需求数据更新需求Unique模型聚合需求Aggregate模型Duplicate模型开启写时合并选择合适的聚合函数优化前缀索引。

2025-10-08 08:45:00 1492

原创 Doris专题9- 行列混存和冷热数据分层

存储方案适用条件核心特性成本效益性能特点存算分离具备部署条件• 数据单副本存对象存储• 本地缓存加速• 存储计算独立扩展存储成本显著降低热数据缓存加速,冷数据直接访问本地分层存算一体模式• SSD→HDD自动迁移• 利用本地存储层级节省高性能存储成本热数据SSD高性能,冷数据HDD低成本远程分层存算一体模式• 冷数据→对象存储/HDFS• 热数据本地存储进一步降低成本热数据本地访问,冷数据远程读取行列混存:优化点查性能,解决宽表IOPS瓶颈远程存储。

2025-10-07 20:00:00 979 4

原创 Doris专题8- 自增列和Schema变更

唯一性管理:系统生成值保证唯一,用户指定值需自行管理唯一性分页优化:深分页场景优先使用自增列替代OFFSET方案字典编码:用户画像场景中自增列可优化Bitmap存储性能模型选择:根据业务需求选择Duplicate或Unique模型。

2025-10-07 14:15:00 414

原创 Doris专题7- 索引

fill:#333;color:#333;color:#333;fill:none;Apache Doris索引体系点查索引跳数索引前缀索引倒排索引ZoneMap索引BloomFilter索引NGram BloomFilter索引内置自动维护用户手动创建内置自动维护用户手动创建用户手动创建。

2025-10-06 17:15:00 1275

原创 Doris专题6- 数据类型与数据压缩

Apache Doris 支持丰富的数据类型,为不同场景的数据存储和分析提供支持。数据类型选择影响数据存储效率和查询性能压缩算法选择需要在存储空间和查询性能间平衡列式存储为高效压缩提供了天然优势实际应用中应根据工作负载特性和数据特征选择合适的数据类型和压缩策略通过合理的数据类型设计和压缩策略配置,可以在Apache Doris中实现存储效率和查询性能的最佳平衡。

2025-10-06 09:15:00 1043

原创 Doris专题5- Rollup与查询

Base Table:用户通过建表语句创建的基础表ROLLUP表:基于Base表创建的辅助数据结构,物理上独立存储作用:获得更粗粒度的聚合数据或调整列顺序优化查询。

2025-10-05 12:35:40 1112

原创 Doris专题4- 使用指南

副本数建议使用默认3副本保证高可用列的Null属性默认为true,影响查询性能支持动态增删分区。

2025-10-05 12:18:02 1209

原创 Doris专题3- 数据划分

时间序列数据:动态分区 + 自动分区离散枚举数据:List分区或自动List分区固定范围数据:手动Range分区。

2025-10-05 11:33:12 758

原创 Doris专题2- 表类型

明细表 (Duplicate Key Table):保留所有原始数据记录,允许Key列重复主键表 (Unique Key Table):保证Key列唯一性,相同Key的数据会被覆盖聚合表 (Aggregate Key Table):基于Key列聚合数据,减少存储空间并提升查询性能。

2025-10-04 11:45:24 994

原创 Doris专题1- 什么是Doris

定义:基于 MPP 架构的高性能、实时分析型数据库特点:高效、简单、统一,亚秒级查询响应适用场景高并发点查询高吞吐复杂分析报表分析、即席查询、统一数仓构建、数据湖联邦查询加速Apache Doris作为一款现代实时分析型数据库,凭借其高性能、高兼容、易用性等特性,已成为企业级数据分析的重要选择,特别适合需要实时洞察和复杂分析的业务场景。

2025-10-04 11:32:51 1231

原创 Spark专题-第三部分:性能监控与实战优化(3)-数据倾斜优化

只要是分布式架构,很容易出的问题就是数据倾斜,少量打工人干了大部分工作,但近期线上没有啥严重的数据倾斜问题,导致想找个素材还真不好找,就只能先用python展示一下类似问题的问题定位、分析流程以及优化思路。

2025-10-03 10:33:04 468 2

原创 Spark专题-第三部分:性能监控与实战优化(2)-分区优化

这一篇不同于之前理论层面的讲解,会直接引入前段时间在工作中发现的问题,并配上思路和解决办法。

2025-10-02 10:40:35 1361

原创 Spark专题-第三部分:性能监控与实战优化(1)-认识spark ui

Spark UI 是 Spark 提供的 Web 监控界面,用于实时查看应用程序的执行状态、性能指标和资源配置。

2025-09-30 22:23:40 1132

原创 Spark专题-第二部分:Spark SQL 入门(8)-算子介绍-sort

在Spark SQL中,排序操作通过SortExec物理算子实现。不同的SQL排序语法会产生不同的执行计划,涉及不同的数据分布和排序策略。小数据全局排序: 使用ORDER BY,但注意内存限制大数据局部排序: 使用SORT BY或CLUSTER BY优化数据分布: 使用DISTRIBUTE BY为后续操作准备数据监控内存使用: 排序操作容易导致内存溢出,需要合理配置利用自适应查询: 启用Spark的自适应查询执行优化排序过程这下应该没有遗漏的重要算子了。

2025-09-27 08:21:51 6894 1

原创 Spark专题-第二部分:Spark SQL 入门(7)-算子介绍-Windows

窗口函数在Spark中通过WindowExec物理算子实现,它负责处理OVER子句中定义的分区、排序和框架边界。

2025-09-21 11:53:20 921

原创 Spark专题-第二部分:Spark SQL 入门(6)-算子介绍-Generate

Generate是Spark执行explode操作的物理算子,负责将输入行转换为多行输出。根据不同的explode函数,Spark会使用不同类型的生成器(Generator)。

2025-09-21 11:15:04 1192

原创 Spark专题-第二部分:Spark SQL 入门(5)-算子介绍-Join

前面几篇介绍的算子大多与单表查询相关,但实际工作中少不了多表关联,因此咱们这一篇就来聊一聊join相关的算子。

2025-09-21 10:49:02 1237

原创 Spark专题-第二部分:Spark SQL 入门(4)-算子介绍-Exchange

Exchange算子是Spark SQL中负责数据重分布(Data Redistribution)的关键算子,它实现了Spark的shuffle操作。当数据需要在不同节点间重新分区时,Exchange算子会被引入到执行计划中。它本质上是Spark分布式计算中数据交换的基础,负责将数据按照特定规则重新组织,以便后续操作能够高效执行。Exchange算子是Spark SQL中至关重要的shuffle操作实现,理解其不同类型和适用场景对于编写高效的Spark SQL查询至关重要。

2025-09-20 11:25:19 903

原创 Spark专题-第二部分:Spark SQL 入门(3)-算子介绍-Aggregate

在Spark SQL中,Aggregate算子用于处理分组和聚合操作,是数据处理中的关键步骤。它通常出现在执行计划中,当查询包含GROUP BY子句或聚合函数时。Aggregate算子负责将数据分组并计算聚合值(如总和、计数、平均值等)。根据数据特性、内存配置和Spark版本,Spark会选择不同的聚合策略,主要包括和。理解这些类型有助于优化查询性能。Aggregate算子是Spark SQL中处理聚合操作的核心,理解其类型和执行流程有助于编写高效的查询。

2025-09-20 10:59:10 1071

CDA数据分析师 LEVEL1

CDA数据分析师 LEVEL1

2023-11-01

python中nmupy获取本地数据和索引-US-video-data-numbers

python中nmupy获取本地数据和索引博客里,所使用到的数据源,一共四列,分别表示【阅读量】、【喜欢量】、【不喜欢量】、【评论量】

2022-12-03

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除