自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

涤生大数据

在职大数据架构专家,擅长大数据开发,组件调优,集群运维架构。当前管理1500+节点大数据集群,100PB+数据,爱好python,爬虫。免费给所有转行大数据小白,大数据初级开发者提供职业规划和学习定制建议,欢迎大家交流

  • 博客(546)
  • 资源 (3)
  • 问答 (1)
  • 收藏
  • 关注

原创 Doris 倒排索引 + Variant 日志最佳实践:Schema Template、多索引组合落地

下面按实现和使用边界拆开讲,方便判断能不能落到自己的链路里。对关键子路径,可以用 Schema Template 预声明类型和索引,同一路径挂两种索引——分词索引服务 MATCH,keyword 索引服务精确等值,优化器按查询形式选择。选型时建议先对照自己的写入量、字段变更频率、检索形态(精确 / 分词 / 短语)和冷热保留策略,再决定 Variant 和倒排要开到什么粒度,而不是默认全开。开启,写入时额外保留原始 JSON 的文档形态,适合"整段 JSON 返回"或"写入优先"的场景,与稀疏列模式互斥。

2026-09-02 09:00:00 201

原创 从 5.5 万到 10 万+: Spark 写 Hive 文件数翻倍 与任务“假卡死”企业案例剖析

目标分区中可观察到的最晚 part 文件时间约为 03:15,但 HDFS Audit 显示直到 04:55:49,Hive 仍在把 .hive-staging 下的 part 文件 rename 到正式分区;04:55:51 才删除 staging 目录。图 5 HDFS Audit:04:55:49 仍在逐文件 rename,04:55:51 删除 .hive-staging跨层时间线03:15 目标目录已出现最后一批 part 文件。

2026-09-01 09:00:00 276

原创 牛来票房4200w了:想赢就要敢上场!求职面试也是如此!

牛来》凭着一腔孤勇登上院线大舞台,收获千万观众的目光。我们每个人的求职路,同样是属于自己的舞台。不必等所有条件完美就绪再出发。机会永远留给敢于登场的人。放平心态,大胆奔赴面试,清晰展示你的价值,很多上岸的契机,往往就藏在这份从容与勇气之中。当然也不是说啥都不准备上场,那是炮灰。我们可以先跑起来在调整姿势,通过面试不断复盘总结成长,我经常说不要求大家面试上来就表现的很优秀,但是我们要求你要通过面试复盘总结,越来越好,越面越好。

2026-08-31 09:00:00 345

原创 大模型很聪明,但不懂你的业务!揭秘企业AI落地的最大“拦路虎”

AI+本体的核心价值是在治理基础上构建业务语义层,把规则结构化沉淀,让AI从“能问答”进化到“能执行业务”。有了本体,AI才能真正从“消耗token的玩具”变成“产生直接业务价值的工具”。

2026-08-23 09:37:16 317

原创 一次“没有运行日志”的DolphinScheduler任务失败排查

在调度系统里,“没有日志”并不意味着没有线索。相反,host、start_time、execute_path、log_path 和 app_link 同时为空,已经非常明确地告诉我们:任务尚未进入执行层。沿着这个事实回到Master,几毫秒级的时间线最终指向 Tenant does not exists。一次高质量排障,不是把所有组件都查一遍,而是用元数据划定边界,用日志建立时间线,用网络测试排除支线,再把任务失败与告警失败分别闭环。只有这样,才能从“经验式排查”走向可解释、可复用、可产品化的诊断体系。

2026-08-23 09:27:27 260

原创 YARN 集成 AI 诊断,告别大数据日志盲查

摘要:大数据集群新增AI任务诊断功能,直接在YARN页面嵌入智能分析模块。支持Spark/MapReduce作业一键诊断,自动收集JobHistory和容器日志,智能识别长尾Stage、异常Task等性能问题,并生成可视化图表。该功能免去人工分析海量日志的困扰,可快速定位任务瓶颈和资源浪费问题,提升运维效率。(98字)

2026-08-18 08:00:00 362

原创 别再熬夜翻DAG图了!Spark任务优化,其实可以交给AI Agent

摘要:本文详细介绍了如何通过Spark WebUI定位和优化Spark任务问题。主要内容包括:通过Stages、Executor和SQL页面分析任务瓶颈,识别数据倾斜、资源不足等常见问题;优化思路从资源、并发、数据倾斜到异常问题分层排查;探讨了利用AI Agent提效的六环节工作流,包括任务发现、异常分析、方案生成、自动测试、报告确认和部署上线。相比传统人工优化,AI Agent能自动定位瓶颈、生成优化方案并验证结果,显著提升优化效率和准确性,帮助开发者从低效重复劳动中解放。

2026-08-17 09:00:00 418

原创 AI冲击+七八月社招求职淡季,一起看看最新的就业行情?

【求职季分析及就业案例分享】社招行情显示7-8月为淡季,建议把握10-12月黄金期。当前招聘趋势凸显AI技能重要性,需掌握AI+大数据复合能力。7月就业数据显示:30W+年薪占比60%,最高涨幅达25W+,收录18个成功案例,包括4年经验普本48W、3年经验35K15、7年经验70W+等典型逆袭案例。特别指出非科班/学历弱势者通过技能突围(如专升本11K13、7年非科班24K*14),强调互联网行业"能力>资历"的特性,建议求职者至少具备教育/工作背景/技术任一核心优势。(149字

2026-08-16 09:57:50 213

原创 27届校招变化:AI全面渗透!不会用大模型,简历第一关就被刷?

【摘要】随着暑期实习结束,2024届秋招即将全面启动。本文基于多年校招辅导经验,为求职者提供实战建议:1)今年AI技术渗透显著,掌握大模型应用能力成关键加分项;2)建立清晰投递策略,建议分层投递并做好进度管理;3)面试需重点突破SQL等硬技能,每场面试后建立"记录-反思-改进"闭环。特别强调秋招"先到先得"特性,提醒学历普通者更要把握8-10月黄金期,避免陷入春招更难困境。建议求职者保持节奏,将每次面试机会转化为成长契机。(149字)

2026-08-12 09:30:00 253

原创 用AI提前3小时预警HBase故障?完整方案来了

摘要:本文通过一起HBase集群事故,总结了多维监控体系构建、故障排查经验及AI在运维中的实践应用。核心问题源于未关闭的Scanner导致HFile堆积,引发复制延迟和数据不一致。关键建议包括:1)监控应覆盖HDFS文件数、SizeOfLogQueue(阈值>1即告警)等核心指标;2)规范Scanner使用(try-with-resources自动关闭);3)优先升级至HBase 2.6修复版本。AI可显著提升运维效率,如通过日志分析快速定位根因(耗时从小时级缩短至分钟级)、时序异常检测提前预警(早于阈值告

2026-08-10 10:00:00 696

原创 Flink Agents 深度剖析:这才是生产级 AI Agent 该有的底座!

FlinkAgents将AI Agent与分布式流处理引擎Flink深度整合,通过复用Flink的Exactly-Once语义、状态管理和背压机制等核心能力,构建了生产级的多Agent流式处理框架。其设计基于三层抽象:Agent(封装行为与资源)、AgentPlan(执行计划生成)和RunnerContext(运行时能力入口),将LLM调用视为异步I/O操作,与数据库查询同级处理。框架采用单线程推理循环和异步工具调用,通过Flink原生机制保障状态一致性与容错。典型案例展示了事件驱动的工作流设计和标准化模型

2026-08-09 10:10:59 344

原创 暑期实习的同学,该如何为秋招做准备?

【摘要】实习的核心目标应是争取留用机会,其次才是能力提升。文章给出两个关键建议:1)争取转正需做到"听安排、勤观察、善提问、常总结",主动融入团队并系统梳理业务知识;2)若无转正名额,应聚焦秋招准备:迭代简历(突出实习项目)、夯实技术基础、关注招聘动态(提前批至关重要)。强调校招竞争激烈,需把握实习期提前备战,建议关注目标企业招聘公众号和使用专用投递渠道。无论选择哪条路径,充分准备是应对秋招的核心竞争力。(149字)

2026-08-02 10:04:44 201

原创 90%的Flink开发没搞懂:延迟数据到底去哪了?

摘要:Flink通过WaterMark+EventTimeWindow机制处理数据乱序问题,但仍可能因数据延迟导致丢失。解决方案包括:1)增大WaterMark延迟时间,权衡准确性与时效性;2)设置allowedLateness允许窗口延迟关闭,为迟到数据提供二次处理机会;3)使用侧输出流(sideOutput)接收超时数据,确保数据不丢失。这些方法在不同场景下综合应用,可有效减少数据处理中的丢失情况。

2026-07-29 09:00:00 182

原创 行情这么卷,这批6月进阶大数据学员凭什么涨薪8k/10k?

18、剩余几个的都是外包了,没啥讲的,外包薪资都不高,不过大数据起薪10k,一般毕业3年+只要能力不是很差的,找个17-20k难度不大,外包面试难度也不大,不过今年外包薪资开始逐步压得很低,反馈说上面要求实缴社保;6月份的就业数据超出预期吧,上岸24人,6月份的进阶同学都异常优秀,不少同学涨薪8k,10k,12k,15k+等,当然也是因为因为辅导的要求越来越高,准备的东西越来越多,努力让我们脱颖而出。2、2年名校本科同学总包40w+知名公司上岸,比较佛系的同学哈,不想去大厂卷,后面去某不卷的知名公司;

2026-07-28 09:00:00 226

原创 AI对大数据的冲击如何?一起看看5月最新的就大数据就业数据?

5月大数据就业市场呈现两极分化:中高端岗位面试难度提升,AI技术成为考核重点,但学员通过系统准备仍取得显著成果。涤生教育数据显示,25名社招学员成功入职,薪资涨幅普遍达50%-200%,其中非科班背景者通过能力提升实现30-50万年薪突破,7年经验大专学历者获27.5k月薪。市场趋势显示:1)学历弱势者需强化实战能力与项目打磨;2)AI技术融合成为职业发展新门槛;3)二线城市优质机会涌现(如30万年薪岗位)。尽管环境竞争加剧,但结构化学习仍能帮助从业者实现薪资翻倍,关键因素包含技术深度、项目匹配度及面试表现

2026-07-27 09:00:00 169

原创 27届秋招马上开始,大家应该如何备战?

六月将尽,大部分公司的暑期实习也陆续收官。实习落幕,意味着八月的秋招正一步步走近。这个节点,相信很多同学是几家欢喜几家愁——有人正在实习中冲刺转正,有人课程还没学完;而那些学历背景普通、简历上实习经历不够亮眼的同学,更要打起精神认真准备。秋招只有一次,错过了,再后悔也来不及。今年我们带的不少同学,已经拿下了百度、字节、快手、京东、滴滴、美团等大厂的暑期实习offer,今年涤生同学去实习的90%以上都是中大厂。还没去实习的同学也别焦虑,只要跟着我们的节奏走,拿offer是迟早的事。

2026-07-26 08:20:39 278

原创 涤生-AI+大数据-校招课程介绍-很详细仔细看哈

摘要: 涤生大数据成立于2021年9月,专注大数据领域教学,已辅导700+学员入职,300+进入中大厂。课程由阿里、字节等一线大厂在职工程师授课,强调实战与企业需求结合,避免“全栈但无专长”的行业痛点。特色包括: 定制化教学:根据学员背景定制学习路径,因材施教; 企业级实战平台:自建10台服务器的大数据中台,模拟真实开发环境; 精细化管理:分阶段学习群+每日打卡,保障学习进度; 全程辅导:覆盖简历优化、面试模拟至试用期护航; 校招专项:针对应届生强化算法、项目及大厂真题训练,近年校招学员年薪30w-60w。

2026-07-22 10:14:08 284

原创 别再瞎写Spark代码!DAG这波“神操作“让效率起飞

Spark DAG执行机制解析与性能优化指南 摘要: Spark通过有向无环图(DAG)实现高效分布式计算,其核心流程分为逻辑计划生成、Catalyst优化、物理计划转换、DAG调度及任务执行五个阶段。DAG以惰性求值记录转换操作,经Catalyst优化器应用谓词下推等策略生成高效物理计划,再由DAGScheduler按宽/窄依赖划分Stage,最终由TaskScheduler并行调度Task。宽依赖(如groupBy)触发Shuffle形成Stage边界,窄依赖(如filter)则合并执行以减少开销。该机

2026-07-19 08:23:05 305

原创 解决 RAG 更新不同步、多路召回、运维繁重问题,这套 Doris 方案太香了

【摘要】企业RAG系统传统架构面临存储冗余、多路召回复杂、同步维护难等问题。Apache Doris提供统一存储方案,实现文档切片、向量、全文索引同表管理,简化架构至单一组件。具体落地流程包括:1)建表时同时定义结构化字段、向量和倒排索引;2)通过StreamLoad或INSERT写入数据后异步构建索引;3)使用混合检索SQL实现结构化过滤+语义/关键词搜索。典型场景如售后问题查询,可结合时间范围、分类标签与向量相似度排序。该方案保留外部Embedding和LLM服务,但收敛了90%的存储检索环节,显著降低

2026-07-13 09:00:00 263

原创 数据团队减负60%的真相:智能问数成败,根本不在大模型

《智能问数落地指南:从技术路线到企业实践》 摘要:智能问数技术虽发展六年,但实际落地效果两极分化。文章系统梳理四代技术演进(规则模板、深度学习NL2SQL、大模型+语义层、Agent化协同),指出当前主流方案是统一语义层+指标平台路线。企业落地需遵循"三步走":需求诊断(聚焦高频场景)、POC验证(业务准确率≥85%)、规模化运营(持续迭代)。关键避坑建议包括:优先单场景做透、构建高质量语义层、采用检索增强技术、建立三层校验防控幻觉。核心结论:智能问数是"三分技术、七分治理&q

2026-07-12 08:57:31 420

原创 3 周效率翻 5 倍!手把手复盘如何用小龙虾输出企业级语义层 PRD

数据开发中常遇到的指标口径不一致问题,源于指标定义分散在不同位置(数仓ETL脚本、BI工具数据集、Excel/口头约定)。语义层(Semantic Layer)通过统一业务语义抽象来解决这一问题,其核心价值包括口径统一、物理隔离、自助分析和权限管控。构建语义层涉及五个模块:DSL(领域特定语言)、元数据注册、SQL引擎、权限管理以及缓存与性能优化。AI工具如小龙虾可大幅提升PRD文档编写效率,但技术决策仍需人工判断。语义层适用于业务流程成熟、指标数量多、跨部门协作复杂的场景,能够显著提升数据开发效率和质量。

2026-07-07 09:00:00 284

原创 27届秋招马上开始,大家应该如何备战?

【秋招备战指南:稳扎稳打是关键】随着暑期实习结束,秋招战役即将打响。本文针对2024届毕业生提供实用建议:1. 时间紧迫性:秋招8月启动,中大厂10月截止,需尽早投递;2. 核心准备:(1)夯实技术基础(数据结构/SQL/大数据框架);(2)重点关注AI技术融合应用;(3)精细化打磨简历,确保内容真实可控;3. 投递策略:分层投递+实时记录,建议关注企业招聘公众号获取第一手信息;4. 面试技巧:提前研究面经,建立复盘闭环,将每次面试转化为成长机会。特别提醒:春招难度是秋招5倍,需把握当下冲刺窗口,保持稳定心

2026-07-06 09:15:00 275

原创 别把 SQL 写乱了:先想清楚这三个问题

【SQL执行顺序解析:GROUP BY与窗口函数的结合使用】 在SQL中,GROUP BY与窗口函数常结合使用,但需明确执行顺序:先执行GROUP BY聚合数据,再通过窗口函数对聚合结果进行分析。例如,计算用户不完成率并排名时,先按uid分组聚合,再用ROW_NUMBER()全局排序。 关键点: 执行顺序:GROUP BY先聚合数据,窗口函数后处理(如排序、累计)。 嵌套使用:窗口函数可嵌套聚合函数(如SUM(SUM(pay_amount)) OVER()),但需确保聚合粒度正确。 应用场景: 案例1:统计

2026-07-05 12:34:21 246

原创 最新面经!腾讯 + 快手数据开发一面真实考察重点有哪些?

【摘要】本文梳理了腾讯和快手数据开发岗校招面试的核心考点。腾讯侧重技术深度,重点考察Spark/Flink线上问题排查(如任务慢、数据倾斜)、SQL优化及Java底层原理;快手则聚焦AI工具落地和业务方案设计,关注大模型应用和智能开发能力。两家公司均包含算法手撕环节(栈实现队列、合并有序数组等基础题)。面试建议:腾讯需掌握框架原理和调优经验,快手要准备AI编程工具实操案例,同时注意项目细节深挖和业务场景应答,避免死记硬背。

2026-06-26 16:34:50 347

原创 90%的Spark开发者没搞懂:SerDe和DataSource到底怎么选?选错性能差一半!

本文对比分析了Spark中Hive SerDe和DataSource两种建表方式的差异:1. 建表语法不同(STORED AS vs USING);2. WebUI显示不同(InsertIntoHiveTable vs InsertIntoHadoopFsRelationCommand);3. 读取方式差异(HiveTableScanExec vs FileSourceScanExec);4. 文件命名规范不同;5. 向量化读取支持度不同(DataSource默认开启);6. 混合分区表的处理方式不同(Se

2026-06-26 16:32:41 173

原创 面试被问:“你和公司对 AI 的使用情况?”到底该怎么回答?

【摘要】面对面试官询问AI使用情况时,回答需体现三个维度:个人AI提效实践、企业落地场景及AI与数据开发的结合能力。建议采用结构化回答:1)个人层面展示AI辅助SQL编写、故障排查、文档生成等具体场景,强调"AI初稿+人工校验"模式;2)企业层面可提及智能取数、指标问答等探索,突出元数据基础和权限管控;3)若企业AI应用有限,应坦诚现状并强调数据底座建设的重要性。高阶回答可结合语义层建设、RAG知识库等概念,重点传达AI作为效率工具而非替代方案的定位,同时体现对数据安全与质量把控的专业认

2026-06-22 09:00:00 363

原创 AI对大数据的冲击如何?一起看看5月最新的就大数据就业数据?

5月大数据行业就业形势分析显示,行业门槛明显提高,市场逐步淘汰低学历、低能力者,但优质机会仍存。涤生教育就业数据亮眼,社招25人成功上岸,薪资涨幅显著,部分非科班学员斩获40w+高薪。中大厂面试更重AI技术和实战能力,难度提升;外包公司门槛较低,掌握八股文即可获取15k-22k岗位。典型案例包括:7年非科班学员获50w中大厂offer、应届生被裁后快速斩获35w+岗位等。数据显示学历弱势者通过能力提升仍可突破职业瓶颈,但需注意行业正加速AI融合,建议从业者补充AI工程化技能以应对趋势。当前环境虽竞争加剧,但

2026-06-19 12:15:00 285

原创 大厂海外BI项目血泪史:当国产StarRocks遇上Power BI,我们踩了多少坑?

回顾整个海外BI项目的落地过程,这不仅是一次简单的工具替换,更是一场关于技术敬畏心与架构弹性的深刻实战演练。从最初的"经验主义照搬",到中期在StarRocks与Power BI兼容性问题上的艰难摸索,再到最终打通Flink+Paimon+SR直连的实时数仓闭环,我们走过了一条典型的"破局之路"。

2026-06-18 09:30:00 301

原创 为什么 Spark AQE 建议的 64MB 分区,会让你的 Driver 直接暴毙?

摘要: Spark AQE(自适应查询执行)通过动态优化解决静态执行计划的不足,核心功能包括动态合并Shuffle分区、动态切换Join策略和动态优化倾斜Join。然而,其优化机制存在潜在风险: 动态合并Shuffle分区:可能因压缩数据解压后内存膨胀导致OOM,需通过REPARTITION强制分散任务或调整参数避免过度合并。 动态切换Join策略:压缩数据解压后可能超出Driver内存,需降低广播阈值或使用SHUFFLE_MERGE提示。 动态优化倾斜Join:统计信息压缩可能导致误判,需调整参数(如sk

2026-06-17 09:56:29 413

原创 为什么 Spark AQE 建议的 64MB 分区,会让你的 Driver 直接暴毙?

Spark AQE(自适应查询执行)动态优化机制分析:AQE通过运行时统计信息弥补了Catalyst静态优化器的不足,在Shuffle边界动态调整执行计划。其三大核心功能在实际生产中可能引发严重问题:1. 动态合并分区机制可能因压缩数据误判导致OOM,需通过强制repartition或调整最小分区数解决;2. 动态Join策略切换时可能因压缩数据解压膨胀引发Driver内存溢出,建议降低广播阈值或使用Hint;3. 倾斜Join优化可能因统计信息压缩失真失效,需调整相关参数确保准确识别倾斜。本文通过生产案例

2026-06-12 09:00:00 366

原创 新鲜春招面经:百度京东大数据原题拆解,AI + 数仓已成面试新风向

2026春招大数据岗位面试趋势发生显著变化:头部大厂全面推行"AI+数据开发"双考核标准,传统技术栈深度考察不减,新增AI落地能力评估。百度、京东等企业面试显示,Spark底层源码、Shuffle机制等硬核技术仍是基础门槛,同时要求候选人具备AI应用能力(如Text-to-SQL、大模型优化参数等)。项目环节更关注业务落地细节(数据治理、多方协同)和AI提效实践(自动校验、指标治理)。面试题涵盖技术手撕(LRU缓存、完全二叉树)、场景化SQL(窗口函数、用户留存)及AI解决方案设计。建议

2026-06-11 09:00:00 345

原创 面试官:我筛掉的候选人,大多输在这几件事上

摘要:本文从面试官视角分享面试要点及候选人应对策略。面试官应避免局限于熟悉领域,多维度考察候选人;候选人遇到深挖领域时可巧妙引导。警惕AI作弊现象,面试官可通过多维度观察识别,候选人应善用AI工具备考。面试中应注重思维过程而非死记硬背,项目考察要聚焦核心内容。SQL/算法是基础必备技能,同时需注重沟通表达等软素质。双方都应保持专业态度,面试官营造公平环境,候选人展现真实能力与学习潜力。(149字)

2026-06-10 11:04:23 242

原创 从 ETL 到 Agent:AI数据工程如何搭建企业级“数据工厂“

AI数据工厂:从ETL到智能体系统的范式转变 随着AI技术的普及,企业数据工程正经历从传统ETL(服务于人)到“AI数据工厂”(服务于模型)的转型。核心变化在于: 数据消费者转变:模型需要动态上下文(Context)、按需检索能力(Skills)和实时反馈,而非静态报表。旧系统的“静默失败”问题(如Schema变更导致模型错误)成为新挑战。 技术架构升级:提出六层AI数据工厂架构: 数据基础层(可接入)统一纳管多源数据; 契约层(可信任)通过版本化、兼容性管理防止数据漂移; 上下文层(可理解)优化Promp

2026-06-05 09:00:00 700

原创 最新字节等面经看看大数据开发面试的变化?

大厂社招面试趋势显示,大数据开发岗位正加速与AI融合,形成"AI+数据开发"新方向。字节、阿里、平安等企业的面试题反映出:大数据技术仍是考核核心(数仓设计、Spark优化、数据治理等),但AI应用能力成为重要加分项。重点考察方向包括:AI赋能数仓的实践(如Text-to-SQL技术)、大模型在数据资产管理中的应用、通过AI实现开发提效等。行业趋势表明,未来3年各类技术岗位都将被"AI+"重塑,从业者需在保持专业深度的同时,积极拥抱AI工具提升效率(如智能问数、任务诊断

2026-06-04 09:00:00 244

原创 春招没拿到offer?别慌!你的机会还有呢?

大数据开发春招面试攻略:核心考点与备战技巧 【摘要】大数据开发岗位春招持续进行中,本文梳理了面试高频考点及应对策略。Spark面试重点考察Shuffle优化,需掌握磁盘I/O、网络传输等性能瓶颈解决方案;Flink需深入理解Watermark机制和Exactly-Once实现原理;数仓建模要能阐释分层设计的业务逻辑。项目经历需量化指标(如"Spark作业耗时从2小时优化至1.5小时")并按STAR框架阐述优化案例。建议求职者持续投递至7月,拓展"数据开发""

2026-06-02 11:15:04 196

原创 大数据面试高频题:row_number() 数据倾斜到底怎么解决?

本文分析了row_number()函数导致数据倾斜的本质原因,并针对不同业务场景提出了优化方案。数据倾斜的根本在于partition key分布不均导致某些窗口分区过大。解决方案需根据业务需求分类处理:对于全量排序场景,应采用有序字段分治策略;TopN问题可通过加盐拆分成局部TopN再全局TopN;首末记录类需求优先使用聚合函数替代;去重场景需区分"任意去重"和"按规则去重"。优化关键在于理解业务语义,避免盲目套用加盐等通用方案,选择最适合具体场景的高效实现方式。

2026-05-24 09:53:11 479

原创 Doris/StarRocks 高频面试题通关指南

Apache Doris与StarRocks高频面试题解析 本文聚焦大数据实时方向核心面试考点,梳理Doris/StarRocks的架构原理、性能优化与表设计: 架构对比:存算一体(高性能)与存算分离(云原生弹性)的选型逻辑,详解数据分布、版本控制与半数写入机制。 性能优势:列式存储+向量化引擎+MPP并行架构,对比ClickHouse的Join短板,强调CBO优化器与多副本高可用设计。 表模型与索引:明细表、聚合表、主键表的适用场景,分区与分桶策略选择,倒排索引/BloomFilter等二级索引优化技巧。

2026-05-21 18:30:00 628

原创 32.1k Stars暴涨!Hermes Agent凭什么碾压OpenClaw,成为开源新宠?

本文聚焦Hermes Agent这款 2026 年 2 月由 Nous Research 推出的开源自进化 AI 智能体框架,先介绍其开源属性、社区数据、多模型兼容与多端部署等基础信息,点明其趁头部同类产品 OpenClaw 遇挫快速崛起的行业背景。接着剖析行业发展启示,指出 AI Agent 正从工具转向智能伙伴,自主进化技能 + 长效记忆体系是核心竞争力,同时揭露单一依赖大模型厂商接口的产品存在巨大经营风险,多模型适配才是稳健架构方向。

2026-05-20 08:00:00 987

原创 双非硕春招中厂上岸!同学,校招不到最后一刻请不要放弃,方向对以后,机会都是干出来的!

双非硕士成功斩获30w+中大厂大数据开发offer,分享春招突围经验。面对春招与毕业论文双重压力,作者通过合理规划时间:上午专注论文,下午复习技术,晚上投递简历,实现双线并进。建议提前准备论文框架,分层投递简历,重视实习经历,吃透技术八股和项目细节。强调双非学历更需多投多面,保持心态平稳,坚持到春招后期仍有补录机会。最终实现offer与论文双丰收,证明充分准备才是求职关键。

2026-05-19 09:52:47 549

原创 炸场!GPT Image 2正式上线,小白也能轻松出大片,告别PS

摘要:GPTImage2 AI生图工具凭借三大优势惊艳用户:1)精准还原细节,关键词越具体效果越惊艳;2)操作简单,无需设计基础,用自然语言描述即可生成;3)适用多场景,职场PPT、社交媒体配图等都能快速完成。相比传统AI生图工具,GPTImage2在细节还原度和易用性上都有显著提升,真正实现了"全民设计"的可能。用户只需掌握"描述具体细节"和"补充调整指令"两个技巧,就能轻松获得理想图片效果。(149字)

2026-05-15 19:15:00 281

阿里里巴巴企业数据安全中的数据脱敏实践.pdf

企业数据安全中的数据脱敏 阿里巴巴

2021-09-10

腾讯大数据安全体系架构与介绍.pdf

腾讯大数据安全体系介绍

2021-09-10

Python3.5官方文档中文版本chm格式

python3.5版本,官方文档中文版,已经 集成为chm格式,直接打开即可使用,更加方便好操作。免费下载吧

2018-09-06

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除