<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[石榴姐yyds]]></title><description><![CDATA[数据开发与数据挖掘]]></description><link>https://blog.csdn.net/godlovedaniel</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; godlovedaniel]]></copyright><item><title><![CDATA[一文讲清：Agent 里 Skill 调用的完整流程]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/166131565</link><guid>https://blog.csdn.net/godlovedaniel/article/details/166131565</guid><author>godlovedaniel</author><pubDate>Sun, 20 Sep 2026 14:46:24 +0800</pubDate><description><![CDATA[智能体开发核心在于Skill的六步流程：请求接入、意图识别与路由、参数提取与校验、技能执行、结果格式化、响应输出与状态更新。每步关键且易出错，如上下文缺失、意图模糊、参数校验不足、状态遗忘等。实际系统需强化兜底机制、上下文继承与权限确认，以应对异常场景。真正差异在异常处理能力，而非正常路径流畅度。]]></description><category></category></item><item><title><![CDATA[面试真题解析：用 SQL 实现按周 Cohort 留存矩阵]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163998505</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163998505</guid><author>godlovedaniel</author><pubDate>Tue, 25 Aug 2026 09:00:00 +0800</pubDate><description><![CDATA[你花了一大笔钱做推广，每天拉来一堆新用户。老板问你一个问题："这些用户，拉来之后到底留没留住？...一堆散乱的登录记录。你没法直接回答"留没留住"，因为：用户1来了三次，算留住了吗？用户2来了两次就不来了，算流失了吗？不同时间来的用户，能放在一起比吗？留存矩阵，就是把这些散乱数据"折叠"成一张能一眼看懂的表。这道题表面上考 SQL，实际上考的是对留存分析这件事的理解。]]></description><category></category></item><item><title><![CDATA[数据异常检测方法全解析：从统计规则到深度学习的实战指南]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163802614</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163802614</guid><author>godlovedaniel</author><pubDate>Wed, 19 Aug 2026 12:00:00 +0800</pubDate><description><![CDATA[本文系统梳理了数据异常检测的主流方法及应用场景。异常检测作为数据治理的核心能力，涵盖规则/阈值、统计方法（Z-Score、IQR）、聚类（LOF）、孤立森林、深度学习（AutoEncoder、GAN）和图分析等技术，适用于不同业务需求。文章通过钢铁、金融、制造等行业案例，对比了各方法的优缺点，强调选型需考虑数据规模、特征和业务场景，建议采用多算法融合策略，并指出数据预处理、模型迭代和结果解释是落地的三大关键。最终强调，方法选择应注重实用性和业务匹配，而非单纯追求技术先进性。]]></description><category></category></item><item><title><![CDATA[Flink 窗口面试题汇总 ]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163800975</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163800975</guid><author>godlovedaniel</author><pubDate>Wed, 19 Aug 2026 09:00:00 +0800</pubDate><description><![CDATA[本文系统梳理了Flink窗口的核心知识点，涵盖基础概念、时间语义、核心组件、数据处理、状态管理等关键内容。主要内容包括：1. 窗口基础概念：介绍Flink窗口的作用、类型（滚动/滑动/会话/全局窗口）及其区别；2. 时间语义与Watermark：详解EventTime与ProcessingTime的区别，Watermark机制及其触发原理；3. 窗口核心组件：解析WindowAssigner、Trigger、Evictor等核心组件的功能与作用；4. 数据处理：阐述迟到数据的处理策略（Watermark/a]]></description><category></category></item><item><title><![CDATA[干了十年程序员，我不再跟AI比谁懂的多]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163595246</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163595246</guid><author>godlovedaniel</author><pubDate>Fri, 14 Aug 2026 09:00:00 +0800</pubDate><description><![CDATA[文章摘要：一位资深程序员面对AI工具带来的冲击，从最初对知识护城河坍塌的焦虑，到重新发现经验价值的历程。他意识到AI虽能快速填补知识差距，却无法替代由实战积累的系统&quot;体感&quot;、问题拆解思维和架构直觉。真正的竞争力在于面对复杂问题时如何思考、判断和取舍的能力，这些源于无数次故障排查和决策沉淀的隐性经验，构成了无法被工具替代的职业护城河。（149字）]]></description><category></category></item><item><title><![CDATA[写了十年SQL，聊聊“集合思维“这件事]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163594461</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163594461</guid><author>godlovedaniel</author><pubDate>Thu, 13 Aug 2026 09:00:00 +0800</pubDate><description><![CDATA[那天那个code review，我最后跟那小伙子说的是：你回去想想，这个需求里"每个用户最近一笔订单"这句话，能不能用SQL直接表达出来，而不是在Java里用if判断"我是不是第一次见到这个用户"。他后来改了一版，用了ROW_NUMBER，十几行Java变成了一条SQL。跑了一下，快了大概六倍。他跟我说："确实不用想那么复杂。我说对。大多数时候不用想那么复杂。你把"你要什么"说清楚，数据库会帮你把"怎么做"搞定。这就是集合思维最实际的好处：不是它多优雅多哲学，是它让你少写代码、少维护代码、少出bug。]]></description><category></category></item><item><title><![CDATA[面试问：数仓分层后有哪些负面影响？为什么不建议盲目分层？ ]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163614006</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163614006</guid><author>godlovedaniel</author><pubDate>Tue, 11 Aug 2026 11:15:00 +0800</pubDate><description><![CDATA[摘要： 数据仓库分层设计（如ODS→DWD→DWS→ADS）虽能提升逻辑清晰度与复用性，但实际落地中可能引发多重问题：链路变长导致时效性下降，存储与计算成本激增，任务依赖复杂化，维护成本攀升，甚至因过度分层拖慢需求响应。分层后，口径统一需依赖规范管理而非自动实现，且存在数据一致性风险、补数成本高、元数据管理压力大等问题。小团队或业务初期可能因分层过细而得不偿失。 优化建议包括：根据业务规模动态调整分层深度（如轻量ODS-DW-ADS）；明确每层职责，避免无效中间表；建立指标字典与血缘管理；定期治理低价值表；]]></description><category></category></item><item><title><![CDATA[DWS 宽表和 ADS 宽表，不是一回事 ]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163399415</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163399415</guid><author>godlovedaniel</author><pubDate>Thu, 06 Aug 2026 12:00:00 +0800</pubDate><description><![CDATA[数据仓库中DWS宽表和ADS宽表的本质区别在于职责定位不同。DWS宽表作为公共中间层，应保持克制，聚焦稳定粒度、原子指标和公共维度，确保复用性和口径统一；而ADS宽表作为应用交付层，可充分冗余维度和派生指标，优化查询体验。常见误区是将DWS过度业务化或让ADS承担公共底座，这会导致模型腐化和维护困难。合理做法是DWS负责公共汇总，ADS专注场景加速，形成&quot;DWD+DIM→DWS→ADS→应用&quot;的分层链路，通过明确分层边界实现数据仓库既稳定又好用的目标。]]></description><category></category></item><item><title><![CDATA[Doris MAX_BY 函数详解]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/163364735</link><guid>https://blog.csdn.net/godlovedaniel/article/details/163364735</guid><author>godlovedaniel</author><pubDate>Mon, 03 Aug 2026 09:00:00 +0800</pubDate><description><![CDATA[Apache Doris中的MAX_BY函数是处理&quot;取每组最新/最大值对应字段&quot;场景的高效聚合函数。文章介绍了其基本语法MAX_BY(expr, order_expr)，通过订单表示例演示如何获取用户最新订单金额。相比MAX函数只能返回极值，MAX_BY能返回极值对应的其他字段值。但需要注意：当排序字段存在重复值时，多个MAX_BY可能返回不同行数据；如需严格获取完整行记录，建议改用ROW_NUMBER窗口函数。该函数适合汇总场景（如获取最新登录IP、最大金额订单状态等），但不适合保留明]]></description><category></category></item><item><title><![CDATA[DolphinScheduler MySQL连接偶发错误排查与解决方案]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/162826234</link><guid>https://blog.csdn.net/godlovedaniel/article/details/162826234</guid><author>godlovedaniel</author><pubDate>Mon, 13 Jul 2026 09:00:32 +0800</pubDate><description><![CDATA[【问题摘要】DolphinScheduler执行SQL任务偶发报错IllegalArgumentException:null，重跑可成功。排查方向如下： 首要原因（80%概率）：Hikari连接池中的失效连接未被及时清理，建议： 追加JDBC参数：autoReconnect=true&amp;connectTimeout=30000 设置maxLifetime＜MySQL的wait_timeout 开启testWhileIdle校验 次要原因（15%概率）：MySQL服务端预编译缓存异常，建议： 关闭服务端]]></description><category></category></item><item><title><![CDATA[SQL中繁琐的Case When 如何优化？ ]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161778286</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161778286</guid><author>godlovedaniel</author><pubDate>Tue, 09 Jun 2026 11:00:00 +0800</pubDate><description><![CDATA[SQL优化新思路：数学映射法替代CASE WHEN 本文提出用数学映射法优化SQL中CASE WHEN的五大场景： 聚合统计：将布尔条件转为整数乘法（如SUM(salary*(status='ACTIVE'))），消除分支提升向量化计算效率 枚举翻译：用字典表JOIN替代硬编码（如支付类型映射），通过哈希连接实现O(1)查询 范围判断：利用数学函数（GREATEST、CEIL）替代分段条件，如CEIL(age/10.0)划分年龄段 WHERE子句：通过逻辑等价拆分（OR/UNION ALL）避免索引失效，恢]]></description><category></category></item><item><title><![CDATA[声明式之美：超越 CRUD 的 SQL]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161665200</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161665200</guid><author>godlovedaniel</author><pubDate>Fri, 05 Jun 2026 11:00:00 +0800</pubDate><description><![CDATA[《SQL思维跃迁：从过程式到集合与状态思维的范式转换》 本文揭示了高效SQL编程的核心思维转变：摒弃传统过程式循环逻辑，转向关系代数的集合映射和状态流转思维。通过三个经典案例（关系除法、会话切割、漏斗分析）的对比解析，文章展示了集合运算（差集/基数映射）和窗口函数（LAG/状态累加）如何替代变量维护与循环遍历，以声明式方法实现复杂逻辑。关键顿悟在于：1）用NOT EXISTS和集合运算替代逐行查找；2）用LAG+窗口函数模拟状态机；3）通过MATCH_RECOGNIZE等实现时间序列模式匹配。文末提供的&q]]></description><category></category></item><item><title><![CDATA[SQL内核修炼：ICU 医疗监护 — 多设备“危险重叠期”识别 | 详解扫描线算法 ]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161634576</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161634576</guid><author>godlovedaniel</author><pubDate>Thu, 04 Jun 2026 11:00:00 +0800</pubDate><description><![CDATA[消除嵌套与循环：它将 O(N^2)的区间两两比对，降维成了 O(Nlog⁡N)的排序 + O(N) 的线性扫描。在 SQL 中，这意味着避免了昂贵的CROSS JOIN或复杂的自关联。状态机思维：它把复杂的几何/时间问题，抽象成了简单的“状态机”。只需要关心“进入”和“离开”对系统当前状态的影响。高度可扩展：无论是求交集（并发数 ≥2 ）、求并集（并发数 ≥1 ）、还是求差集（A 的并发数 =1且 B 的并发数=0 ），只需要在步骤 4 修改WHERE条件即可，底层的数据流转逻辑完全不变。]]></description><category></category></item><item><title><![CDATA[数仓面试提问：项目里最难的是什么，如何回答？]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161515578</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161515578</guid><author>godlovedaniel</author><pubDate>Wed, 03 Jun 2026 12:00:00 +0800</pubDate><description><![CDATA[这是一道常见的“分水岭”问题。几乎所有的求职者都有几率碰到该问题，也是求职者最头疼、最恶心的一道题目，今天我们就聊一聊，当求职者遇到该问题时应如何应对，本文总结了四类场景供求职者参考。首先，我们来看一下当面试官抛出这个问题时的真实意图是什么？项目的真实性：只有亲手踩过坑的人，才能把细节说清楚。技术深度与广度：你遇到的“难点”是低级错误（如SQL写错），还是具有挑战性的架构/性能/业务问题？解决问题的方法论：面对未知问题，你的排查思路、技术选型和落地能力如何？]]></description><category></category></item><item><title><![CDATA[阿里大数据开发面试：星型和雪花模型的trade-off是什么?实际中如何选？]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161570533</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161570533</guid><author>godlovedaniel</author><pubDate>Tue, 02 Jun 2026 12:15:00 +0800</pubDate><description><![CDATA[星型模型和雪花模型是数据仓库维度建模的两种核心结构。星型模型采用去规范化维度表，查询性能高但存储冗余大；雪花模型通过规范化维度表节省空间但增加查询复杂度。现代数据仓库更倾向星型模型或宽表设计，因其能充分利用廉价存储和高效扫描能力。实际应用中常采用混合架构：底层规范化保证数据质量，上层反规范化优化查询性能。关键权衡点包括查询性能、存储空间、易用性和ETL复杂度等。]]></description><category></category></item><item><title><![CDATA[利用SQL求解城市天际线问题| LeetCode 218题]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161572826</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161572826</guid><author>godlovedaniel</author><pubDate>Mon, 01 Jun 2026 15:00:00 +0800</pubDate><description><![CDATA[无论是用 Python 的最大堆，还是用 SQL 的左连接+分组聚合打破实体的边界：不要盯着“一栋栋楼”看，要把楼拆碎，变成时间/空间轴上的“事件”。维护“活跃状态池”：扫描线本身没有记忆，你必须用一个数据结构（堆、Multiset、或者 SQL 的 JOIN 匹配）来记录“当前扫描线穿透了哪些实体”。只关注“状态突变”：海量的事件点中，90% 都是无效的（被遮挡的、高度没变的）。真正的业务价值（天际线的转折、系统的报警、用户的流失）只发生在状态池的极值（MAX）发生翻转的那一瞬间。往期精彩。]]></description><category></category></item><item><title><![CDATA[业务问题：用“孤岛与间隙”算法计算设备宕机时长与 MTTR]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161516223</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161516223</guid><author>godlovedaniel</author><pubDate>Mon, 01 Jun 2026 12:00:00 +0800</pubDate><description><![CDATA[孤岛与间隙”算法不仅仅是一个 SQL 技巧，更是一种将“离散状态”转化为“连续事件”的数据建模思维。通过LAG()寻找边界，通过划分孤岛，我们成功将碎片化的 IoT 上报数据，转化为了支撑 MTTR 计算、SLA 考核和预测性维护的坚实数据基石。掌握了这个算法，无论是用户的“连续登录天数”、HR 的“请假区间合并”，还是金融的“连续异常交易拦截”，你都能游刃有余地给出优雅的 SQL 解决方案。]]></description><category></category></item><item><title><![CDATA[某制造业面试题：LOT历史日志设备空值数据补全问题]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161463017</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161463017</guid><author>godlovedaniel</author><pubDate>Thu, 28 May 2026 12:00:00 +0800</pubDate><description><![CDATA[摘要：本文针对半导体晶圆制造中批次流转日志的设备编号空值问题，提出基于SQL窗口函数的分层数据清洗方案。通过划分制程区间（JobPrep~JobOut）和制程间隙（JobOut~JobPrep）两种场景，分别采用区间内JobIn设备填充和沿用前序制程设备的补全规则。方案利用窗口函数实现制程分组和空值填充，无需存储过程即可完成全量数据修复。该纯SQL方案对半导体及其他离散制造业的生产日志治理具有通用参考价值，能有效解决设备统计失真、制程追溯失效等业务痛点。]]></description><category></category></item><item><title><![CDATA[面试问：建模中粒度设计不当会造成什么影响？]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161203014</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161203014</guid><author>godlovedaniel</author><pubDate>Tue, 19 May 2026 11:00:00 +0800</pubDate><description><![CDATA[数据粒度是数据仓库设计的核心要素，直接影响系统性能和业务价值。粒度过细会导致存储成本激增、查询性能下降、ETL流程复杂化；粒度过粗则会丢失细节信息，限制分析深度。此外，不同主题域间的粒度不一致会引发数据口径冲突和集成困难。合理的粒度设计应遵循分层原则（ODS保留原始粒度，DWD采用原子粒度，DWS轻度汇总，ADS高度汇总），以业务需求为导向，平衡性能与分析需求，同时保持粒度一致性并预留扩展空间。错误的粒度决策将造成系统性影响且修复成本高昂。]]></description><category></category></item><item><title><![CDATA[SQL数据分析实战：电商新品高流量低转化问题 ]]></title><link>https://blog.csdn.net/godlovedaniel/article/details/161027009</link><guid>https://blog.csdn.net/godlovedaniel/article/details/161027009</guid><author>godlovedaniel</author><pubDate>Wed, 13 May 2026 12:00:00 +0800</pubDate><description><![CDATA[摘要：某电商平台智能收纳盒新品上线15天转化率仅0.9%，远低于行业平均水平。通过SQL数据分析发现：1）流量质量问题突出，65%流量来自低转化（0.5%）的限时秒杀渠道；2）详情页到加购环节流失率高达97.2%；3）新品价格较竞品高12%但缺乏差异化价值；4）用户反馈中性价比和质量顾虑占比达77%。建议立即优化流量结构，重构详情页展示，加强信任背书，并调整价格策略。]]></description><category></category></item></channel></rss>