- 博客(650)
- 资源 (12)
- 收藏
- 关注
原创 用户行为分析之用户行为路径计算模型
前提什么是用户行为路径? 1用户路径分析,顾名思义,用户在APP或网站中的访问行为路径。为了衡量网站优化的效果或营销推广的效果,以及了解用户行为偏好,时常要对访问路径的转换数据进行分析。以电商为例,买家从登录网站/APP到支付成功要经过首页浏览、搜索商品、加入购物车、提交订单、支付订单等过程。而在用户真实的选购过程是一个交缠反复的过程,例如提交订单后,用户可能会返回首页继续搜索商品,也可能去取消订单,每一个路径背后都有不同的动机。与其他分析模型配合进行深入分析后,能为找到快速用户动机,从而引领用户走向
2021-08-02 08:19:10
1657
2
原创 【Hive SQL 新算法】求任意时间段连续登录N天用户数/用户明细/最长连续登陆天数/用户留存率问题总结
注:本计算方法原创来源于:https://blog.csdn.net/hweinifengkuang/article/details/92832309建测试表CREATE TABLE `user_login_table`( `user_id` int COMMENT '用户ID', `login_date` date COMMENT '登录日期') 插入1000条测试数据数据见文末写SQL-- 第二段 根据登陆时间减去排列顺序 得出用户连续登陆的分组SELECT user
2021-07-31 15:51:31
1966
原创 Hive内部表(MANAGED_TABLE)的“批量删除分区”特性详解
Hive内部表批量删除分区不删数据文件的原理与解决方案 在生产环境中,Hive内部表(MANAGED_TABLE)执行批量删除分区操作时会出现元数据删除但物理文件保留的现象。这是Hive出于性能和安全性考虑的设计特性:批量操作可能涉及大量分区,直接删除文件会导致高I/O开销和潜在风险。该特性会导致存储浪费、数据一致性等问题。 解决方案包括: 直接删除存储文件(高效但需谨慎) 通过MSCK修复元数据后逐分区删除 修改表为外部表改变管理方式 最佳实践建议避免批量删除、定期清理孤儿文件,并在重要场景优先使用单分区
2026-07-14 11:31:07
459
原创 数仓表重跑验数 — 双层快照方法
本文介绍了一种双层快照方法用于验证数仓表重跑后的数据变化情况。该方法结合物理层(文件元数据)和数据层(内容校验)进行双重验证,解决了传统方法可能遇到的缓存假象和误判问题。 核心要点: 利用Trino Hive Connector的隐藏列功能获取文件物理信息(路径、大小、修改时间),这些信息直接来自存储系统而非元数据缓存 采用双层验证机制:先确认物理文件是否被覆盖,再比较数据内容是否变化 通过案例展示了单层快照方法的局限性,以及如何通过添加物理层验证发现幂等空跑情况 提供了具体的SQL查询示例和Python实
2026-05-09 18:51:37
422
原创 由 Rust 开发的能大幅降低LLM token消耗的高性能 CLI 代理工具 rtk
rtk:高效降低LLM交互Token消耗的Rust工具 rtk是一款由Rust开发的高性能CLI代理工具,核心功能是通过智能压缩命令行输出(如ls、git、docker等100+命令),减少传输至大语言模型(LLM)的Token数量。官方数据显示可节省60%-90%的Token开销,处理延迟低于10ms。支持多平台安装(Homebrew/Cargo/脚本),提供预编译二进制和国际化文档。适用于开发者与Claude/GPT等模型交互时显著降低成本,同时保持输出信息的有效性。
2026-04-26 10:04:31
648
原创 基于DAMA-DMBOK企业数据仓库建设规范文档
《企业数据仓库标准化建设指南》摘要 本规范基于DAMA数据管理知识体系,构建企业级数据仓库全流程标准。主要内容包括: 分层架构设计:采用ODS-DWD-DWB-DWS-ADS九层架构,明确各层定位与数据流转规则,禁止跨层调用。 标准化规范:制定严格的库表命名规则(如dwd_order_pay_detail_dd)、字段设计标准(金额用decimal(18,2))、数据类型规范等。 建模开发要求:实施三级建模体系(概念-逻辑-物理),规范事实表与维度表设计,明确ETL开发中的抽取、清洗和SQL编写标准。
2026-04-26 09:24:42
572
原创 基于DAMA-DMBOK的企业数据仓库建设规范文档
本文档制定了企业数据仓库建设的全流程规范,基于DAMA数据管理知识体系,涵盖架构设计、建模开发、命名规则、质量管理等核心内容。规范明确了数仓分层体系(ODS/DWD/DWS/ADS等)及各层职责,严格约束数据流转规则。详细规定了库表命名、分区策略、字段设计、ETL开发等标准,强调指标统一管理、主数据治理和质量管控。同时要求落实元数据管理、数据安全分级和权限最小化原则,确保数据资产标准化、可治理、可追溯。适用于企业各类数据仓库组件和参与角色,旨在解决数据孤岛、质量失控等问题,支撑数据分析应用长期稳定运行。
2026-04-26 09:17:08
454
原创 【hive】hive里的 MACRO 功能用法
Hive 的 MACRO 是一个轻量级的代码复用工具,适合封装简单的表达式和业务逻辑,让 SQL 更清晰、更易维护。但对于复杂逻辑,还是需要使用 UDF。,类似于编程语言中的函数或宏定义。它可以让你封装复杂的表达式,在查询中重复使用,提高代码的可读性和维护性。
2026-02-27 11:39:58
455
原创 【BI】vchart 组合图 显示多个指标,左Y轴为整数,右Y轴为百分比,渲染逻辑
官方文档:https://visactor.io/vchart/guide/tutorial_docs/Chart_Types/Combination。
2026-02-26 10:51:32
200
原创 Droris(强制)删除某一个分区数据
如果不加FORCE,删除分区则是临时删除,并不会立马释放存储空间,如果需要立即释放这些分区所占用的磁盘空间,那就要执行DROP PARTITION FORCE,此时系统不会检查分区中是否有未完成的事务,分区会被直接删除,且无法恢复。
2025-04-09 19:30:16
1246
原创 hive udtf 函数:输入一个字符串,将这个字符串按照特殊的逻辑处理之后,输出4个字段
【代码】hive udtf 函数:输入一个字符串,将这个字符串按照特殊的逻辑处理之后,输出4个字段。
2024-08-06 13:55:26
709
原创 hive udf去掉map中的一个或者多个key
实现一个hive udf,可以将Map中的某一个或者多个key去掉,这里要继承GenericUDF 这个抽象类,然后Override evaluate这个函数即可,可以把执行这个udf前初始化的一些内容放在initialize方法内,比如参数的判断,函数的返回值类型等等。
2024-08-02 20:04:16
654
1
原创 Scala面向对象编程(高级部分)
从面向对象来看,接口并不属于面向对象的范畴,Scala是纯面向对象的语言,在Scala中,没有接口, 也没有implements关键字。Scala语言中,采用trait(特质,特征)来代替接口的概念,也就是说,多个类具有相同的特征(特征)时,就可以将这个特质(特征)独立出来,采用关键字trait声明。
2023-09-06 10:50:00
1342
原创 非计算机科班如何丝滑转码?
非计算机科班的人想要顺利转码成为计算机相关岗位的从业者,需要制定学习计划,学习基础知识,进行项目实践,提升技术能力,并保持对行业动态的关注。计算机岗位的发展前景广阔,对于转码者来说是一个很好的就业选择。
2023-08-11 19:57:16
689
1
原创 shell中,将文件内容按照“,“切割,切割后的第一列做分组键,并将第三列加和,然后按照第三列的和倒序排序打印出来
即将Linux中的文件解析,实现。
2023-08-10 20:08:14
472
原创 shell中按照特定字符分割字符串,并且在切分后的每段内容后加上特定字符(串),然后再用特定字符拼接起来
【代码】shell中按照特定字符分割字符串,并且在切分后的每段内容后加上特定字符(串),然后再用特定字符拼接起来。
2023-07-29 12:39:56
1532
原创 windows中使用imgkit时报错No wkhtmltoimage executable found: “command not found“
首先看官网:https://wkhtmltopdf.org/
2023-05-22 14:37:57
1999
转载 hive行转列过程中使用LATERAL VIEW遇到空MAP或者空数组的情况
【代码】hive行转列过程中使用LATERAL VIEW遇到空MAP或者空数组的情况。
2023-05-19 10:34:11
634
原创 【问题记录】hiveserver2 提交SQL任务慢原因排查
同样一个SQL,在hive cli执行,提交了SQL之后立马就会提交到Yarn上,但是通过hiveserver2 提交,就会经过很长一段时间才会提交到Yarn上,甚至有时候直接报错time out。
2023-05-15 11:16:45
949
原创 checkpoint Kafka Offset commit failed问题记录
checkpoint Kafka Offset commit failed
2023-05-08 10:03:32
1971
2
转载 Word打字很卡顿 Office打字时反应慢 延迟 Excel输入迟钝 PPT卡死的终极解决办法大全(24种方法)
下面就来分享一下处理 Word 文档卡顿 Excel 表格缓慢的一些方法。
2022-11-05 20:33:25
10293
原创 Excel里实现 sum(case when xxx then xxx else xxx end)的用法
【代码】Excel里实现 sum(case when xxx then xxx else xxx end)的用法。
2022-09-08 10:02:41
1923
原创 正则表达式 不以特定 字符开头的行 或者 不包含特定 字符串的行
比如匹配不以a开头的结果作为定位符时, 表示字符串的开始, 表示字符串的结束,不以Lua 或者 Java开头的行:
2022-07-12 10:31:15
5118
1
原创 【Linux】文件,每行内容按“\t“切割,筛选出内容包含“;“ 的 或者 切割后字段数小于16的 行
答案:cat file.txt | awk -F "\t" '{if(NF<16 || index($0,";")) print $0}'这里用到了awk工具。主要用到了以下知识点:-F参数:指定分隔符,可指定一个或多个awk中的内置变量常用字符串函数awk的if语句...
2022-04-21 10:05:40
1650
原创 Blink 任务运行报错
Blink 任务总是报错java.lang.Exception: Exception while creating StreamOperatorStateContext. at org.apache.flink.streaming.api.operators.StreamTaskStateInitializerImpl.streamOperatorStateContext(StreamTaskStateInitializerImpl.java:216) at org.apache.flink.stre
2022-04-20 14:06:23
1083
3
转载 CentOS 7.X yum install没有可用软件包
已加载插件:fastestmirror, langpacksLoading mirror speeds from cached hostfilebase: mirrors.aliyun.comextras: mirrors.aliyun.comupdates: mirrors.dgut.edu.cn没有可用软件包 htop。错误:无须任何处理遇见这种情况,先执行:sudo yum install epel-release然后再试试yum install 其他安装包...
2022-04-15 16:11:34
1392
原创 StarRocks 如何获取profile
1通过 set is_report_success=true 可以打开profile的上报。2在MySQL客户端中执⾏你的sql语句:3打开浏览器,社区版⽤⼾在 http//:FE_IP:FE_HTTP_PORT/query 可以看到当前的查询和Profile信息:进⼊然后复制profile信息...
2022-04-12 13:47:43
1374
原创 hive中的爆炸函数在presto中的写法
hive中的爆炸函数写法:SELECT student, scoreFROM testsLATERAL VIEW explode(scores) t AS score;爆炸函数在presto中的写法:SELECT student, scoreFROM testsCROSS JOIN UNNEST(scores) AS t (score);
2022-03-25 14:25:44
3973
原创 Windows10 从wsl1与升级到wsl2
wsl2支持docker安装,但是我本地wsl安装的是版本1查看wsl版本:打开power shell 执行 wsl --list -v接下来就升级一下wsl的版本。
2022-03-23 18:54:40
4717
原创 在使用flinkcdc同步多个表时遇到报错:A slave with the same server_uuid/server_id as this slave has connected to the
报错信息:flink version:flink-1.13.5cdc version:2.1.1 在使用flinkcdc同步多个表时遇到报错:org.apache.flink.runtime.JobException: Recovery is suppressed by FixedDelayRestartBackoffTimeStrategy(maxNumberRestartAttempts=3, backoffTimeMS=10000)at org.apache.flink.runtime.e
2022-02-17 14:01:02
6947
4
原创 Flink中的JobListener官方文档
ExecutionEnvironment 与 StreamExecutionEnvironment 均有 registerJobListener 方法,可以传进一个 JobListener,在作业提交以及完成的时候调用对应方法。当然,这需要你提交作业的客户端程序一直存在,直到作业完成并且对应函数被调用。https://nightlies.apache.org/flink/flink-docs-master/api/java/org/apache/flink/api/java/ExecutionEnviro
2022-01-10 19:39:07
2552
转载 Python 命令行之旅
本文来自:https://github.com/HelloGitHub-Team/Article文章目录Python 命令行之旅:初探 argparse前言介绍快速开始设置解析器定义参数解析命令行业务逻辑代码梳理小结Python 命令行之旅:深入 argparse(一)前言参数动作参数类别可选参数参数类型参数默认值位置参数可选值互斥参数可变参数列表小结Python 命令行之旅:深入 argparse(二)前言帮助自动生成帮助自定义帮助参数组选项参数前缀共享解析器嵌套解析器自定义动作小节Python 命令行
2021-12-31 20:09:05
813
9
转载 解决 python json.dumps() 中文乱码问题
python 输出一串中文字符,在控制台上(控制台使用UTF-8编码)通过print 可以正常显示,但是写入到文件中之后,中文字符都输出成ascii编码了。英文字符能正常显示可读字符。原因:json.dumps 序列化时默认使用的ascii编码,想输出真正的中文需要指定ensure_ascii=False:更深入分析,是应为dJSON object 不是单纯的unicode实现,而是包含了混合的unicode编码以及已经用utf-8编码之后的字符串。可行的方式如下:import osimport o
2021-12-21 20:17:51
2302
5
原创 flinksql的await
本文来自社区String initialValues = "INSERT INTO kafka\n" + "SELECT CAST(price AS DECIMAL(10, 2)), currency, " + " CAST(d AS DATE), CAST(t AS TIME(0)), CAST(ts AS TIMESTAMP(3))\n" + "FROM (VALUES (2.02,'Eur
2021-12-21 19:25:11
1008
4
原创 hive beeline 链接impala
beeline -d "com.cloudera.impala.jdbc41.Driver" \-u "jdbc:impala://xxxx:21050/;AuthMech=1;KrbRealm=.COM.LOCAL;KrbHostFQDN=xxx;KrbServiceName=impala"
2021-12-20 19:33:03
1485
Apache Flink结合Apache Kafka实现端到端的一致性语义.pdf
2019-05-16
数据仓库数据分层结构
2019-03-02
十大数据分析模型详解_白皮书.pdf
2020-06-24
pentaho-aggdesigner-algorithm-5.1.5-jhyde.jar
2020-08-19
javax.jms-1.1.jar.7z
2020-08-14
hadoop-2.7.2.zip
2020-09-16
sqoop-1.4.6.2.3.99.0-195.jar..zip
2020-08-14
mongodb-win32-x86_64-enterprise-windows-64-4.2.1-signed.msi
2020-06-05
HBase权威指南
2019-03-02
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅