- 博客(100)
- 收藏
- 关注
原创 Spark - Code 核心教程
RDD(Resilient Distributed Dataset)叫做弹性分布式数据集,是 Spark 中最基本的数据处理模型。代码中是一个抽象类,它代表一个弹性的、不可变、可分区、里面的元素可并行计算的集合。➢ 弹性存储的弹性:内存与磁盘的自动切换;容错的弹性:数据丢失可以自动恢复;计算的弹性:计算出错重试机制;分片的弹性:可根据需要重新分片。➢ 分布式:数据存储在大数据集群不同节点上➢ 数据集:RDD封装了计算逻辑,并不保存数据➢ 数据抽象:RDD是一个抽象类,需要子类具体实现。
2026-05-16 10:39:10
576
原创 Scala - 基础教程
1)类型函数1:无参,无返回值函数2:无参,有返回值函数3:有参,无返回值函数4:有参,有返回值函数5:多参,无返回值函数6:多参,有返回值2)案例实操// 函数1:无参,无返回值println("无参,无返回值")//函数2:无参,有返回值println("无参,有返回值")1//函数3:有参,无返回值println("有参,无返回值 : " + a)//函数4:有参,有返回值println("有参,有返回值 :" + b)b//函数5:多参,无返回值。
2026-05-08 15:46:30
677
4
原创 (第十五篇)spring cloud之Sentinel实现熔断与限流
(1)创建自定义限流处理类return "自定义的限流处理信息......MyBlockHandler";(2)业务类return "访问成功 OK";(3)配置(4)测试超过阈值返回自定义阈值。
2026-04-27 17:26:59
596
原创 Azkaban - 入门教程
Azkaban 是由Linkedin 公司推出的工作流任务调度器,主要用于在一个工作流内以一个特定的顺序,它的配置是通过简单的key:value对的方式,通过配置中的Dependencies 来设置依赖关系。Azkaban使用job配置文件建立任务之间的依赖关系,并提供一个易于使用的web用户界面维护和跟踪创建的工作流。官网地址。
2026-04-20 18:36:02
624
原创 Canal - 数据同步
MySQL 的二进制日志可以说MySQL最重要的日志了,它记录了所有的DDL和DML(除了数据查询语句)语句,以事件形式记录,还包含语句所执行的消耗的时间,MySQL的二进制日志是事务安全型的。一般来说开启二进制日志大概会有1%的性能损耗。其一:MySQL Replication在Master端开启binlog,Master 把它的二进制日志传递给slaves 来达到master-slave 数据一致的目的。其二:数据恢复,通过使用mysqlbinlog工具来使恢复数据。
2026-04-20 17:59:56
410
原创 DolphinScheduler-保姆级教程
1)创建工作流A2)创建工作流B3)创建工作流C4)保存工作流a、自定义日期格式可以对 $[yyyyMMddHHmmss] 任意分解组合,如 $[yyyyMMdd], $[HHmmss], $[yyyy MM-dd]。b、add_months() 函数使用 add_months() 函数用于加减月份第一个入口参数为[yyyyMMdd],表示返回时间的格式第二个入口参数为月份偏移量,表示加减多少个月。参数说明后 N 年前 N 年后 N 月前 N 月c、直接加减数字。
2026-04-18 16:14:41
1093
原创 MaxWell 高级教程
MySQL 的二进制日志可以说MySQL最重要的日志了,它记录了所有的DDL和DML(除了数据查询语句)语句,以事件形式记录,还包含语句所执行的消耗的时间,MySQL的二进制日志是事务安全型的。一般来说开启二进制日志大概会有1%的性能损耗。其一:MySQL Replication在Master端开启binlog,Master 把它的二进制日志传递给slaves 来达到master-slave 数据一致的目的。其二:数据恢复,通过使用mysqlbinlog工具来使恢复数据。
2026-04-18 16:13:18
678
原创 MySQL函数大全
ASCII()将每个参数对应的整数转为对应的字符,并将这些字符组成一个字符串返回按顺序拼接多个字符串,并返回拼接后的字符串;如果拼接的参数中一个为NULL, 则返回NULL;通过指定的分隔符按顺序拼接多个字符串,并返回拼接后的字符串。返回指定位置的字符串。pos:指定位置数字;str1,...:字符串参数列表指定的值在给定的列表中的索引。1、返回的索引的值从1开始。2、如果在列表中找不到指定的值,函数返回0返回字符串在一个逗号分隔的字符串列表中的索引将数字四舍五入到指定的小数位数;
2026-04-17 11:28:58
425
原创 Java8 - Stream和Optional超详解
super T, A, R> collector)是最常用终端操作,通过Collectors工具类实现复杂收集。如果传入的是 null,则抛出 NullPointerException。还有IntStream、LongStream、DoubleStream。创建包含非空值的 Optional 对象。4)合并两个 List 并去重。5)分组后对分组内元素做映射。2)收集为不可变集合。
2026-04-16 16:57:46
379
原创 (第十四篇)spring cloud之Nacos
Nacos(Dynamic Naming and Configuration Service)是阿里巴巴开源的动态服务发现、配置管理和服务管理平台,致力于帮助开发者快速构建云原生应用Nacos。它源自阿里内部十年技术沉淀,历经双十一高并发场景验证,支持百万级服务实例,兼容主流微服务框架(Spring Cloud、Dubbo 等),是国内微服务生态的核心组件之一。其中包含了注册中心和配置中心等核心模块,相当于 Eureka+Config +BusGitHub地址官网地址。
2026-04-08 15:55:35
401
原创 Hbase - 入门到实战
HBase 是一种分布式、可扩展、支持海量数据存储的NoSQL数据库。实现将HDFS中的数据写入到Hbase表中。a、构建Mapper读取HDFS中的文件数据@Override// 获取一行数据// 数据处理// 根据数据中值的含义取值//初始化rowKey// 初始化put// 添加参数// 输出b、构建Reducer类@Override//读出来的每一行数据写入到fruit_hdfs表中c、创建Driver组装Job。
2026-04-07 18:49:07
715
原创 Flume-使用与详解
Flume 是Cloudera 提供的一个高可用的,高可靠的,分布式的海量日志采集、聚合和传 输的系统。Flume基于流式架构,灵活简单。Flume官网地址文档查看地址在实际的开发中,一台服务器产生的日志类型可能有很多种,不同类型的日志可能需要发送到不同的分析系统。此时会用到Flume拓扑结构中的。
2026-03-30 16:54:31
706
原创 Hive - 函数、压缩与优化
当Hive 提供的内置函数无法满足你的业务处理需要时,此时就可以考虑使用用户自定义 函数(UDF:user-defined function)。UDF(User-Defined-Function) 一进一出UDAF(User-Defined Aggregation Function) 聚集函数,多进一出 类似于:count/max/minUDTF(User-Defined Table-Generating Functions) 一进多出 如lateral view explode()
2026-03-27 16:19:26
550
原创 Hive - 安装与使用
(1)hive 简介Hive:由 Facebook 开源用于解决海量结构化日志的数据统计工具。Hive 是基于 Hadoop 的一个数据仓库工具,可以将结构化的数据文件映射为一张表,并 提供类 SQL 查询功能。(2) Hive 本质:将 HQL 转化成 MapReduce 程序(1)Hive 处理的数据存储在 HDFS(2)Hive 分析数据底层的实现是 MapReduce(3)执行程序运行在 Yarn 上。
2026-03-24 15:06:11
939
原创 Hadoop2 - MapReduce框架原理
自定义一个类继承FileInputFormat,改写RecordReader,实现一次读取一个完整文件封装为KV,在输出时使用SequenceFileOutPutFormat输出合并文件为了实现控制最终文件的输出路径,可以自定义OutputFormat。要在一个mapreduce程序中根据数据的不同输出两类结果到不同目录,这类灵活的输出需求可以通过自定义outputformat来实现。1)自定义一个类继承FileOutputFormat。
2026-02-28 17:24:30
1411
1
原创 Hadoop2 - MapReduce详解
(1)是什么序列化就是把内存中的对象,转换成字节序列(或其他数据传输协议)以便于存储(持久化)和网络传输。反序列化就是将收到字节序列(或其他数据传输协议)或者是硬盘的持久化数据,转换成内存中的对象。(2)Java序列化Java的序列化是一个重量级序列化框架(Serializable),一个对象被序列化后,会附带很多额外的信息(各种校验信息,header,继承体系等),不便于在网络中高效传输。所以,hadoop自己开发了一套序列化机制(Writable),精简、高效。(3)Hadoop序列化。
2026-02-28 17:22:20
835
原创 Hadoop2 - HDFS文件系统
1HDFS(Hadoop Distributed File System)是 Apache Hadoop 生态的核心组件之一,是专门为海量数据存储设计的分布式文件系统。你可以把它理解成 “大数据时代的分布式超级硬盘”—— 它将超大文件切分成小块,分散存储在集群的多台廉价商用服务器上,同时对外提供统一的文件访问接口,让用户感觉就像使用本地文件系统一样。
2026-02-07 17:36:29
1027
原创 Hadoop2 - HDFS高可用
所谓HA(high available)就是24小时不中断服务,实现高可用最关键的策略是消除单点故障。HA严格来说应该分成各个组件的HA机制:HDFS的HA和YARN的HA。Hadoop2.0之前,在HDFS集群中NameNode存在单点故障(SPOF)。NameNode主要在以下两个方面影响HDFS集群:NameNode机器发生意外,如宕机,集群将无法使用,直到管理员重启NameNode机器需要升级,包括软件、硬件升级,此时集群也将无法使用。
2026-02-06 22:33:43
961
原创 Hadoop2 - 介绍使用与集群搭建
Hadoop是一个由Apache基金会所开发的分布式系统基础架构,它主要解决海量数据的存储和海量数据的分析计算问题。广义上来说,Hadoop通常是指一个更广泛的概念——Hadoop生态圈四个配置文件存放在$HADOOP_HOME/etc/hadoop下面,用户可以根据项目需求重新进行修改配置。
2026-02-06 10:06:23
987
原创 Hadoop2 【源码编译】
编辑配置文件,将所有 $releasever 替换为 7(避免变量解析问题)编译期间maven报错,可能网络阻塞问题导致依赖库下载不完整导致,多次执行命令。# 重建缓存(这一步会下载镜像源的包列表,耐心等待)# 启用 epel 源(可选,但能补充更多依赖)过程比较漫长,最终成功是全部SUCCESS,如果。安装glibc-headers和gcc-c++# 下载阿里云 CentOS 7 归档源配置。# 移动所有 .repo 文件到备份目录。(build工具,打包用的)重命名为jdk1.8。
2026-02-05 17:17:00
884
原创 什么是 -大数据
大数据的本质是 **“从海量数据中挖掘价值,用数据驱动决策和创新”**,它不仅是一种技术,更是一种思维方式和发展模式。从技术层面,大数据以分布式计算存储为核心,形成了全流程的技术体系;从产业层面,大数据构建了上下游协同的产业生态;从应用层面,大数据已渗透到各行各业,成为数字经济的核心支撑。尽管大数据面临着数据孤岛、安全隐私、人才短缺等挑战,但随着云原生、隐私计算、实时流处理等技术的突破,以及数据要素市场化的加速,大数据的价值将得到更充分的释放。
2026-02-05 17:16:35
1330
原创 什么是Hadoop
Hadoop 作为大数据技术的奠基性框架,通过 "普通硬件集群化 + 分布式存储 + 分布式计算" 的核心思想,彻底改变了海量数据处理的成本与效率。尽管面临 Spark 等新兴技术的挑战,Hadoop 凭借成熟的生态系统和稳定的核心能力,仍是企业构建大数据平台的首选基础架构之一,尤其在离线批量数据处理和数据仓库场景中占据不可替代的地位。
2026-01-24 18:07:13
1706
1
原创 LangcChain4J - Java必备技能
LangChain4j 的目标是简化将大型语言模型集成到 Java 应用中官网地址文档地址@AiService官网地址低阶api有最多的选择,可以使用所有底层组件,比如ChatModel等。这些是基于LLM的应用中的“primitives”。可以完全控制组合它们,但需要写更多的代码。Embedding高阶api在程序员自己定义接口,通过AiServices类里面的方法实现,优点是Api封装度较高,减少代码的复杂度,但是仍可以进行微调流式输出(StreamingOutput)是一种。
2026-01-24 17:56:53
1631
原创 (第十三篇)spring cloud之Sleuth分布式链路跟踪
在微服务框架中,一个由客户端发起的请求在后端系统中会经过多个不同的的服务节点调用来协同产生最后的请求结果,每一个请求都会形成一条复杂的分布式服务调用链路,链路中的任何一环出现高延时或错误都会引起整个请求最后的失败。Spring Cloud Sleuth 为提供了分布式追踪解决方案的 API。它与集成Spring Cloud Sleuth 能够追踪您的请求和消息,从而将这些通信与相应的日志条目关联起来。你也可以把追踪信息导出到外部系统,以直观地显示延迟。Spring Cloud Sleuth 直接支持。
2026-01-24 14:36:40
743
原创 (第十二篇)spring cloud之Stream消息驱动
Spring Cloud Stream 是一个构建消息驱动微服务的框架。应用程序通过 inputs 或者 outputs 来与 Spring Cloud Stream中binder对象交互。通过我们配置来binding(绑定) ,而 Spring Cloud Stream 的 binder对象负责与消息中间件交互。所以,我们只需要搞清楚如何与 Spring Cloud Stream 交互就可以方便使用消息驱动的方式。
2026-01-21 11:23:55
750
原创 (第十一篇)spring cloud之Bus消息总线
Spring Cloud Bus是用来将分布式系统的节点与轻量级消息系统链接起来的框架,它整合了Java的事件处理机制和消息中间件的功能。Spring Clud Bus目前支持RabbitMQ和Kafka。Spring Cloud Bus能管理和传播分布式系统间的消息,就像一个分布式执行器,可用于广播状态更改、事件推送等,也可以当作微服务间的通信通道。官方文档。
2026-01-21 09:52:39
703
原创 (第十篇)spring cloud之Config分布式配置中心
SpringCloud Config为微服务架构中为微服务提供集中化的外部配置支持,为各个不同微服务应用提供了一个中心化的外部配置。SpringCloud Config分为服务端和客户端两部分:服务端也称为分布式配置中心,它是一个独立的微服务应用,用来连接配置服务器并为客户端提供获取配置信息,加密/解密信息等访问接口。
2026-01-19 18:10:08
653
原创 (第九篇)spring cloud之Gateway网关
SpringCloud Gateway 是 Spring Cloud 的一个全新项目,基于 Spring 5.0+Spring Boot 2.0 和 Project Reactor 等技术开发的网关,它旨在为微服务架构提供一种简单有效的统一的 API 路由管理方式。
2026-01-19 18:09:33
941
原创 (第七篇)spring cloud之Hystrix断路器
(1)概述Hystrix是一个用于处理分布式系统的延迟和容错的开源库,在分布式系统里,许多依赖不可避免的会调用失败,比如超时、异常等,Hystrix能够保证在一个依赖出问题的情况下,不会导致整体服务失败,避免级联故障,以提高分布式系统的弹性。
2026-01-17 16:36:16
773
原创 (第八篇)spring cloud之zuul路由网关
Zuul是一种提供动态路由、监视、弹性、安全性等功能的边缘服务。它是Netflix出品的一个基于JVM路由和服务端的负载均衡器。API网关为微服务架构中的服务提供了统一的访问入口,客户端通过API网关访问相关服务。API网关的定义类似于设计模式中的门面模式,它相当于整个微服务架构中的门面,所有客户端的访问都通过它来进行路由及过滤。它实现了请求路由、负载均衡、校验过滤、服务容错、服务聚合等功能。路由、过滤、负载均衡、灰度发布灰度发布。
2026-01-17 16:35:43
693
原创 什么是MCP
是由 Anthropic 公司于 2024 年 11 月推出的,被誉为 AI 领域的 “USB-C 接口”,核心目标是,解决传统 AI 集成中 “工具碎片化、适配成本高、安全可控难” 的三大痛点。
2026-01-16 18:33:29
753
原创 Spring AI Alibaba百炼平台 - Java开发者首选
Spring Al Alibaba 项目的产生背景是生成式 AI与大模型在过去一年的快速发展,我们作为使用方、开发者,更关注的应该是如何为我们的应用接入生成式AI能力。在这样的背景下,Spring 官方开源了 Spring Al 框架,用来简化 Spring 开发者开发智能体应用的过程。随后阿里巴巴开源了 Spring Al Alibaba,它基于 Spring Al,同时与阿里云百炼大模型服务、通义系列大模型做了深度集成与最佳实践。
2026-01-16 18:32:26
1912
1
原创 SpringAI+Deepseek大模型应用实战
Spring AI是一个AI工程领域的应用程序框架;Spring AI 是 AI 工程的应用框架。其目标是将 Spring 生态系统设计原则(如可移植性和模块化设计)应用于 AI 领域,并促进使用 POJO 作为应用程序的构建块到 AI 领域。它的目标是将Spring生态系统的设计原则应用于 AI 领域,比如Spring生态系统的可移植性和模块化设计,并促进使用 POJO 作为应用程序的构建块到 AI 领域;
2026-01-09 18:04:26
1130
原创 Python数据可视化 Matplotlib库
Matplotlib是一个Python绘图库,广泛用于创建各种类型的静态、动态和交互式图表。它是数据科学、机器学习、工程和科学计算领域中常用的绘图工具之一。支持多种图表类型:折线图(Line plots)散点图(Scatter plots)柱状图(Bar charts)直方图(Histograms)饼图(Pie charts)热图(Heatmaps)箱型图(Box plots)极坐标图(Polar plots)3D图(3D plots,配合 mpl_toolkits.mplot3d)。
2025-12-31 17:27:58
1138
原创 Python科学计算 Pandas库
Pandas 是 Python 数据分析工具链中最核心的库,充当数据读取、清洗、分析、统计、输出的高效工具。是一个开源的数据分析和数据处理库,它是基于 Python 编程语言的。提供了易于使用的数据结构和数据分析工具,特别适用于处理结构化数据,如表格型数据(类似于Excel表格)。是数据科学和分析领域中常用的工具之一,它使得用户能够轻松地从各种数据源中导入数据,并对数据进行高效的操作和分析。
2025-12-27 18:32:28
1032
原创 Python科学计算 Numpy库
numpy是Python中科学计算的基础包。它是一个Python库,提供多维数组对象、各种派生对象(例如掩码数组和矩阵)以及用于对数组进行快速操作的各种方法,包括数学、逻辑、形状操作、排序、选择、I/O 、离散傅里叶变换、基本线性代数、基本统计运算、随机模拟等等。
2025-12-02 18:26:33
912
原创 (第六篇)spring cloud之OpenFeign远程调用
Feign是一个声明式WebService客户端。使用Feign能让编写Web Service客户端更加简单。它的使用方法是定义一个服务接口然后在上面添加注解。Feign也支持可拔插式的编码器和解码器。Spring Cloud对Feign进行了封装,使其支持了Spring MVC标准注解和HttpMessageConverters。Feign可以与Eureka和Ribbon组合使用以支持负载均衡。官网。
2025-08-19 14:21:26
1010
原创 jenkins自动化部署
(1)将下载的压缩包解压到指定目录:/opt/softwore/jdk-17.0.12(2)配置jdk环境变量:(3)重新加载环境变量(4)验证。
2025-08-19 14:13:41
1529
原创 (第五篇)spring cloud之Ribbon负载均衡
Spring Cloud Ribbon是基于Netflix Ribbon实现的一套客户端负载均衡的工具。Ribbon是Netflix发布的开源项目,主要功能是提供客户端的软件负载均衡算法和服务调用。Ribbon客户端组件提供一系列完善的配置项如连接超时,重试等;Ribbon目前也进入维护模式。IRule:根据特定算法从服务列表中选取一个要访问的服务com.netflix.loadbalancer.RoundRobinRule:轮询。
2025-08-19 10:56:21
938
2
原创 (第四篇)spring cloud之Consul注册中心
Consul 是一套开源的分布式服务发现和配置管理系统,由 HashiCorp 公司用 Go 语言开发。它提供了微服务系统中的等功能。这些功能中的每一个都可以根据需要单独使用优点包括: 基于 raft 协议,比较简洁;支持健康检查, 同时支持 HTTP 和 DNS 协议 支持跨数据中心的 WAN 集群 提供图形界面 跨平台,支持 Linux、Mac、Windows。官网服务发现:提供HTTP和DNS两种发现方式。健康检查:支持多种方式,HTTP、TCP、Docker、Shell脚本定制化监控。
2025-08-15 18:13:04
594
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅