大数据
文章平均质量分 88
大数据相关
进哥聊编程
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
数据仓库:ClickHouse海量存储 —— 列式存储、MergeTree引擎与分布式查询优化实战
在上一篇关于Flink实时流处理的文章中,我们构建了毫秒级延迟的实时数据处理Pipeline。然而,流处理的结果需要持久化存储,并支持高效的即席查询(Ad-hoc Query)。传统的关系型数据库(如MySQL)面对PB级数据分析时力不从心,而Hadoop生态(如Hive)的查询延迟又难以满足实时分析需求。ClickHouse是由俄罗斯Yandex于2016年开源的高性能列式OLAP数据库,专为在线分析处理场景设计。它凭借列式存储向量化执行引擎高压缩率和分布式架构。原创 2026-07-14 09:06:48 · 92 阅读 · 0 评论 -
实时流处理:Flink数据清洗 —— 从DataStream到CEP的完整实战指南
在上一篇关于HDFS+Spark数据湖架构的文章中,我们构建了一个可靠的离线数据存储与批处理体系。然而,面对金融交易风控、IoT设备监控、电商实时推荐等场景,分钟级甚至小时级的批处理延迟已无法满足业务需求。Apache Flink作为业界领先的分布式流处理引擎,以其真正的流处理优先架构毫秒级延迟和精确一次(Exactly-Once)语义保障,成为实时数据处理领域的事实标准。本文将围绕。原创 2026-07-14 09:05:55 · 85 阅读 · 0 评论 -
数据湖架构——HDFS+Spark采集:数据湖概念、HDFS存储、Spark批处理与Schema管理
随着企业数字化转型的深入,数据规模呈指数级增长,传统的数据仓库架构已难以满足海量异构数据的存储与分析需求。2010年,Pentaho创始人James Dixon首次提出"数据湖"(Data Lake)概念,旨在构建一个能够存储原始格式数据的企业级存储库,支持结构化、半结构化和非结构化数据的全量存储与灵活分析。然而,早期的数据湖基于Hadoop生态(HDFS+Spark)构建,在实践中暴露出严重的"数据沼泽"(Data Swamp)问题——数据无序堆积、缺乏Schema管理、没有ACID事务保证。原创 2026-07-14 09:04:11 · 67 阅读 · 0 评论 -
消息队列:Kafka高吞吐采集实战——Topic分区、消费者组、Exactly-Once与性能调优全解析
在上一篇《RabbitMQ深度应用》中,我们深入探讨了AMQP协议下的消息路由与可靠性保障。然而,面对海量日志采集、实时数据流处理、大规模事件驱动等场景,高吞吐量成为了消息队列选型的核心指标。Apache Kafka作为分布式流处理平台的标杆,凭借其顺序写磁盘、零拷贝传输、分区并行消费等设计,单机吞吐量可达数十万条/秒,成为大数据生态的事实标准。本文将围绕Topic分区、消费者组、Exactly-Once语义、性能调优四大核心主题,结合实战代码与架构图,带你深入掌握Kafka的高吞吐采集技术。原创 2026-07-13 09:36:44 · 46 阅读 · 0 评论 -
增量更新与数据同步策略——全量对比、CDC、消息队列同步
如何让多个数据副本保持一致?当爬虫从源站采集的数据需要同步到MySQL从库、Elasticsearch索引、Redis缓存、ClickHouse分析库乃至HarmonyOS元服务时,简单的"复制粘贴"早已无法满足生产需求。本文作为鸿蒙生态赋能活动(第五期)技术实战系列的第五十二篇,将系统梳理全量对比、CDC(变更数据捕获)、消息队列三大同步策略的工程实现,深入探讨CAP理论下的选型权衡,并提供经过生产验证的代码架构。所有方案均支持从爬虫采集端到多端存储的完整数据链路。策略核心机制延迟侵入性。原创 2026-07-12 12:03:32 · 42 阅读 · 0 评论 -
大数据治理:定义、原则与实践案例
大数据治理是指在大数据环境中,通过一系列政策、流程和技术手段,对数据进行统一管理,确保数据资产的高效利用和合规性。它涵盖了数据的获取、处理、存储、安全等各个环节,旨在通过优化和提升大数据的架构、质量、标准、安全等技术指标,显著推动大数据的服务创新。大数据治理是企业提升数据管理能力、优化决策支持、保障数据安全的关键手段。通过遵循核心原则和实施有效的治理框架,企业可以更好地管理数据资产,实现数据的高效利用和合规性。希望本文的介绍和案例分析能够为企业的数据治理实践提供有益的参考。原创 2025-04-23 07:52:02 · 14683 阅读 · 15 评论 -
Hadoop HA集群两个NameNode都是standby或者主NameNode是standby,从NameNode是active的情况集锦
这里说一下配置Hadoop HA集群可能出现的两种情况,第一种就是两个NameNode都是standby,第二种就是主Master是standby,从Master是active。原创 2023-08-17 21:54:11 · 52851 阅读 · 140 评论 -
如何学习大数据
大数据依然是当下热门的技术之一,就犹如之前的移动开发刚开始火的时候一样,之前写了一系列的大数据开发所需的组件安装,但还从来没想过要怎么学习大数据,正好趁这次机会写一写。大数据技术是当前互联网和信息化领域的热门技术之一,随着数据量急剧增长和结构复杂化,对大数据技术的需求也越来越大。如果想要从事相关领域的工作,学习大数据技术就是必不可少的一步。本文将为大家介绍学习大数据技术的基本途径和方法,希望能够帮助大家更好地入门和掌握大数据技术。原创 2023-08-12 07:32:17 · 63541 阅读 · 159 评论 -
Windows下JDK安装与环境变量配置
JDK(Java Development Kit)是Java开发工具包的缩写,包含了Java编译器、Java虚拟机、Java类库等众多组件,是Java开发的基石,提供了编写、编译和运行Java程序所必需的工具。同时,为了让系统能够正确识别Java环境,在开始使用JDK进行Java开发之前,需要先把JDK安装到本地计算机,并配置好相应的环境变量。本文将介绍JDK安装与环境变量配置的方法。原创 2023-08-04 22:15:47 · 49444 阅读 · 156 评论 -
ERROR util.Shell: Failed to locate the winutils binary in the hadoop binary path
或者。原创 2023-06-26 13:03:17 · 38435 阅读 · 28 评论 -
Error: JAVA_HOME is incorrectly set. Please update C:\hadoop-2.5.1\conf\hadoop-env.cmd ‘
有些同学在Windows下解压安装好Hadoop后执行。原创 2023-06-25 20:25:12 · 37843 阅读 · 19 评论 -
Hadoop运行报ERROR: Attempting to operate on hdfs as root或者HDFS_ZKFC_USER defined错误的解决方法
修改start-yarn.sh和stop-yarn.sh。修改start-dfs.sh和stop-dfs.sh。使用root账号启动服务,但没预先定义。修改后重新启动Hadoop就成功了!欢迎start,欢迎评论,欢迎指正。原创 2023-06-26 14:06:18 · 57961 阅读 · 32 评论 -
Windows系统下安装Hadoop
前面我们已经讲过了在,还没看过的可以先去了解一下安装流程。今天我们来看一下如何在Window下安装Hadoop,这其实和在Linux下的安装都是大同小异的。下面我们具体来看一下安装步骤。原创 2023-06-24 17:46:47 · 43883 阅读 · 25 评论 -
配置Linux操作系统主机名及网络设置
三台虚拟机Spark01、Spark02和Spark03默认为动态IP地址,若后续重启系统后IP地址便会发生改变,非常不利于实际开发,且虚拟机Spark02和Spark03是通过克隆虚拟机Spark01创建的,这会导致这两台虚拟机的主机名与虚拟机Spark01的主机名一致,造成通信混淆的现象,同一主机名会指向不同的虚拟机。进入相应的目录查看ifcfg-eno后面的相应数字是什么,或者也可以输入这个命令输入到ifcfg-eno的时候按tab键补全。好了,这一篇我们就讲到这里,下一篇我们将讲一下如何。原创 2023-06-06 23:04:15 · 41893 阅读 · 21 评论 -
大数据相关常用软件下载地址集锦
由于大数据开发中经常需要用到Zookeeper、Hadoop、Spark、HBase、Kafka、Flume、Redis、Hive等软件,安装的时候需要它们的下载地址,这里就汇总一下,方便同学们查找。欢迎start,欢迎评论,欢迎指正。一、软件下载地址如下。原创 2023-06-20 19:51:47 · 39985 阅读 · 32 评论 -
Kafka集群部署
好了,Kafka的集群部署我们就讲到这里了,这几篇主要针对大数据集群环境的搭建进行了讲解,包括创建虚拟机、Linux操作系统的安装与配置、安装JDK、ZooKeeper集群部署、Hadoop集群部署、Spark集群部署、HBase集群部署以及Kafka集群部署。通过这几篇的学习,希望读者熟悉大数据集群环境的搭建流程,并掌握ZooKeeper、Hadoop、Spark、HBase和Kafka集群的部署,为后续项目的开展奠定基础。启动Kafka集群时,需要确保ZooKeeper集群是正常启动的。原创 2023-06-15 21:50:13 · 54005 阅读 · 23 评论 -
HBase集群部署
利用ZooKeeper作为分布式应用程序协调服务,同时存储HBase集群的元数据信息可以为HBase集群提供故障自动转移功能,以保证HBase集群的高可用。进入Hadoop安装目录的conf目录,将配置文件core-site.xml和hdfs-site.xml复制到HBase安装目录下的conf目录,用于HBase启动时读取Hadoop的核心配置信息和HDFS配置信息。在虚拟机Spark01中,通过解压缩的方式安装HBase,将HBase安装到存放应用的目录/export/servers/。原创 2023-06-14 21:15:00 · 64800 阅读 · 24 评论 -
Spark集群部署和启动与关闭
YARN(Spark on YARN模式)是一款资源调度管理系统,支持动态资源分配策略,可以为Spark提供资源调度服务,由于在生产环境中,很多时候都要与Hadoop同在一个集群,所以采用YARN来管理资源调度,可以降低运维成本和提高资源利用率,避免出现多个资源管理器造成资源分配的混乱无序的问题。Mesos(Spark on Mesos模式)是一款资源调度管理系统,可以为Spark提供资源调度服务,由于Spark与Mesos存在密切的关系,所以在设计Spark框架时充分考虑到了对Mesos的集成。原创 2023-06-13 22:05:20 · 51628 阅读 · 17 评论 -
Hadoop集群部署和启动与关闭
为了提高Hadoop集群的高可用性,集群中至少需要两个NameNode节点(一个主节点,一个备用节点)和两个ResourceManager节点 (一个主节点,一个备用节点)以满足HDFS和YARN的高可用性,同时为了满足“过半写入则成功”的原则,集群中至少需要三个 JournalNode节点。在虚拟机Spark01中的NameNode主节点执行初始化命令后,需要将元数据目录的内容复制到其他未格式化的 NameNode备用节点(虚拟机Spark02)上,确保主节点和备用节点的NameNode数据一致。原创 2023-06-12 22:43:39 · 40953 阅读 · 11 评论 -
ZooKeeper的集群部署和启动与关闭
分别在虚拟机Spark01、Spark02和Spark03 的/export/data/zookeeper/zkdata目录中创建myid文件,在虚拟机Spark01的myid文件中写入值1,在虚拟机Spark02的myid文件中写入值2,在虚拟机Spark03的myid文件中写入值3。”命令编辑ZooKeeper配置文件zoo.cfg,修改参数“dataDir”配置存储快照文件的目录,添加参数“server.x”指定ZooKeeper集群包含的服务器。”命令启动ZooKeeper服务。原创 2023-06-11 22:18:00 · 42774 阅读 · 20 评论 -
提示-bash: command not found的解决方法集锦
3、export PATH=“$PATH:/phpstudy/mysql/bin” #在该文件中加入 command not found 的应用 bin 目录,这里我是将 mysql 的 bin 放到这里,因为我是 mysqld / mysqldump / mysqladmin 命令用不了。第三个这和Windows是相同的道理,都是环境变量惹的祸,就是说你的 命令的 执行文件不在 /usr/bin 或者 /etc/init.d 中,他就找不到 执行该命令的 文件来执行。1.你将命令的名称拼错了。原创 2023-06-10 21:42:42 · 88757 阅读 · 29 评论 -
Linux搭建配置jdk开发环境
注意:这里我使用的可视化工具是SecureCRT,读者也可以使用其他的可视化工具(如:MobaXterm、xshell、finalShell等),可以直接将jdk拖拽到Linux的文件目录里面。通过SecureCRT远程连接工具连接虚拟机Spark01,进入Linux操作系统中存放应用安装包的目录/export/software/,在该目录下执行“”命令查看JDK版本,验证虚拟机Spark01中的JDK环境。好了,jdk的安装和配置还是比较简单的,我们就讲到这里了,下一篇我们将讲解。原创 2023-06-10 09:59:40 · 36009 阅读 · 29 评论 -
配置Linux服务器时间同步
这是由于由于在线安装Chrony时会直接安装最新版的Chrony ,可能会导致Chrony 版本与当前Linux内核版本不一致,导致Chrony服务启动报错,可通过升级Linux内核版本解决此类问题。Chrony是网络时间协议(NTP)的通用实现,它能保持系统时间与时间服务器(NTP)同步,为集群中的其他计算机提供时间服务,确保集群时间一致。这里说一下为什么要配置时间同步这个问题,为了避免各虚拟机的时间出现不一致的情况而引发集群故障。”命令,编辑集群的时间客户端配置文件chrony.conf。原创 2023-06-08 21:38:07 · 42550 阅读 · 29 评论 -
配置SSH远程登录和免密登录
首先讲一下我们为什么要配置SSH 免密登录,通过VMware Workstation工具操作虚拟机十分不方便,无法复制内容到虚拟机中,也无法开启多个虚拟机窗口进行操作,并且在实际工作中,服务器通常被放置在机房中,同时受到地域和管理的限制,开发人员通常不会进入机房直接上机操作,而是通过远程连接服务器,进行相关操作。”选项,弹出“Session Options”窗口,在该窗口选中“Appearance”,将“Character encoding”处的值修改为“UTF-8”。欢迎start,欢迎评论,欢迎指正。原创 2023-06-07 22:05:31 · 43536 阅读 · 26 评论 -
克隆虚拟机
下面我们来讲一下如何通过已经创建好的虚拟机spark01克隆出spark02和spark03来,从而满足搭建大数据集群环境需要多台虚拟机的需求。完整克隆的虚拟机可以脱离原始虚拟机独立使用,不与原始虚拟机共享任何资源,是完全独立的虚拟机。链接克隆的虚拟机需要和原始虚拟机共享同一虚拟磁盘文件,不能脱离原始虚拟机独立运行。我们自然是要选择完整克隆的,我们需要的是完全独立的虚拟机。克隆虚拟机我们就讲到这里了。下一篇我们将讲一下如何。欢迎start,欢迎评论,欢迎指正。上一篇我们已经讲过了。原创 2023-06-04 21:12:42 · 40926 阅读 · 13 评论 -
启动虚拟机并安装Linux系统
我们刚刚新建的虚拟机相当于一个裸机,还没有安装操作系统在里面,下面我们来看一下怎么进行Linux系统的安装。虚拟机和Linux的安装就到这里了。下一篇我们将通过已经创建好的虚拟机和Linux。Spark02和Spark03,从而满足搭建大数据集群环境需要多台虚拟机的需求。可以单击“Network Time”开关通过获取网络时间自动调整系统时间。欢迎start,欢迎评论,欢迎指正。原创 2023-06-01 22:44:43 · 43139 阅读 · 12 评论 -
安装VMware Workstation和虚拟机教程
一、VM简介 VMware Workstation中文版是一个“虚拟 PC”软件。它使你可以在一台机器上同时运行二个或更多 Windows、DOS、LINUX 系统。与“多启动”系统相比,VMWare 采用了完全不同的概念。多启动系统在一个时刻只能运行一个系统,在系统切换时需要重新启动机器。VMWare 是真正“同时”运行,多个操作系统在主系统的平台上,就象标准 Windows 应用程序那样切换。而且每个操作系统你都可以进行虚拟的分区、配置而不影响真实硬盘的数据,你甚至可以通过网卡将几台虚拟机用网卡连接原创 2023-05-29 22:12:02 · 39995 阅读 · 2 评论 -
初识Linux操作系统及常用的Linux命令
伴随互联网的发展,企业对服务器速度和安全的要求越来越高,Linux系统由于具有性能稳定、防火墙组件性能高效、配置简单等优势,得到了越来越多组织、公司和软件爱好者的支持,逐渐成为服务器首选。CentOS是商业版RHEL(Red Hat Enterprise Linux)源代码再编译的产物,由于出自同样的源代码,因此CentOS具有高度稳定性,企业中的服务器通常以CentOS替代商业版的Red Hat Enterprise Linux使用。12.文件或者目录搜索的命令:find。19.vim文本编辑器。原创 2023-05-25 21:36:47 · 36836 阅读 · 3 评论
分享