Hive数据仓库实践
文章平均质量分 59
酒城译痴无心剑
国家三级笔译。一手代码一手诗,酸甜苦辣寸心知。杏坛泊梦千秋事,万古云山日迟迟。讲授高等数学、Java高级程序设计、动态网站设计与开发(JSP、Servlet)、企业信息系统设计与开发(Spring Boot)、智能移动终端应用开发(Android)、Python Web开发(Django)、大数据离线分析(Hadoop、Hive、Spark)、计算机专业英语等课程,教学深入浅出,语言生动、经验丰富,深受学生好评。指导学生参加移动应用开发省赛和国赛,多次获奖,被授予优秀指导教师称号。热爱翻译,曾翻译西奥尼·帕帕斯数学科普读物《天天数学》与两千余首诗词,已形成独特的译诗风格。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Hive实战任务 - 9.5 实现网址去重
本实战通过Hive对三个含重复IP的文本文件进行去重处理,创建外部表加载HDFS数据,使用DISTINCT或collect_set+explode实现去重,并将唯一IP列表持久化至HDFS输出目录,完整展示了Hive在大数据清洗与去重场景中的高效应用。原创 2025-12-18 09:28:25 · 398 阅读 · 0 评论 -
Hive实战任务 - 9.4 分科汇总求月考平均分
本实战利用Hive分区表管理学生三科月考成绩,按科目(语文、数学、英语)分别加载数据,通过分组聚合计算每位学生的各科平均分,并进一步使用条件聚合实现单行展示三科月考平均分,最终将结果导出至HDFS,完整体现了Hive在多维度成绩分析中的高效处理能力。原创 2025-12-18 09:22:51 · 646 阅读 · 0 评论 -
Hive实战任务 - 9.3 实现学生信息排序和统计
本实战基于Hive对HDFS中的学生信息进行多维度分析,创建外部表后实现按性别升序、年龄降序的复合排序,并统计男女生平均年龄,最终以二元组格式将汇总结果导出至HDFS,完整展示了Hive在结构化数据排序、分组聚合与结果持久化方面的应用能力。原创 2025-12-18 09:18:40 · 318 阅读 · 0 评论 -
Hive实战任务 - 9.2 统计总分与平均分
本实战通过Hive处理学生成绩数据,创建内部表加载HDFS中的score.txt文件,利用SQL计算每位学生的总分与平均分,并以分列式和三元组格式输出结果,最终将统计结果持久化至HDFS目录,完整展示了Hive在结构化数据分析中的应用流程。原创 2025-12-18 09:14:48 · 430 阅读 · 0 评论 -
Hive实战任务 - 9.1 实现词频统计
本实战在Hadoop环境中完成词频统计任务:将文本数据上传至HDFS,通过Hive创建外部表,利用split和explode函数拆分单词,建立视图简化操作,最终实现按词频分组统计,并以元组格式导出结果到HDFS,完整展示了从数据准备到分析输出的Hive处理流程。原创 2025-12-18 09:10:19 · 465 阅读 · 0 评论 -
Hive实战:按不同格式输出查询结果
本次实战基于 t_score 成绩表,通过四种不同方式查询每位学生的总分与平均分:完整记录查看、分列式展示、元组式拼接和语句式自然语言输出。重点运用了字段运算、ROUND 函数保留小数、CONCAT 字符串拼接等 SQL 技能,体现了数据呈现形式的灵活性与表达多样性。原创 2025-12-16 10:08:55 · 506 阅读 · 0 评论 -
Hive实战:电商数据分析平台
本项目基于电商平台日志数据,通过Hive完成数据建模与清洗,构建订单、用户、商品、退款、物流等多维数据表,并围绕流量、销售、商品、营销及物流等核心维度开展指标分析,最终利用Tableau实现可视化展示,为业务决策提供数据支撑。原创 2025-12-09 17:46:43 · 1359 阅读 · 0 评论 -
7.1 Hive内置函数
本次 Hive 内置函数实战全面覆盖数学、日期、字符串、条件、聚合及集合统计等类别,通过大量示例验证了函数在数据清洗、转换、分析中的强大能力。重点掌握了 `collect_set` 与 `collect_list` 在去重与保留重复场景下的差异应用,熟练运用 `regexp_replace`、`parse_url`、`get_json_object` 等函数处理非结构化数据,并通过 `percentile`、`var_pop` 等实现统计分析。原创 2025-12-03 13:42:42 · 629 阅读 · 0 评论 -
实训云上搭建大数据集群
本次实战围绕云主机搭建与大数据集群服务展开。历经登录实训云、创建网络、路由器、虚拟网卡等基础配置,设置安全组规则并创建云主机,绑定浮动IP实现FinalShell远程连接。通过修改本地IP与主机名映射文件,实现按IP及主机名Ping云主机。原创 2025-12-03 08:25:30 · 1190 阅读 · 0 评论 -
7.2 Hive自定义函数实战
本实战完整演示了 Hive 自定义函数(UDF)的开发与部署流程:从创建 Maven 项目、编写阶乘 UDF 类,到打包上传 JAR;分别注册临时函数和永久函数,并验证其生命周期与可用性。通过对比,明确了临时函数会话级有效、永久函数全局持久的特点,掌握了 UDF 在生产环境中的正确使用方式。原创 2025-11-30 14:49:04 · 366 阅读 · 0 评论 -
6.5 Hive查询优化:执行计划与性能初探
本次实战通过 explain 命令分析了三类典型查询的执行计划:普通表全表扫描、多表 JOIN 优化及分区表裁剪效果。验证了谓词下推、MapJoin 和分区裁剪等 Hive 自动优化机制的实际生效情况,直观展示了合理使用分区字段与小表关联对减少 I/O、提升性能的关键作用。原创 2025-11-28 12:16:45 · 329 阅读 · 0 评论 -
6.4 Hive高级分析:窗口函数与复杂查询
本次实战基于 student、sc 和 course 三张真实表,运用窗口函数完成了课程内成绩排名、按年龄分组平均分计算、以及学生个人最高分差距分析等高级查询,充分展示了窗口函数在保留明细数据的同时实现高效分组统计与对比的能力,验证了其在教育数据分析场景中的实用性与灵活性。原创 2025-11-28 11:33:47 · 353 阅读 · 0 评论 -
6.3 Hive多表关联:JOIN与子查询
本次实战基于学生、课程与选课三张表,系统演练了 Hive 中 JOIN 多表关联与子查询的典型应用,包括成绩查询、条件筛选、选课统计等场景,验证了关联查询的数据整合能力与子查询在聚合过滤中的灵活性,为复杂分析任务奠定基础。原创 2025-11-28 09:45:09 · 474 阅读 · 0 评论 -
6.2 Hive分组统计:GROUP BY与聚合函数
本次实战围绕 Hive 的 GROUP BY 与聚合函数展开,基于学生表 t_student 进行多维度分组统计,包括按性别、年龄统计人数,使用 HAVING 筛选分组结果,并计算各性别的平均、最大和最小年龄,全面展示了分组聚合在数据汇总与分析中的核心应用。原创 2025-11-27 11:48:57 · 409 阅读 · 0 评论 -
6.1 Hive基础查询:SELECT与WHERE
本次实战围绕Hive基础查询展开,通过学生表和雇员表,演示了SELECT与WHERE的多种用法,包括全表查询、数值/字符串条件过滤、范围查询(BETWEEN)、集合查询(IN)、模糊匹配(LIKE)及复杂字段(如struct类型)处理,验证了HiveQL在结构化数据检索中的灵活性与高效性。原创 2025-11-27 10:51:48 · 326 阅读 · 0 评论 -
Hive实战 - 词频统计
本次Hive词频统计实战通过创建外部表读取HDFS文本数据,利用explode(split(...))拆分单词并构建视图,实现基于视图的分组计数与排序,完整展示了从数据加载、单词展开、视图封装到词频统计的全流程,并通过脚本自动化执行及元数据验证,体现了Hive在文本分析中的高效性与灵活性。原创 2025-11-27 07:56:42 · 411 阅读 · 0 评论 -
4.6 Hive视图实战
本次实战通过创建课程表并基于其定义视图 v_course,完整演示了 Hive 视图的创建、查询、元数据验证与删除操作,验证了视图作为虚拟表的动态查询能力、逻辑抽象优势及其在简化访问和权限控制中的应用价值。原创 2025-11-27 07:52:31 · 233 阅读 · 0 评论 -
4.5 Hive临时表实战
本次实战通过创建临时表 t_course,演示了 Hive 临时表的创建、数据插入、查询及生命周期管理。验证了其仅在当前会话可见、不写入元数据、会话结束后自动删除的特性,适用于 ETL 中间处理与临时数据缓存场景,提升开发效率并避免元数据污染。原创 2025-11-27 07:48:53 · 380 阅读 · 0 评论 -
4.4 Hive分桶表实战
本实战通过创建外部表加载课程数据,构建按 course 字段分3桶的内部分桶表,开启分桶机制后插入数据,验证HDFS中数据按哈希值分布至各桶,并通过分桶采样查询展示其在高效抽样与数据组织中的优势,完整体现了Hive分桶表的核心功能与应用场景。原创 2025-11-27 07:44:15 · 334 阅读 · 0 评论 -
4.3 Hive分区表实战
本次实战围绕Hive分区表展开,分别完成单分区(按国家)和多分区(按省、市)表的创建、数据加载、查询验证及元数据管理。通过手动操作与自动同步,深入掌握分区增删改查、HDFS存储结构及Metastore元数据关联机制,充分体现了分区表在提升查询效率与数据组织方面的核心优势。原创 2025-11-27 07:39:56 · 471 阅读 · 0 评论 -
重置Hive环境
本次实战完成了Hive环境的彻底重置与重建:包括清理HDFS数仓目录、停止并重启Hadoop服务、清除旧Hive元数据库、重新初始化Metastore、启动Hive服务进程,并验证了Hive与MySQL元数据的一致性,为后续数据仓库开发提供了干净可靠的运行环境。原创 2025-11-26 13:32:21 · 1175 阅读 · 0 评论 -
5.5 Hive导出数据实战
实战演练涵盖了从ACID与非ACID表中导出数据至HDFS或本地的多种场景,包括使用适当语法格式处理大数据量的分布式存储和单机小数据量调试。任务成功验证了从非ACID表t_student导出男生记录至HDFS,以及t_student_acid表女生记录到本地的流程,同时指出直接从ACID表导出数据至HDFS的限制。通过MapReduce作业实现数据导出,并检查输出文件确认数据完整性和正确性,体现了Hive在数据处理和导出方面的灵活性与强大功能。然而,对于ACID表的数据导出,需采用其他策略以避免事务一致性问原创 2025-11-21 11:18:02 · 489 阅读 · 0 评论 -
5.4 Hive删除数据实战
本实战演示了在Hive ACID表中执行DELETE操作的完整流程:通过配置事务参数,对已存在的`t_student_acid`表执行删除语句,成功移除“王小虎”记录,并经查询验证数据一致性。整个过程符合ACID特性,体现了Hive对行级删除的支持及事务可靠性。原创 2025-11-21 10:23:39 · 463 阅读 · 0 评论 -
5.3 Hive更新数据实战
本实战演示了在Hive中基于ACID事务机制更新数据的完整流程:通过配置事务参数、创建ORC分桶ACID表、插入初始数据,并成功使用UPDATE语句将“李灵玉”的年龄修改为18岁,验证了Hive对行级更新的支持及数据一致性保障。原创 2025-11-21 09:55:12 · 458 阅读 · 0 评论 -
5.2 Hive插入数据实战
本次实战系统演示了 Hive 3.1.3 的插入数据操作,涵盖非分区表的追加与覆盖插入、分区表的静态与动态分区写入。通过临时表生成测试数据,验证了 `INSERT INTO` 和 `INSERT OVERWRITE` 的行为差异,并成功实现按区域自动创建分区及分区级数据清洗,全面掌握基于查询的批量数据写入机制及其在 ETL 中的应用。原创 2025-11-20 11:40:29 · 437 阅读 · 0 评论 -
5.1 Hive加载数据实战
本次实战系统演示了 Hive 3.1.3 中加载数据的完整流程,包括创建内部表与分区表、从本地和 HDFS 加载数据、验证文件存储与查询结果。通过 LOAD DATA 实现高效文件级导入,验证了内部表的数据移动/复制行为及分区表的目录结构与分区裁剪机制,全面掌握 Hive 数据加载核心操作。原创 2025-11-20 11:37:13 · 479 阅读 · 0 评论 -
4.2 Hive数据表操作
本次Hive实战围绕数据库与表的创建、数据插入(命令/文件上传/LOAD)、复杂类型查询及元数据管理展开,验证了内部表存储机制、分隔符处理、中文支持及SQL查询能力,全面掌握了Hive数据仓库的核心操作流程与底层原理。原创 2025-11-13 17:15:31 · 536 阅读 · 0 评论 -
4.1 Hive数据库操作
本次实战系统演示了Hive数据库的全生命周期管理:从启动MySQL、Hadoop及Hive服务,到创建、查询、切换、修改和删除数据库,涵盖默认与自定义路径、属性设置、所有者变更及级联删除等核心操作,全面掌握Hive元数据管理技能。原创 2025-11-13 13:07:17 · 376 阅读 · 0 评论 -
从Hive on YARN到Hive on Spark
本实战通过配置 Hive 与 Spark 集成,分别基于 YARN(MapReduce)和 Spark 引擎执行词频统计任务,验证了 Hive on Spark 在查询性能上的显著优势,同时展示了 Hadoop、Hive 和 Spark 的协同部署与关键配置步骤。原创 2025-11-06 16:22:34 · 1735 阅读 · 0 评论 -
Hive建表实战
本次Hive建表实战围绕员工信息管理,系统演练了四种核心数据类型的表设计与操作。首先创建数值类型表`t_staff`,存储员工年龄、身高、体重等数值字段;接着构建时间类型表`t_business_trip`,使用`timestamp`精确记录员工出差的时分秒;随后建立字符串类型表`t_song`,处理演唱歌曲等文本数据;最后通过复杂类型表`t_family`,综合运用`array`、`map`和`struct`结构,高效组织朋友、家庭成员和地址等嵌套信息。原创 2025-09-22 17:59:18 · 305 阅读 · 0 评论 -
VMWare上搭建Hive集群
本实战在VMware上搭建Hive集群,集成MySQL作为元数据存储,完成Hive环境配置、元数据初始化及HDFS仓库目录创建,实现Hive on Hadoop的SQL查询能力,为大数据分析提供数据仓库支持。原创 2025-09-05 14:13:51 · 895 阅读 · 0 评论 -
初探Hive数据类型
Hive 支持丰富的数据类型,分为基本类型和复杂类型。基本类型包括数值型(TINYINT、SMALLINT、INT、BIGINT、FLOAT、DOUBLE)、时间类型(DATE、TIMESTAMP)、字符串(STRING、VARCHAR、CHAR)、BOOLEAN 和 BINARY。复杂类型支持集合结构:ARRAY(有序列表)、MAP(键值对,key 为原始类型)、STRUCT(类似对象,封装多个字段)以及 UNION(合并查询结果)。原创 2025-09-19 16:09:09 · 268 阅读 · 0 评论
分享