.NET工程师知识图谱--大数据

最新推荐文章于 2024-01-11 00:04:35 发布

ludewig

最新推荐文章于 2024-01-11 00:04:35 发布

阅读量496

点赞数 1

分类专栏：基础知识 .NET 文章标签：知识图谱 big data 大数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/lordwish/article/details/120398321

版权

.NET 同时被 2 个专栏收录

19 篇文章 7 订阅

订阅专栏

10 篇文章 0 订阅

订阅专栏

1.知识图谱

在这里插入图片描述

1.1.数据采集

名称	说明
网络爬虫	按照一定规则自动抓取网站信息的程序，可以为数据收集提供来源。
Flume	分布式、高可靠、高可用服务，可以有效收集、聚合、移动大量的日志数据。Flume的设计目的是要向Hadoop集群批量导入基于事件的海量数据。
Logstash	开源服务器端数据处理管道，可以同时从多个数据来源采集数据和转换数据，并将数据传输至存储中。
Beats	轻量级数据采集产品，包含用于收集网络流量数据的Packetbeat，用于收集系统、进程和文件系统级别CPU及内存使用情况的Topbeat，用于收集日志与文件数据的Filebeat，用于收集Windows事件日志数据的Winlogbeat。

1.2.数据存储

名称	说明
HDFS	Hadoop Distributed File System，Hadoop分布式文件系统的简称。HDFS是一个高容错性的系统，可以部署在配置和价格相对较低的计算机上，能够提供高吞吐量的数据访问，适合大规模数据集上的应用。
HBase	Hadoop Database的简称，是一个高可靠性、高性能、面向列、可伸缩的分布式存储系统。Hadoop项目的子项目，是可以运行在Hadoop集群上的NoSQL数据库。

1.3.数据挖掘

名称	说明
Hive	面向Hadoop生态的数据仓库，提供HiveQL用于查询和管理大数据。
Pig	面向分布式大数据分析的平台，用于简化Hadoop任务，对MapReduce进行更高层次的封装，执行效率快，适用于实时分析。
Sqoop	用于关系型数据库与Hadoop之间的数据传输，可以将数据导入到Hive或HBase中，并从Hadoop导出到关系型数据库。

1.4.数据处理

名称	说明
Hadoop	分布式系统基础架构，核心就是HDFS和MapReduce。
MapReduce	面向大数据并行处理的计算模型、框架和平台。主要用于数据划分和计算任务调度、数据及代码互定位、系统优化、出错检测和恢复。Hadoop的实现就是依据MapReduce的原理。
Impala	Cloudera公司主导开发的新型查询系统，提供了SQL语义，可以查询存储在HDFS和HBase中的数据。与Hive相比其优势就是快。
Storm	用来做大数据流实时处理的开源框架，可以相对可靠的处理无限的数据流，实时处理Hadoop的批任务。使用简单，支持多种类型的编程语言。
Spark	一种基于内存的分布式并行计算框架，不同于MapReduce，Job中间输出结果可以保存在内存中，不需要读写HDFS，能更好的适应数据挖掘与机器学习等需要。
Flink	开源流处理框架，以数据并行和流水线方式执行流数据程序，支持迭代算法的执行，比较适合处理在线的实时大数据。

关注

1
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
.NET工程师知识图谱--大数据

1.知识图谱1.1.数据采集名称说明网络爬虫按照一定规则自动抓取网站信息的程序，可以为数据收集提供来源。Flume分布式、高可靠、高可用服务，可以有效收集、聚合、移动大量的日志数据。Flume的设计目的是要向Hadoop集群批量导入基于事件的海量数据。Logstash开源服务器端数据处理管道，可以同时从多个数据来源采集数据和转换数据，并将数据传输至存储中。Beats轻量级数据采集产品，包含用于收集网络流量数据的Packetbeat，用于收集系统、进程和文件
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。