初认hadoop

什么是hadoop?

hadoop = teh hadoop projects

hadoop体系架构生态圈主要包含common,avro,mapreduce,hdfs,pig,hive(数据仓库),hbase,zookeeper,oozie(任务调度),sqoop(数据转移hive ↔ mysql)等组件

hadoop核心: hdfs(分布式文件系统)+ mapreduce (计算)+yarn(运算资源调度系统,管理硬件资源,内存/cpu等)。


HDFS架构

hdfs中的一些常见名词

block:一个文件分块,默认64M。当写入一个文件到 HDFS 时,它被切分成数据块,块大小是由配置文件 hdfs-default.xml 中的参数 dfs.blocksize (自 hadoop-2.2 版本后,默认值为 134217728字节即 128M,可以在 hdfs-site.xml 文件中改变覆盖其值。

namenode:保存整个文件系统的目录信息,文件信息以及文件相应的分块信息。(单点,提供服务的namenode只有一个)

datanode:用于存储blocks(文件块)。

hdfs的HA策略:namenode一旦宕机,整个文件系统将无法工作,如果namenode中的数据丢失,整个文件系统也就丢失了,从2.x开始,hdfs支持namenode的active-atandy模式(主从)。



在hdfs上的文件存储 

dbossdat1001.txt   600G


同一个文件快在不同节点中有多个副本,当某个节点的数据失效时,可以从另外的节点获取到文件的内容,当数据失效时,副本有效个数会减少,hadoop可以自动侦测到这一点,从有效的副本复制,自动恢复到正常的副本个数。


hdfs中的namenode和datanode


如上图所示,在hdfs中,分为两个部分:namenode和datanode,其中那么node只有一个节点,datanode则有多个节点。但从hadoop2.0版本之后开始,namenode有主从两个节点防止节点挂掉。



hdfs总的架构图


mapreduce


mapreduce编程模型

总图中可以看到,mapreduce是将大任务分割成若干的小任务,然后在汇总得出结果。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
众所周知,人工智能是当前最热门的话题之一, 计算机技术与互联网技术的快速发展更是将对人工智能的研究推向一个新的高潮。 人工智能是研究模拟和扩展人类智能的理论与方法及其应用的一门新兴技术科学。 作为人工智能核心研究领域之一的机器学习, 其研究动机是为了使计算机系统具有人的学习能力以实现人工智能。 那么, 什么是机器学习呢? 机器学习 (Machine Learning) 是对研究问题进行模型假设,利用计算机从训练数据中学习得到模型参数,并最终对数据进行预测和分析的一门学科。 机器学习的用途 机器学习是一种通用的数据处理技术,其包含了大量的学习算法。不同的学习算法在不同的行业及应用中能够表现出不同的性能和优势。目前,机器学习已成功地应用于下列领域: 互联网领域----语音识别、搜索引擎、语言翻译、垃圾邮件过滤、自然语言处理等 生物领域----基因序列分析、DNA 序列预测、蛋白质结构预测等 自动化领域----人脸识别、无人驾驶技术、图像处理、信号处理等 金融领域----证券市场分析、信用卡欺诈检测等 医学领域----疾病鉴别/诊断、流行病爆发预测等 刑侦领域----潜在犯罪识别与预测、模拟人工智能侦探等 新闻领域----新闻推荐系统等 游戏领域----游戏战略规划等 从上述所列举的应用可知,机器学习正在成为各行各业都会经常使用到的分析工具,尤其是在各领域数据量爆炸的今天,各行业都希望通过数据处理与分析手段,得到数据中有价值的信息,以便明确客户的需求和指引企业的发展。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值