大数据
文章平均质量分 96
zdy0_2004
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Flink+Hudi 构架湖仓一体化解决方案
摘要:本文详细介绍了 Flink + Hudi 湖仓一体化方案的原型构建。主要内容为: Hudi 新架构与湖仓一体 最佳实践 Flink on Hudi Flink CDC 2.0 on Hudi Tips:FFA 2021 重磅开启,点击「阅读原文」即可报名~GitHub 地址欢迎大家给Flink点赞送 star~一、Hudi1. 简介Apache Hudi (发音为 “Hoodie”)在 DFS...转载 2021-10-18 13:32:01 · 1981 阅读 · 0 评论 -
Kafka体系架构详细分解
基本概念Kafka 体系架构Kafka 体系架构包括若干 Producer、若干 Broker、若干 Consumer,以及一个 ZooKeeper 集群。在 Kafka 中还有两个特别重要的概念—主题(Topic)与分区(Partition)。Kafka 中的消息以主题为单位进行归类,生产者负责将消息发送到特定的主题(发送到 Kafka 集群中的每一条消息都要指定一个主题),...转载 2020-03-08 23:24:45 · 622 阅读 · 0 评论 -
大数据基础架构详解
大数据基础架构详解http://www.cnblogs.com/luobei/p/4253718.html简介:本文是对大数据领域的基础论文的阅读总结,相关论文包括GFS,MapReduce、BigTable、Chubby、SMAQ。大数据出现的原因: 大多数的技术突破来源于实际的产品需要,大数据最初诞生于谷歌的搜索引擎中。随着转载 2015-01-27 21:06:01 · 1308 阅读 · 0 评论 -
关于大型网站技术演进的思考(八)--存储的瓶颈终篇(8)
在开始本篇主要内容前,我们一起看看下面的几张截图,首先是第一张图,如下图所示: 这是一家电商网站的首页,当我们第一次打开这个首页,网站会弹出一个强制性的对话框,让用户选择货物配送的地址,如果是淘宝和京东的话,那么这个选择配货地址的选项是在商品里,如下图是淘宝的选择配送地点: 下图是京东选择配货地点: 那么图一跟京东和淘宝有什么区别呢?图一转载 2015-02-08 21:17:43 · 1063 阅读 · 0 评论 -
RabbitMQ
http://lynnkong.iteye.com/blog/16996841 什么是RabbitMQ?RabbitMQ是实现AMQP(高级消息队列协议)的消息中间件的一种,最初起源于金融系统,用于在分布式系统中存储转发消息,在易用性、扩展性、高可用性等方面表现不俗。消息中间件主要用于组件之间的解耦,消息的发送者无需知道消息使用者的存在,反之亦然: 单向解转载 2015-02-17 10:07:54 · 692 阅读 · 0 评论 -
四层和七层负载均衡的区别
四层和七层负载均衡的区别负载均衡方案应是在网站建设初期就应考虑的问题,不过有时随着访问流量的爆炸性增长,超出决策者的意料,这也就成为不得不面对的问题。当我们在引入某种负载均衡方案乃至具体实施时,像其他的许多方案一样,首先是确定当前及将来的应用需求,然后在代价与收效之间做出权衡。(一)简单理解四层和七层负载均衡:① 所谓四层就是基于IP+端口的负载均衡;七层就转载 2015-02-17 01:51:30 · 546 阅读 · 0 评论 -
MySQL Cluster数据分布/分区,两阶段提交协议及事务资源
MySQL Cluster数据分布/分区,两阶段提交协议及事务资源http://www.zrwm.com/?p=3210MySQL Cluster数据分布和分区数据分布MySQL Cluster自动分区数据表(也可能使用用户自定义分区),将数据分布到分区中.一个数据表被划分到多个Data Node分区中,数据在分区中被”striped”主键的hashing决定哪转载 2015-02-18 01:01:44 · 711 阅读 · 0 评论 -
分布式系统 并不是我想象中的那样!
分布式系统 并不是我想象中的那样!过去两个月深入的参与了一个分布式系统的开发,记得之前有人说过“想成为架构师之前,都是从微观架构开始的”。尽管我从没想过将来的某一天要成为一个架构师,或者领域专家,我只是想萌萌哒的编码,写着自己喜欢的Code,和一群志同道合的朋友做出大家喜欢的商品和产品。前言过去两个月深入的参与了一个分布式系统的开发,记得之前有人说过“想成为架构师之前,转载 2015-02-17 02:01:55 · 612 阅读 · 0 评论 -
大数据实时处理:百分点实时计算架构和算法
大数据实时处理:百分点实时计算架构和算法http://www.oschina.net/question/1459174_145255当今时代,数据不再昂贵,但从海量数据中获取价值变得昂贵,而要及时获取价值则更加昂贵,这正是大数据实时计算越来越流行的原因。以百分点公司为例,在高峰期每秒钟会有近万HTTP请求发送到百分点服务器上,这些请求包含了用户行为和个性化推荐请求。转载 2015-02-17 10:28:23 · 1307 阅读 · 0 评论 -
HBase入门篇
HBase入门篇 目录:1-HBase的安装2-Java操作HBase例子3-HBase简单的优化技巧4–存储5(集群) -压力分载与失效转发6 -白话MySQL(RDBMS)与HBase之间7 -安全&权限1-HBase的安装HBase是什么?HBase是Apac转载 2015-02-17 10:41:55 · 602 阅读 · 0 评论 -
Storm - 大数据Big Data实时处理架构
Storm - 大数据Big Data实时处理架构什么是Storm?Storm是:• 快速且可扩展伸缩• 容错• 确保消息能够被处理• 易于设置和操作• 开源的分布式实时计算系统- 最初由Nathan Marz开发- 使用Java 和 Clojure 编写Storm和Hadoop主要区别是实时和批处理的区别: Storm概念 组成:Spout 和Bolt组成Topology。Tuple是S转载 2015-02-17 10:50:39 · 862 阅读 · 0 评论 -
一种可以避免数据迁移的分库分表scale-out扩容方式
http://www.cnblogs.com/tommyli/p/3767362.html一种可以避免数据迁移的分库分表scale-out扩容方式原文地址:http://jm-blog.aliapp.com/?p=590目前绝大多数应用采取的两种分库分表规则mod方式dayofweek系列日期方式(所有星期1的数据在一个库/表,或所有?月份的数据在一个库转载 2015-02-18 02:09:43 · 696 阅读 · 0 评论 -
技术揭秘12306改造(一):尖峰日PV值297亿下可每秒出票1032张
技术揭秘12306改造(一):尖峰日PV值297亿下可每秒出票1032张注:本文首发于CSDN,转载请标明出处。【编者按】12306网站曾被认为是“全球最忙碌的网站”,在应对高并发访问处理方面,曾备受网民诟病。 2015年铁路客票春运购票高峰期已过,并且12306网站今年没“瘫痪”,也顺利过关。因此记者在第一时间联系到一位对12306改造非常关注的技术架构师,他从技转载 2015-02-24 00:40:18 · 1913 阅读 · 0 评论 -
Google 开源 C/C++ 版 MapReduce 框架
Google 开源 C/C++ 版 MapReduce 框架http://www.oschina.net/news/59911/google-opensource-cpp-mapreduce据GigaOM消息,Google上周宣布,将自己用C++开发的MapReduce框架MapReduce for C(MR4C)开源,此举可给Hadoop社区带来福音,因为这样用户就可转载 2015-02-24 19:26:12 · 932 阅读 · 0 评论 -
高并发Web服务的演变——节约系统内存和CPU
徐汉彬:高并发Web服务的演变——节约系统内存和CPUhttp://www.csdn.net/article/2015-02-12/2823952?reload=1一、越来越多的并发连接数现在的Web系统面对的并发连接数在近几年呈现指数增长,高并发成为了一种常态,给Web系统带来不小的挑战。以最简单粗暴的方式解决,就是增加Web系统的机器和升级硬件配置。虽然现在的硬转载 2015-02-25 01:02:05 · 976 阅读 · 0 评论 -
RabbitMQ入门(3)
RabbitMQ入门(3)摘要 RabbitMQ, RabbitMQ入门RabbitMQ RabbitMQ入门目录[-]出版和订阅(使用java 客户端)交换临时队列绑定把所有放在一起出版和订阅(使用java 客户端)在先前的指南中,我们创建了一个工作队列。这工作队列后面的假想是每一转载 2015-02-26 01:20:36 · 624 阅读 · 0 评论 -
RabbitMQ入门(4)
RabbitMQ入门(4)http://my.oschina.net/OpenSourceBO/blog/379737摘要 RabbitMQ,RabbitMQ入门RabbitMQ RabbitMQ入门目录[-]路由(使用Java客户端)绑定直接交换多种绑定发出日志订阅把它们放在一起路由转载 2015-02-26 01:24:51 · 551 阅读 · 0 评论 -
RabbitMQ入门(2)
RabbitMQ入门(2)http://my.oschina.net/OpenSourceBO/blog/379735目录[-]工作队列(使用Java客户端)准备循环分派消息确认消息持久化公平分发把它们放在一起工作队列(使用Java客户端) 在这第一指南部分,我们写了通过同一命名的队列发转载 2015-02-26 01:14:09 · 521 阅读 · 0 评论 -
RabbitMQ入门(1)
RabbitMQ入门(1)http://my.oschina.net/OpenSourceBO/blog/379732摘要 RabbitMQ入门,RabbitMQ目录[-]“Hello World”(使用java客户端)发送接收把所有放在一起前面声明本文都是RabbitMQ的官方指南翻译过来的,由于本人水平有限转载 2015-02-26 01:13:05 · 554 阅读 · 0 评论 -
RabbitMQ入门(6)
RabbitMQ入门(6)http://my.oschina.net/OpenSourceBO/blog/379740摘要 RabbitMQ,RabbitMQ入门RabbitMQ RabbitMQ入门目录[-]远程过程调用(RPC)(使用Java客户端)用户接口回收队列相关性ID (原:Correlation Id)摘转载 2015-02-26 01:30:25 · 635 阅读 · 0 评论 -
Apache HBase v1.0 发布,分布式数据库
Apache HBase v1.0 发布,分布式数据库http://www.oschina.net/news/59973/apache-hbase-1-0Apache HBase v1.0 发布了,这是 HBase 一个主要的里程碑。1.0 版本经过 7 年的开发,有超过 1500 次的更改和升级。与上一个版本 0.98.0 比较,1.0 版本值得关注的改进有:转载 2015-02-26 13:46:48 · 635 阅读 · 0 评论 -
http://home.cnblogs.com/group/topic/69417.html
弹性分布式数据集:一种基于内存的集群计算的容错性抽象方法http://home.cnblogs.com/group/topic/69417.html摘要:本文提出了弹性分布式数据集(RDD,Resilient Distributed Datasets),这是一种分布式的内存抽象,允许在大型集群上执行基于内存的计算(In-Memory Computing),与此同时还保持了M转载 2015-02-23 23:44:44 · 1288 阅读 · 0 评论 -
配置高可用的Hadoop平台
配置高可用的Hadoop平台http://www.cnblogs.com/smartloli/p/4298430.html1.概述 在Hadoop2.x之后的版本,提出了解决单点问题的方案--HA(High Available 高可用)。这篇博客阐述如何搭建高可用的HDFS和YARN,执行步骤如下:创建hadoop用户安装JDK配置hosts安装SSH关闭转载 2015-02-25 22:24:43 · 763 阅读 · 0 评论 -
分布式内存文件系统:Tachyon
Tachyonhttp://www.open-open.com/lib/view/open1409754088791.htmlTachyon是一个分布式内存文件系统,可以在集群里以访问内存的速度来访问存在tachyon里的文件。把Tachyon是架构在最底层的分布式文件存储和上层的各种计算框架之间的一种中间件。主要职责是将那些不需要落地到DFS里的文件,落地到分布式内存转载 2015-02-23 23:48:21 · 709 阅读 · 0 评论 -
RabbitMQ入门(5)
RabbitMQ入门(5)摘要 RabbitMQ,RabbitMQ入门目录[-]主题(topic)(使用Java客户端)topic类型交易所把所有放在一起主题(topic)(使用Java客户端)在先前的指南中我们改进了我们的日志系统。取代使用fanout类型的交易所,那个仅仅有能力实现哑的广播,我们使用一个转载 2015-02-26 01:25:38 · 453 阅读 · 0 评论 -
分布式存储hadoop
分布式存储hadoop在SIP项目设计的过程中,对于它庞大的日志在开始时就考虑使用任务分解的多线程处理模式来分析统计,在我从前写的文章《Tiger Concurrent Practice --日志分析并行分解设计与实现》中有所提到。但是由于统计的内容暂时还是十分简单,所以就采用Memcache作为计数器,结合MySQL就完成了访问控制以及统计的工作。然而未来,对于海量日志分析的工作,还转载 2015-02-12 22:29:06 · 867 阅读 · 0 评论 -
storm的八种Grouping策略
storm的八种Grouping策略http://www.cnblogs.com/UUhome/p/4298755.html 在这里,将会提到storm的七种grouping策略,并且编码逐一实现。 首先,需要一个集群(希望尽量模仿真实环境,故就不用本地模式了)。详细的安装方法大家可以查看本人的另外一篇博文:storm集群和zookeeper集群的部署转载 2015-02-25 00:18:58 · 4731 阅读 · 0 评论 -
Hadoop学习系列
http://www.cnblogs.com/edisonchou/category/542546.html转载 2015-02-23 23:53:47 · 460 阅读 · 0 评论 -
那些年使用Hive踩过的坑
1.概述 这个标题也是用血的教训换来的,希望对刚进入hive圈的童鞋和正在hive圈爬坑的童鞋有所帮助。打算分以下几个部分去描述:Hive的结构Hive的基本操作Hive SelectHive JoinHive UDFHive的M/R使用Hive注意点优化及优化详情优化总结调优的经常手段解决Hive问题的途径 这篇文章只是起个头,为描述其他部分做下准备。下面我赘述下Hive的结转载 2015-02-12 22:18:12 · 1304 阅读 · 0 评论 -
天机镜——优土大数据平台应用级别监控利器
天机镜——优土大数据平台应用级别监控利器http://www.cnblogs.com/colorfulkoala/p/4333103.html上古十大神器之一天机镜:天机镜又名昆仑镜。昆仑山西王母所有,能洞察天机,知晓古今! 1. 动机 在业务系统开发的前期,我们往往只专注到业务逻辑,而忽略了对系统本身的监控。 对硬件资源的监控运维同学提供的ganglia转载 2015-03-13 23:59:57 · 1599 阅读 · 0 评论 -
使用Storm实现实时大数据分析!
使用Storm实现实时大数据分析!rm让大数据分析变得轻松加愉快。当今世界,公司的日常运营经常会生成TB级别的数据。数据来源囊括了互联网装置可以捕获的任何类型数据,网站、社交媒体、交易型商业数据以及其它商业环境中创建的数据。考虑到数据的生成量,实时处理成为了许多机构需要面对的首要挑战。我们经常用的一个非常有效的开源实时计算工具就是Storm —— Twitter开发,通常被转载 2015-02-13 23:51:18 · 657 阅读 · 0 评论 -
大数据架构师:hadoop、Storm该选哪一个?
阅读下面可以带着下面问题:如果hadoop、Storm还感觉混要,那么此篇文章将帮助你把他们完全区分可以带着下面问题来阅读本文章:1.hadoop、Storm各是什么运算2.Storm为什么被称之为流式计算系统3.hadoop适合什么场景,什么情况下使用hadoop4.什么是吞吐量首先整体认识:Hadoop是磁盘级计算,进行计算时,数据在磁盘上,需要读写磁盘;S转载 2015-02-13 23:57:10 · 747 阅读 · 0 评论 -
使用Storm实现实时大数据分析!
使用Storm实现实时大数据分析!简单和明了,Storm让大数据分析变得轻松加愉快。当今世界,公司的日常运营经常会生成TB级别的数据。数据来源囊括了互联网装置可以捕获的任何类型数据,网站、社交媒体、交易型商业数据以及其它商业环境中创建的数据。考虑到数据的生成量,实时处理成为了许多机构需要面对的首要挑战。我们经常用的一个非常有效的开源实时计算工具就是Storm ——转载 2015-02-13 23:58:46 · 481 阅读 · 0 评论 -
自动加载缓存框架
自动加载缓存框架http://my.oschina.net/u/1469495/blog/380865摘要 现在使用的缓存技术很多,比如Redis、 Memcache、EhCache等,甚至还有使用ConcurrentHashMap 或 HashTable 来实现缓存。但在缓存的使用上,每个人都有自己的实现方式,大部分是直接与业务代码绑定,随着业务的变化,要更换缓存转载 2015-03-01 18:50:25 · 701 阅读 · 0 评论 -
HBase 高性能加入数据 - 按批多“粮仓”式解决办法
HBase 高性能加入数据 - 按批多“粮仓”式解决办法 摘要:如何从HBase中的海量数据中,以很快的速度的获取大批量数据,这一议题已经在《HBase 高性能获取数据》(http://www.cnblogs.com/wgp13x/p/4245182.html)一文中给出了解决办法。那么,如何向HBase中高性能的插入数据呢?经研究表明,光是批量写入也还转载 2015-03-07 20:21:19 · 736 阅读 · 0 评论 -
Storm集群的DRPC模式
Storm集群的DRPC模式 storm的DRPC模式的作用是实现从远程调用storm集群的计算资源,而不需要连接到集群的某一个节点。OK。那么storm实现DRPC主要是使用LinearDRPCTopologyBuilder这个类。下面就先来看看一个简单的例子,它的源码的github上。1234567转载 2015-03-07 20:18:31 · 767 阅读 · 0 评论 -
jedis
什么是RedisRedis是一个开源的使用ANSI C语言编写、支持网络、可基于内存亦可持久化的日志型、Key-Value数据库,并提供多种语言的API。从2010年3月15日起,Redis的开发工作由VMware主持。从2013年5月开始,Redis的开发由Pivotal赞助。Memcached和RedisMemcached的基本应用模型如下图所示:red转载 2015-03-08 22:21:26 · 1139 阅读 · 0 评论 -
Hive sql语法详解
Hive sql语法详解http://www.cnblogs.com/zhengrunjian/p/4545915.htmlHive 是基于Hadoop 构建的一套数据仓库分析系统,它提供了丰富的SQL查询方式来分析存储在Hadoop 分布式文件系统中的数据,可以将结构化的数据文件映射为一张数据库表,并提供完整的SQL查询功能,可以将SQL语句转转载 2015-06-02 20:55:56 · 934 阅读 · 0 评论 -
RHadoop实践系列之一:Hadoop环境搭建
RHadoop实践系列之一:Hadoop环境搭建http://www.cnblogs.com/zhengrunjian/p/4530798.htmlRHadoop实践系列文章,包含了R语言与Hadoop结合进行海量数据分析。Hadoop主要用来存储海量数据,R语言完成MapReduce 算法,用来替代Java的MapReduce实现。有了RHadoop可以让广大的R语言转载 2015-06-02 21:13:18 · 771 阅读 · 0 评论 -
【hadoop】如何向map和reduce脚本传递参数,加载文件和目录
【hadoop】如何向map和reduce脚本传递参数,加载文件和目录http://www.cnblogs.com/zhengrunjian/p/4536572.html本文主要讲解三个问题: 1 使用Java编写MapReduce程序时,如何向map、reduce函数传递参数。 2 使用Streaming编写MapReduce程转载 2015-06-02 21:19:07 · 3108 阅读 · 0 评论
分享