基于常规法则的大数据分析最佳实践

转载 2013年09月09日 11:42:54

由于出现了新词汇、新技术、新产品和新提供商,“大数据”分析让人很陌生,但是经过检验的数据管理最佳实践方法一样能够在这个仍然属于新兴学科的领域发挥作用。

与 各种商业智能(BI)和数据仓库一样,专家认为在开始进行大数据分析项目之前,清晰理解组织的数据管理需求和明确策略是非常重要的。大数据分析被广泛地进 行讨论,而且各种行业的公司都充斥着新数据源和不断增多的信息。但是,在未明确这样做能够真正给公司带来什么价值之前,就投入大量的资源应用大数据技术, 这就是所谓用户的最严重失误。

David Menninger是Ventana研究公司的一名分析师,他主要关注于BI、分析与信息管理技术。他认为不要在这个技术上表现得太激进,要先从业务角度着手,并且要与CIO、数据科学家和业务人员进行交流,一起确定业务目标和预期价值,然后再开始动手。

准确定义可用的数据和确定组织最佳利用这些资源的方式是整个过程中最关键的部分。Menninger指出,CIO、IT经理和BI人员需要确定所保留、聚集和使用的数据是什么,并且将它们与丢弃的数据进行比较。同时一定要考虑目前仍未涉及但可能会加入的外部数据源。

Menninger 指出,即使公司不确定何时及如何应用大数据分析,尽早进行这种评估仍然是有好处的。此外,开始数据捕捉的过程能够帮助您准备好实现最终的跳跃。他说:“即 使您不知道将使用它来做什么,也要先捕捉数据。否则,您就会失去一个机会,因为您没有足够的历史数据可以分析。”

 大数据要从小开始

分析大数据集也一样要从小机会开始,然后再使用它们作为起点。随着公司不断地扩大分析的数据源和信息类型,以及开始创建最重要的分析模型,帮助他们发现结构化和非结构化数据的模式和相关性,他们需要注意那些对于预期业务目标而言最重要的结果。

Gartner公司的分析师Yvonne Genovese指出:“如果您最终只能寻找新的模式,而且它们毫无用处,那么您肯定遇到死角了。”

ComScore公司专门跟踪互联网使用,为企业客户提供Web分析和销售智能服务。它们很早就认识到需要某种大数据策略。但是,ComScore选取了一些非常有针对性的点,然后再慢慢建立自己的大数据分析项目。

ComScore的软件工程副总裁Will Duckworth说:“我们从小开始——提取各个数据流,再将它们传输到不同的系统。如果您无法达到一定的规模,您是无法一夜之间做到这一点的。”

鉴于公司处理的数据量,规模正是comScore重视的方面。早在2009年,当它一开始每天只采集到3亿条记录的时候——现在每天达到230亿条记录并仍在增长,Duckworth就开始寻找一些新系统和技术基础架构,以高效地完成comScore的数据处理。

 不要忘记最终目标仍是大数据

通过利用开源Hadoop 技术和新型分析工具,Duckworth对开源环境进行了优化,这样SQL的业务分析人员便可以更容易地接受。他指出,在确定大数据分析实施计划时,公司一定要重视规模因素。

他解释说:“您一定要考虑到变化——从现在开始的半年内,您需要处理多少数据,您需要增加多少服务器,是否由软件来完成这些任务。人们并没有考虑到数据增长的程度,以及觖决方案部署到生产环境后的流行程度。”

在陷入大数据“新常态”之后,许多公司经常忽略的另一个方面是数据管理的“旧常态”仍然是有效的。

Gartner的另一位分析师Marcus Collins指出,“信息管理实践方法对于现在的大数据和以前的数据仓库都是一样重要的。即使是对于希望增加处理灵活性的公司而言,他们也要记住一点,信息是企业资产,应该一如继往地保持重视。”

Web基本法则-外观和感觉

外观和感受 你的工程
  • seasolzombie
  • seasolzombie
  • 2014年10月04日 01:22
  • 151

基于成本的Oracle优化法则

当我们讨论SQL语句的成本时,需要倍加谨慎,这是因为“成本”一词同时存在两方面的含义。一方面,成本可以指由诸如解释计划(explain plan)等工具导致的大量的执行次数;另一方面,成本可以指执行S...
  • elimago
  • elimago
  • 2007年11月01日 14:26
  • 1368

常用的微分运算法则

机器学习涉及到较多的数学知识,在工程应用领域,这些数学知识不是必要的,其实很多算法都是数值运算专家写好了的。然而知其然知其所以然,了解这些数学公式的来龙去脉是帮助理解算法的关键。本文直接给出常用的微分...
  • kamidox
  • kamidox
  • 2015年09月28日 22:16
  • 4830

基于Python3的列表常规操作

Python-----列表 列表是个啥玩应?? 简单的说, 把一堆数据放到一起, 用"[ ]"括起来; 数据与数据之前用逗号" , "隔开; 这就是列表。 它的作用, 其实就是用来存...
  • No_can_no_ba_ba
  • No_can_no_ba_ba
  • 2018年01月25日 22:58
  • 35

《基于Apache Kylin构建大数据分析平台》

经过出版社几个月的辛苦努力,《基于Apache Kylin构建大数据分析平台》终于与读者见面了。现在京东,当当,淘宝,亚马逊等各大网站以及书店已经开始发售,非常感谢很多对Apache Kylin感兴趣...
  • jiangshouzhuang
  • jiangshouzhuang
  • 2016年12月14日 12:58
  • 3489

基于Hadoop大数据分析

一、Hadoop的应用业务分析 大数据是不能用传统的计算技术处理的大型数据集的集合。它不是一个单一的技术或工具,而是涉及的业务和技术的许多领域。 目前主流的三大分布式计算系统分别为Hado...
  • u012017783
  • u012017783
  • 2017年10月08日 15:58
  • 244

大数据与机器学习博文链接

Spark VS MapReduce 时间节约66%,计算节约40% http://mp.weixin.qq.com/s?__biz=MzA3MjY1MTQwNQ==&mid=200820787&i...
  • ithlw
  • ithlw
  • 2015年01月04日 20:49
  • 168

大数据决策领跑零售业

随着全球数据量的爆发式增长,大数据技术得到了飞速发展,也为零售业从庞大的业务数据中提取有用信息提供了强有力的支持。如今,沃尔玛“啤酒十尿布”的故事已经成为数据分析的传统经典,各行各业纷纷效仿,利用大数...
  • yuanziok
  • yuanziok
  • 2016年03月14日 09:45
  • 2590

基于大数据分析的网络攻击检测

基于大数据分析的网络攻击检测 360公司首席隐私官、副总裁谭晓生将在2014中国计算机网络安全年会上发表演讲,谭晓生认为“魔高一尺道高一丈”,网络危害与时俱进,安全防御也是不断创新的。云计算...
  • chengying332
  • chengying332
  • 2014年08月14日 09:34
  • 310

Spark快速大数据分析——读书笔记

——8.16开始整理 Spark快速大数据分析推荐序: 一套大数据解决方案通常包含多个组件,从存储、计算和网络硬件层,到数据处理引擎,再到利用改良的统计和计算算法、数据可视化来获得商业洞见的分析层...
  • qq_33813365
  • qq_33813365
  • 2017年08月19日 21:18
  • 880
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:基于常规法则的大数据分析最佳实践
举报原因:
原因补充:

(最多只允许输入30个字)