<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/jojo52013145</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; jojo52013145]]></copyright><item><title><![CDATA[App数据分析]]></title><link>https://blog.csdn.net/jojo52013145/article/details/20120731</link><guid>https://blog.csdn.net/jojo52013145/article/details/20120731</guid><author>jojo52013145</author><pubDate>Fri, 28 Feb 2014 09:33:11 +0800</pubDate><description><![CDATA[在和大量移动应用开发者接触的过程中，我们注意到有一个现象是：很多开发者只注意应用的下载量和激活量，他们把这些指标看成是一款应用成功与否的标志。于是很多应用出现了“重推广、轻运营”，甚至是“有推广、无运营”的情况。

但是，一个人真正成为某款应用的用户是在哪个时刻呢？是他决定下载这款应用的时候吗？还是他安装了这款应用的时候？事实上，都不是。甚至当他启动并进入了这款应用的时候，也还没有真正成为这款]]></description><category></category></item><item><title><![CDATA[Win7 eclipse Hadoop Failed to set permissions of path]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19324605</link><guid>https://blog.csdn.net/jojo52013145/article/details/19324605</guid><author>jojo52013145</author><pubDate>Mon, 17 Feb 2014 08:49:54 +0800</pubDate><description><![CDATA[背景：win7下用eclipse远程连接linux里的hadoop调试开发



12/04/24 15:32:44 WARN util.NativeCodeLoader: Unable to load native-hadoop library for your platform... using builtin-java classes where applicable
12/04/]]></description><category></category></item><item><title><![CDATA[Hadoop 1.2.1 eclipse 插件编译]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19291399</link><guid>https://blog.csdn.net/jojo52013145/article/details/19291399</guid><author>jojo52013145</author><pubDate>Sun, 16 Feb 2014 18:18:30 +0800</pubDate><description><![CDATA[在ubuntu上进行hadoop相关的开发，需要在eclipse上安装hadoop开发插件。最新释放出的hadoop包含源码的包，以hadoop-1.1.1为例，包含相关的eclipse插件的源码，因此可以针对自己的eclipse版本来编译一个hadoop的eclipse插件，我的eclipse的版本代号为indigo，以此为例，下面详细介绍插件的编译安装过程。
一. 下载hadoop-1.2.]]></description><category></category></item><item><title><![CDATA[Hadoop集群环境搭建（win7下vmware虚拟ubuntu）]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19287691</link><guid>https://blog.csdn.net/jojo52013145/article/details/19287691</guid><author>jojo52013145</author><pubDate>Sun, 16 Feb 2014 16:19:56 +0800</pubDate><description><![CDATA[(1)实验环境：最新的vmware workstation10.0.0 和 ubuntu-12.04.3服务器版本，hadoop 1.1.2，java1.7
在win7下虚拟三个 乌班图系统，作为一个主节点两个从节点。
分别去官网下载这四个的安装包
(2) vmware10.0.0安装：
按提示安装vmware10.0.0 并破解，安装完成后显示


(2)创建三个乌班图虚拟机
点]]></description><category></category></item><item><title><![CDATA[Hive 工作原理]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19206559</link><guid>https://blog.csdn.net/jojo52013145/article/details/19206559</guid><author>jojo52013145</author><pubDate>Fri, 14 Feb 2014 17:28:49 +0800</pubDate><description><![CDATA[hive就是一个将sql语句转化为MR工具

hive的工作原理：

1、使用antlr定义sql语法，（详细见hive.g），由antlr工具将hive.g编译为两个java文件：HiveLexer.java HiveParser.java，可以将输入的sql解析为ast树

2、org.apache.hadoop.hive.ql.Driver对ast树进行初步的解析（combile]]></description><category></category></item><item><title><![CDATA[MapReduce中的Shuffle和Sort分析]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19204291</link><guid>https://blog.csdn.net/jojo52013145/article/details/19204291</guid><author>jojo52013145</author><pubDate>Fri, 14 Feb 2014 16:33:40 +0800</pubDate><description><![CDATA[MapReduce 是现今一个非常流行的分布式计算框架，它被设计用于并行计算海量数据。第一个提出该技术框架的是Google 公司，而Google 的灵感则来自于函数式编程语言，如LISP，Scheme，ML 等。

MapReduce 框架的核心步骤主要分两部分：Map 和Reduce。当你向MapReduce 框架提交一个计算作业时，它会首先把计算作业拆分成若干个Map 任务，然后分配到不同]]></description><category></category></item><item><title><![CDATA[Hive 全排序 优化]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19199657</link><guid>https://blog.csdn.net/jojo52013145/article/details/19199657</guid><author>jojo52013145</author><pubDate>Fri, 14 Feb 2014 14:35:21 +0800</pubDate><description><![CDATA[使用Hive可以高效而又快速地编写复杂的MapReduce查询逻辑。但是某些情况下，因为不熟悉数据特性，或没有遵循Hive的优化约定，Hive计算任务会变得非常低效，甚至无法得到结果。一个”好”的Hive程序仍然需要对Hive运行机制有深入的了解。

有一些大家比较熟悉的优化约定包括：Join中需要将大表写在靠右的位置；尽量使用UDF而不是transfrom……诸如此类。下面讨论5个性能和逻辑]]></description><category></category></item><item><title><![CDATA[Hadoop Hive 中的排序 Order by ,Sort by ,Distribute by, Cluster By,]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19199595</link><guid>https://blog.csdn.net/jojo52013145/article/details/19199595</guid><author>jojo52013145</author><pubDate>Fri, 14 Feb 2014 14:33:26 +0800</pubDate><description><![CDATA[order by

order by 会对输入做全局排序，因此只有一个reducer（多个reducer无法保证全局有序）
只有一个reducer，会导致当输入规模较大时，需要较长的计算时间。

set hive.mapred.mode=nonstrict; (default value / 默认值)

set hive.mapred.mode=strict;

order by]]></description><category></category></item><item><title><![CDATA[HDFS Datanode数据存储格式分析]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19168975</link><guid>https://blog.csdn.net/jojo52013145/article/details/19168975</guid><author>jojo52013145</author><pubDate>Thu, 13 Feb 2014 17:55:03 +0800</pubDate><description><![CDATA[在Datanode中，每一个block都对应一个数据存储文件，数据存储文件以_blk开头；同时，每一个block还对应一个元数据文件，元数据文件以.meta结尾（注意：meta file的命名格式如下blokcFileName_generationStamp.meta）。
       首先将一下我理解的几个概念。在HDFS中有storage的概念，每一个节点对应一个storage。我们可以理解]]></description><category></category></item><item><title><![CDATA[HDFS Datanode数据存储格式分析]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19168933</link><guid>https://blog.csdn.net/jojo52013145/article/details/19168933</guid><author>jojo52013145</author><pubDate>Thu, 13 Feb 2014 17:51:01 +0800</pubDate><description><![CDATA[首先在Datanode中，每一个block都对应一个数据存储文件，数据存储文件以_blk开头；同时，每一个block还对应一个元数据文件，元数据文件以.meta结尾（注意：meta file的命名格式如下blokcFileName_generationStamp.meta）。

首先将一下我理解的几个概念。在HDFS中有storage的概念，每一个节点对应一个storage。我们可以理解为一个]]></description><category></category></item><item><title><![CDATA[Hive限制]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19168715</link><guid>https://blog.csdn.net/jojo52013145/article/details/19168715</guid><author>jojo52013145</author><pubDate>Thu, 13 Feb 2014 17:42:21 +0800</pubDate><description><![CDATA[1.更新，事务，索引，不支持，是全表扫描

2.创建表的字段类型和java类型是对应的。不支持日期类型，提供转换为字符串类型的函数。

3.查询语句中，不支持having，可写嵌套的select来解决；group by后只能是表的定义列名，不能像mysql那样可以为查询语句为逻辑处理结果声明的别名，但可为逻辑处理过程语句

4.内置函数查看命令（show functions;desc ]]></description><category></category></item><item><title><![CDATA[使用 Hive 构建数据库]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19166829</link><guid>https://blog.csdn.net/jojo52013145/article/details/19166829</guid><author>jojo52013145</author><pubDate>Thu, 13 Feb 2014 17:02:10 +0800</pubDate><description><![CDATA[当您需要处理大量数据时，存储它们是一个不错的选择。令人难以置信的发现或未来预测不会来自未使用的数据。大数据是一个复杂的怪兽。用 Java™ 编程语言编写复杂的 MapReduce 程序要耗费很多时间、良好的资源和专业知识，这正是大部分企业所不具备的。这也是在 Hadoop 上使用诸如 Hive 之类的工具构建数据库会成为一个功能强大的解决方案的原因。



作者：Peter J. Jama]]></description><category></category></item><item><title><![CDATA[Hive中partition如何使用]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19162131</link><guid>https://blog.csdn.net/jojo52013145/article/details/19162131</guid><author>jojo52013145</author><pubDate>Thu, 13 Feb 2014 15:16:26 +0800</pubDate><description><![CDATA[一、背景

1、在Hive Select查询中一般会扫描整个表内容，会消耗很多时间做没必要的工作。有时候只需要扫描表中关心的一部分数据，因此建表时引入了partition概念。

2、分区表指的是在创建表时指定的partition的分区空间。

3、如果需要创建有分区的表，需要在create表的时候调用可选参数partitioned by，详见表创建的语法结构。

二、技术细节
]]></description><category></category></item><item><title><![CDATA[Hive QL 语法]]></title><link>https://blog.csdn.net/jojo52013145/article/details/19154533</link><guid>https://blog.csdn.net/jojo52013145/article/details/19154533</guid><author>jojo52013145</author><pubDate>Thu, 13 Feb 2014 10:43:11 +0800</pubDate><description><![CDATA[Hive 的官方文档中对查询语言有了很详细的描述，请参考：http://wiki.apache.org/hadoop/Hive/LanguageManual ，本文的内容大部分翻译自该页面，期间加入了一些在使用过程中需要注意到的事项。
1. DDL Operations
创建表：

hive> CREATE TABLE pokes (foo INT, bar STRING); 
创建表并]]></description><category></category></item><item><title><![CDATA[Oracle undo 表空间管理]]></title><link>https://blog.csdn.net/jojo52013145/article/details/17395445</link><guid>https://blog.csdn.net/jojo52013145/article/details/17395445</guid><author>jojo52013145</author><pubDate>Wed, 18 Dec 2013 15:18:29 +0800</pubDate><description><![CDATA[Oracle 的Undo有两种方式： 一是使用undo 表空间，二是使用回滚段. 




我们通过 undo_management 参数来控制使用哪种方式，如果设为auto，就使用UNDO 表空间，这时必须要指定一个UNDO 表空间。 如果设为manual，系统启动后使用rollback segment方式存储undo信息。如果系统没有指定undo_management，那么系统默认以]]></description><category></category></item><item><title><![CDATA[数据分析师的层级]]></title><link>https://blog.csdn.net/jojo52013145/article/details/16902599</link><guid>https://blog.csdn.net/jojo52013145/article/details/16902599</guid><author>jojo52013145</author><pubDate>Sat, 23 Nov 2013 16:37:16 +0800</pubDate><description><![CDATA[前段时间在微博上看到一张某集团的数据分析师职位层级表，由于表格太大，在网页上显得字体太小，很难看清楚，因此我将它简化处理成如下两张表格，分为层级1和层级2：


从表中可以看出，专家级的数据分析在分析方法的要求方面与资深数据分析师是相同的，层级2与层级1的能力差别主要体现在业务分析能力、管理能力和影响力等方面。要从“使命必达”的助理数据分析师，成长为“独挡一面”的数据分析专家，其中必然需要学]]></description><category></category></item><item><title><![CDATA[数据分析师的层级]]></title><link>https://blog.csdn.net/jojo52013145/article/details/16902537</link><guid>https://blog.csdn.net/jojo52013145/article/details/16902537</guid><author>jojo52013145</author><pubDate>Sat, 23 Nov 2013 16:27:11 +0800</pubDate><description><![CDATA[前段时间在微博上看到一张某集团的数据分析师职位层级表，由于表格太大，在网页上显得字体太小，很难看清楚，因此我将它简化处理成如下两张表格，分为层级1和层级2：


从表中可以看出，专家级的数据分析在分析方法的要求方面与资深数据分析师是相同的，层级2与层级1的能力差别主要体现在业务分析能力、管理能力和影响力等方面。要从“使命必达”的助理数据分析师，成长为“独挡一面”的数据分析专家，其中必然需要学]]></description><category></category></item><item><title><![CDATA[数据分析师的成长之路]]></title><link>https://blog.csdn.net/jojo52013145/article/details/16825735</link><guid>https://blog.csdn.net/jojo52013145/article/details/16825735</guid><author>jojo52013145</author><pubDate>Tue, 19 Nov 2013 15:40:59 +0800</pubDate><description><![CDATA[一、掌握基础、更新知识。 

基本技术怎么强调都不过分。这里的术更多是（计算机、统计知识）， 多年做数据分析、数据挖掘的经历来看、以及业界朋友的交流来看，这点大家深有感触的。
数据库查询—SQL
数据分析师在计算机的层面的技能要求较低，主要是会SQL，因为这里解决一个数据提取的问题。有机会可以去逛逛一些专业的数据论坛，学习一些SQL技巧、新的函数，对你工作效率的提高是很有帮助的。
统计知]]></description><category></category></item><item><title><![CDATA[Oracle 临时表空间的增删改查]]></title><link>https://blog.csdn.net/jojo52013145/article/details/12874803</link><guid>https://blog.csdn.net/jojo52013145/article/details/12874803</guid><author>jojo52013145</author><pubDate>Sat, 19 Oct 2013 20:35:07 +0800</pubDate><description><![CDATA[1、查看临时表空间 （dba_temp_files视图）（v_$tempfile视图）
select tablespace_name,file_name,bytes/1024/1024 file_size,autoextensible from dba_temp_files;
select status,enabled, name, bytes/1024/1024 file_size from]]></description><category></category></item><item><title><![CDATA[Oracle 表空间设计]]></title><link>https://blog.csdn.net/jojo52013145/article/details/12872669</link><guid>https://blog.csdn.net/jojo52013145/article/details/12872669</guid><author>jojo52013145</author><pubDate>Sat, 19 Oct 2013 17:19:41 +0800</pubDate><description><![CDATA[Oracle数据库开创性地提出了表空间的设计理念，这为Oracle数据库的高性能做出了不可磨灭的贡献。可以这么说，Oracle中很多优化都是基于表空间的设计理念而实现的。


常用原则：

1、一般较大的表或索引单独分配一个tablespace。
2、Read only对象或Read mostly对象分成一组，存在对应的tablespace中。
3、若tablespace中的对象皆是]]></description><category></category></item></channel></rss>