自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

Thinkgamer博客

《推荐系统开发实战》作者,「搜索与推荐Wiki」公号负责人,CyanScikit科技创始人...

原创 IK Analyzer 和 lucene结合使用

特别注意:版本问题(IK Analyzer的版本中注意各个版本的细微区别,小编就是栽在IK Analyzer2012_U5 和IK Analyzer2012FF上了) 版本匹配: 1、IK Analyzer 2012_U5 支持的是 lucene 3.2-3.6版本 2、IK Analyze...

2015-07-31 14:29:28

阅读数 3752

评论数 1

原创 《图论》——深度优先搜索算法(DFS)

十大算法之广度优先遍历: 深度优先搜索遍历类似于树的先序遍历。假定给定图G的初态是所有顶点均未被访问过,在G中任选一个顶点i作为遍历的初始点,则深度优先搜索递归调用包含以下操作: (1)访问搜索到的未被访问的邻接点; (2)将此顶点的visited数组元素值置1; (3)搜索该顶点的未...

2015-07-31 09:55:35

阅读数 1824

评论数 0

原创 四、伪分布下安装hive1.2

声明:本篇blog并没有配置MySQL,元数据库为derby 如需配置mysql请点击:http://blog.csdn.net/gamer_gyt/article/details/47776369 一、环境 Ubuntu14.04 hadoop2.6伪分布(安装教程请参考:点击打开链接)...

2015-07-30 15:57:36

阅读数 4240

评论数 3

原创 《图论》——广度优先遍历算法(BFS)

十大算法之广度优先遍历: 本文以实例形式讲述了基于Java的图的广度优先遍历算法实现方法,具体方法如下: 用邻接矩阵存储图方法: 1.确定图的顶点个数和边的个数 2.输入顶点信息存储在一维数组vet中 3.初始化邻接矩阵; 4.依次输入每条边存储在邻接矩阵array中 输入边依附的两个...

2015-07-30 11:57:15

阅读数 2781

评论数 2

原创 《排序算法》——堆排序(大顶堆,小顶堆,Java)

十大算法之堆排序: 堆的定义如下:   n个元素的序列{k0,k1,...,ki,…,k(n-1)}当且仅当满足下关系时,称之为堆。   " ki<=k2i,ki<=k2i+1;或ki>=k2i,ki>=k2i+1.(i=1,2...

2015-07-30 09:12:54

阅读数 3264

评论数 0

原创 hbase shell 基本操作命令

具体的hbase shell 命令如下表所示: 查看hbase 的状态 : status 查看hbase 的版本 : version 创建scores表: create ‘scores’,‘grad’,'course' 查看当前hbase 中有哪些表: ...

2015-07-29 18:26:59

阅读数 1846

评论数 0

原创 三、伪分布环境下安装hbase

环境说明: 1、hadoop2.6伪分布安装:具体请参考博主的一篇文章:http://blog.csdn.net/gamer_gyt/article/details/46793731 2、Ubuntu14.04 3、hbase-0.98.13-hadoop2-bin,hbase下载链接...

2015-07-29 14:17:05

阅读数 1736

评论数 0

原创 线性查找算法

十大算法之线性查找: 介绍: BFPRT算法解决的问题十分经典,即从某n个元素的序列中选出第k大(第k小)的元素,通过巧妙的分 析,BFPRT可以保证在最坏情况下仍为线性时间复杂度。该算法的思想与快速排序思想相似,当然,为使得算法在最坏情况下,依然能达到o(n)的时间复杂 度,五位算法作者...

2015-07-29 12:25:47

阅读数 2938

评论数 0

原创 二分查找算法

十大算法之二分查找: 二分查找算法是在有序数组中用到的较为频繁的一种算法,在未接触二分查找算法时,最通用的一种做法是,对数组进行遍历,跟每个元素进行比较,其时间为O(n).但二分查找算法则更优,因为其查找时间为O(lgn),譬如数组{1, 2, 3, 4, 5, 6, 7, 8, 9},查找元素6...

2015-07-29 10:44:54

阅读数 1849

评论数 2

原创 《排序算法》——快速排序(Java)

十大算法之快速排序: 方法其实很简单:分别从初始序列“6 1 2 7 9 3 4 5 10 8”两端开始“探测”。先从右往左找一个小于6的数,再从左往右找一个大于6的数,然后交换他们。这里可以用两个变量i和j,分别指向序列最左边和最右边。我们为这两个变量起个好听的名字“哨兵i”和“哨兵j”。...

2015-07-29 09:44:28

阅读数 1397

评论数 0

原创 搜索引擎:MapReduce实战----倒排索引

1.倒排索引简介 倒排索引(Inverted index),也常被称为反向索引、置入档案或反向档案,是一种索引方法,被用来存储在全文搜索下某个单词在一个文档或者一组文档中的存储位置的映射。它是文档检索系统中最常用的数据结构。 有两种不同的反向索引形式: 一条记录的水平反向索引(或者反向档案索...

2015-07-28 10:23:59

阅读数 3124

评论数 0

原创 MapReducer中的多次归约处理

我们知道,MapReduce是分为Mapper任务和Reducer任务,Mapper任务的输出,通过网络传输到Reducer任务端,作为输入。 在Reducer任务中,通常做的事情是对数据进行归约处理。既然数据来源是Mapper任务的输出,那么是否可以在Mapper端对数据进行归约处理,业务逻辑...

2015-07-28 09:06:41

阅读数 1953

评论数 0

原创 hadoop命令——hdfs

hdfs是hadoop大体系下的分布式文件管理系统,是英文Hadoop Distributed File System的简写,其常用命令如下: 一:fs命令(和Linux终端运行命令一致,也是hdfs最常用命令) 二:其他相关命令 1、hadoop 归档文件shell:hadoop ar...

2015-07-11 17:11:32

阅读数 1547

评论数 0

原创 VirtualBox 虚拟Ubuntu系统与主机互ping

互ping的前提是主机和虚拟机的ip地址在同一波段【eg:主机为:192.168.1.10虚拟Linux:192.168.1.11】 1、设置主机ip: 打开网络共享中心->更改适配器设置->以太网,修改其ip 在主机上运行CMD输...

2015-07-08 23:04:18

阅读数 4326

评论数 0

原创 linux ifconfig命令配置ip地址

Linux下网卡命名规律:eth0,eth1。第一块以太网卡,第二块。 lo为环回接口,它的IP地址固定为127.0.0.1,掩码8位。它代表你的机器本身。 ifconfig [Interface] 是查看网卡的信息 ,如果不加参数查看的是所有的网卡信息 加上参数eth0...

2015-07-08 12:31:26

阅读数 3223

评论数 0

原创 二、hadoop伪分布搭建

环境 虚拟机:VirtualBox Ubuntu:14.04 hadoop:2.6 安装 1、创建hadoop用户 sudo useradd -m hadoop -s/bin/bash 【Ubun...

2015-07-07 20:14:49

阅读数 5220

评论数 3

原创 MySQLdb的安装与使用

一、安装 安装已编译版本(此方法简便快捷): http://www.codegood.com/downloads 根据自己系统下载,双击安装,搞定 然后import MySQLdb,查看是否成功 我的,win7,32位,2.7版本 MySQL-python-1.2.3.win-am...

2015-07-05 11:44:08

阅读数 2302

评论数 0

提示
确定要删除当前文章?
取消 删除