mahout kmeans 测试

参考网址:

http://www.cnblogs.com/linjiqin/archive/2013/03/15/2961649.html


http://blog.163.com/jiayouweijiewj@126/blog/static/171232177201011475716354/


执行算法命令


hadoop jar /opt/cloudera/parcels/CDH/lib/mahout/mahout-examples-0.7-cdh4.3.0-job.jar \

org.apache.mahout.clustering.syntheticcontrol.kmeans.Job



查看结果

mahout seqdumper:将SequenceFile文件转成可读的文本形式,对应的源文件是org.apache.mahout.utils.SequenceFileDumper.java
mahout vectordump
:将向量文件转成可读的文本形式,对应的源文件是org.apache.mahout.utils.vectors.VectorDumper.java
mahout clusterdump
:分析最后聚类的输出结果,对应的源文件是org.apache.mahout.utils.clustering.ClusterDumper.java


clusteredPoints:存放的是最后聚类的结果,将cluster-id和documents-id都展示出来了,用mahoutseqdumper读clusteredPoints结果的key-value类型是(IntWritable,WeightedVectorWritable)

查看命令:

mahout seqdumper -i /user/root/output/clusteredPoints/part-m-00000 -o clusteredPoints.txt


clusters-N:是第N次聚类的结果,其中n为某类的样本数目,c为各类各属性的中心,r为各类属性的半径。 clusters-N结果类型是(Text,Cluster)

查看命令:(测试有问题,显示不出来....)

mahout seqdumper -i  /user/root/output/clusters-0/part-00000 

mahout seqdumper -i  /user/root/output/clusters-9-final/part-r-00000


data:存放的是原始数据,这个文件夹下的文件可以用mahout vectordump来读取,原始数据是向量形式的,其它的都只能用mahout seqdumper来读取,向量文件也可以用mahout seqdumper来读取,只是用vectordump读取出来的是数字结果,没有对应的key,用seqdumper读出来的可以看到key,即对应的url,而value读出来的是一个类描述,而不是数组向量

例如要查看data下的文件用命令:

mahout vectordump -i   /user/root/output/data/part-m-00000 -o data_vector.txt




  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值