mahout kmeans 测试

最新推荐文章于 2021-03-23 00:41:00 发布

flyeagle88

最新推荐文章于 2021-03-23 00:41:00 发布

阅读量893

点赞数

分类专栏： mahout

本文链接：https://blog.csdn.net/flyeagle88/article/details/12711725

版权

mahout 专栏收录该内容

1 篇文章 0 订阅

订阅专栏

参考网址：

http://www.cnblogs.com/linjiqin/archive/2013/03/15/2961649.html

http://blog.163.com/jiayouweijiewj@126/blog/static/171232177201011475716354/

执行算法命令

hadoop jar /opt/cloudera/parcels/CDH/lib/mahout/mahout-examples-0.7-cdh4.3.0-job.jar \

org.apache.mahout.clustering.syntheticcontrol.kmeans.Job

查看结果

mahout seqdumper：将SequenceFile文件转成可读的文本形式，对应的源文件是org.apache.mahout.utils.SequenceFileDumper.java
mahout vectordump：将向量文件转成可读的文本形式，对应的源文件是org.apache.mahout.utils.vectors.VectorDumper.java
mahout clusterdump：分析最后聚类的输出结果，对应的源文件是org.apache.mahout.utils.clustering.ClusterDumper.java

clusteredPoints：存放的是最后聚类的结果，将cluster-id和documents-id都展示出来了，用mahoutseqdumper读clusteredPoints结果的key-value类型是(IntWritable,WeightedVectorWritable)

查看命令：

mahout seqdumper -i /user/root/output/clusteredPoints/part-m-00000 -o clusteredPoints.txt

clusters-N：是第N次聚类的结果，其中n为某类的样本数目，c为各类各属性的中心，r为各类属性的半径。 clusters-N结果类型是(Text,Cluster)

查看命令：(测试有问题，显示不出来....)

mahout seqdumper -i /user/root/output/clusters-0/part-00000

mahout seqdumper -i /user/root/output/clusters-9-final/part-r-00000

data：存放的是原始数据，这个文件夹下的文件可以用mahout vectordump来读取，原始数据是向量形式的，其它的都只能用mahout seqdumper来读取，向量文件也可以用mahout seqdumper来读取，只是用vectordump读取出来的是数字结果，没有对应的key，用seqdumper读出来的可以看到key，即对应的url，而value读出来的是一个类描述，而不是数组向量

例如要查看data下的文件用命令：

mahout vectordump -i /user/root/output/data/part-m-00000 -o data_vector.txt

flyeagle88

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
mahout kmeans 测试

hadoop jar /opt/cloudera/parcels/CDH/lib/mahout/mahout-examples-0.7-cdh4.3.0-job.jar \org.apache.mahout.clustering.syntheticcontrol.kmeans.Job
复制链接

扫一扫