汇总统计
我们提供列汇总统计RDD(Vector),通过colStats函数中可用的统计信息。
colStats()返回一个MultivariateStatisticalSummary实例,包含列的最大值、最小值、均值、方差和非零的数量以及总数量。
import org.apache.spark.mllib.linalg.Vector
import org.apache.spark.mllib.stat.{MultivariateStatisticalSummary, Statistics}
val observations: RDD[Vector] = ... // an RDD of Vectors
// Compute column summary statistics.
val summary: MultivariateStatisticalSummary = Statistics.colStats(observations)
println(summary.mean) // a dense vector containing the mean value for each column
println(summary.variance) // column-wise variance
println(summary.numNonzeros) // number of nonzeros in each column
未完待续~