一.简介
计算两个系列数据之间的相关性是“统计”中的常见操作。spark.ml 提供了很多系列中的灵活性,计算两两相关性。目前支持的相关方法是Pearson和Spearman的相关。
Correlation 使用指定的方法为向量的输入数据集计算相关矩阵。输出将是一个DataFrame,其中包含向量列的相关矩阵。
二.代码实战
import spark.implicits._
val data = Seq(
Vectors.sparse(4, Seq((0, 7.0), (3, -2.0))), // 稀疏向量,等价于dense(7.0, 0.0, 0.0, -2.0)
Vectors.dense(0.0, 5.0, 3.0, 3.0), // 稠密向量
Vectors.dense(0.0, 7.0, 5.0, 8.0