Spark ML基本算法【Correlation相关性】

最新推荐文章于 2024-05-10 09:12:55 发布

神之凝视

最新推荐文章于 2024-05-10 09:12:55 发布

阅读量2.7k

点赞数 1

分类专栏： Spark 机器学习大数据文章标签： spark ml

本文链接：https://blog.csdn.net/qq_27600723/article/details/106956524

版权

一.简介

计算两个系列数据之间的相关性是“统计”中的常见操作。spark.ml 提供了很多系列中的灵活性，计算两两相关性。目前支持的相关方法是Pearson和Spearman的相关。
Correlation 使用指定的方法为向量的输入数据集计算相关矩阵。输出将是一个DataFrame，其中包含向量列的相关矩阵。

二.代码实战

    import spark.implicits._

    val data = Seq(
      Vectors.sparse(4, Seq((0, 7.0), (3, -2.0))), // 稀疏向量，等价于dense(7.0, 0.0, 0.0, -2.0)
      Vectors.dense(0.0, 5.0, 3.0, 3.0), // 稠密向量
      Vectors.dense(0.0, 7.0, 5.0, 8.0

最低0.47元/天解锁文章

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

神之凝视

关注关注

1
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
Spark ML基本算法【Correlation相关性】

一.简介计算两个系列数据之间的相关性是“统计”中的常见操作。spark.ml 提供了很多系列中的灵活性，计算两两相关性。目前支持的相关方法是Pearson和Spearman的相关。Correlation 使用指定的方法为向量的输入数据集计算相关矩阵。输出将是一个DataFrame，其中包含向量列的相关矩阵。二.代码实战package big.data.analyse.mlimport org.apache.log4j.{Level, Logger}import org.apache.spark
复制链接

扫一扫