《数据分析实战》总结三之关联分析算法Apriori+连接分析算法PageRank+常用的数据挖掘算法逻辑回归

1 关联分析算法:Apriori

关联规则挖掘的重要算法:Apriori

关联规则挖掘可以让我们从数据集中发现项与项(item 与 item)之间的关系

概念:

支持度:指的是某个物品在组合中出现的次数与总次数之间的比例。支持度越高,代表这个组合出现的频率越大。

置信度:指的是在 A 发生的情况下,B 发生的概率是多少。

提升度:指的是A的发生对B的发生概率提升的程度。

公式:提升度 (A→B)= 置信度 (A→B)/ 支持度 (B),用来衡量 A 出现的情况下,是否会对 B 出现的概率有所提升

频繁项集:支持度大于等于最小支持度 (Min Support,可随机指定) 阈值的项集,所以小于最小值支持度的项目就是非频繁项集,而大于等于最小支持度的项集就是频繁项集。

工作原理:

1 初始化K=1,计算 K 项集的支持度;

2 筛选掉小于最小支持度(随机指定)的项集;

3 如果项集为空,则对应 K-1 项集的结果为最终结果,或者说项集只有一行,那此行就是结果;
否则 K=K+1,重复 1-3 步。

FP-Growth 算法:对Apriori进行改进

Apriori缺陷:

1 可能产生大量的候选集。因为采用排列组合的方式,把可能的项集都组合出来了&#

  • 1
    点赞
  • 11
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值