python apriori算法 sklearn_Apriori关联分析

最新推荐文章于 2021-03-02 07:18:52 发布

weixin_39884412

最新推荐文章于 2021-03-02 07:18:52 发布

阅读量1.7k

点赞数 1

文章标签： python apriori算法 sklearn

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39884412/article/details/112890973

版权

关联规则挖掘可以让我们从数据集中发现项与项(item 与 item)之间的关系，它在我们的生活中有很多应用场景，“购物篮分析”就是一个常见的场景。

在今天的内容中，希望你能带着问题，和我一起来搞懂以下几个知识点：

搞懂关联规则中的几个重要概念：支持度、置信度、提升度；

Apriori 算法的工作原理；

在实际工作中，我们该如何进行关联规则挖掘。

搞懂关联规则中的几个概念

我举一个超市购物的例子，下面是几名客户购买的商品列表：

什么是支持度呢？

支持度是个百分比，它指的是某个商品组合出现的次数与总次数之间的比例。支持度越高，代表这个组合出现的频率越大。

在这个例子中，我们能看到“牛奶”出现了 4 次，那么这 5笔订单中“牛奶”的支持度就是 4/5=0.8。

同样“牛奶 + 面包”出现了 3 次，那么这 5 笔订单中"牛奶 + 面包”的支持度就是 3/5=0.6。

什么是置信度呢？

它指的就是当你购买了商品 A，会有多大的概率购买商品 B，在上面这个例子中：

置信度(牛奶→啤酒)=2/4=0.5，代表如果你购买了牛奶，有多大的概率会购买啤酒？

置信度(啤酒→牛奶)=2/3=0.67，代表如果你购买了啤酒，有多大的概率会购买牛奶？

我们能看到，在 4 次购买了牛奶的情况下，有 2 次购买了啤酒，所以置信度 (牛奶→啤酒)=0.5，而在 3 次购买啤酒的情况下，有 2 次购买了牛奶，所以置信度(啤酒→牛奶)=0.67。

所以说置信度是个条件概念，就是说在 A 发生的情况下，B 发生的概率是多少。

什么是提升度呢？

我们在做商品推荐的时候，重点考虑的是提升度，因为提升度代表的是“商品 A 的出现，对商品 B 的出现概率提升的”程度。

Apriori 的工作原理

首先我们把上面案例中的商品用 ID 来代表，牛奶、面包、尿布、可乐、啤酒、鸡蛋的商品 ID 分别设置为 1-6，上面的数据表可以变为：

Apriori 算法其实就是查找频繁项集 (frequent itemset) 的过程，所以首先我们需要定义什么是频繁项集。

频繁项集就是支持度大于等于最小支持度 (Min Support)

最低0.47元/天解锁文章

weixin_39884412

关注

1
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
python apriori算法 sklearn_Apriori关联分析

关联规则挖掘可以让我们从数据集中发现项与项(item 与 item)之间的关系，它在我们的生活中有很多应用场景，“购物篮分析”就是一个常见的场景。在今天的内容中，希望你能带着问题，和我一起来搞懂以下几个知识点：搞懂关联规则中的几个重要概念：支持度、置信度、提升度；Apriori 算法的工作原理；在实际工作中，我们该如何进行关联规则挖掘。搞懂关联规则中的几个概念我举一个超市购物的例子，下面是几名客户...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。