一提人工智能大数据,必有人提啤酒与尿布,有意思的是,都2020年了,还有人信这个老掉牙的都市传说。今天我们系统讲解一下。
一、站在背后的关联规则
支持啤酒与尿布故事的,是关联规则算法。注意:关联规则算法本身没啥问题,这是一种发现关联关系(注意:不是因果关系哦)的手段,并且它的算法原理非常简单,需要的数据也非常少,因此适用范围非常广。
假设有6种产品,ABCDEF,一个客人买了AB去结账,收银员打出一张小票,上边有AB产品的名称、价格,我们可以用0、1代表是否有该商品,简单把小票表示成:
类似地,如果有5张订单,可以表示成:
注意,即使没有计算,用肉眼也能看到,似乎ABC三个产品在订单里同时出现的几率很高,这就是关联规则的基本思路:找到同时出现频率高的组合。只不过,我们需要用一些指标来衡量:到底什么算高。
因为有六个商品,所以同时出现的组合有很多种:A+B,A+B+C等,我们从最简单的两两组合开始计算,再算三三、四四……计算组合的时候,我们希望组合出现的频率越高越好,因此有了支持度概念: