Apriori核心算法过程如下:
- 过单趟扫描数据库D计算出各个1项集的支持度,得 到频繁1项集的集合。
- 连接步:为了生成,预先生成,由2个只有一个项不同的属于的频集做一 个(k-2)JOIN运算得到的。
- 剪枝步:由于是的超集,所以可能有些元素不是频繁的。在 潜在k项集的某个子集不是中的成员是,则该潜在频繁项集不可能是频繁的可以从中移去。
- 通过 单趟扫描数据库D,计算中各个项集的支持度,将中不满足支持度的项集去掉形成。
对于一个例子:
假设使用表1的事务数据,该数据库具有9个事务,设最小支持度为2,频繁项集的极大长度为3。
表1某商店的详细事务数据
TID |
Items |
1 2 3 |