所谓闭项集,就是指一个项集X,它的直接超集的支持度计数都不等于它本身的支持度计数。
如果闭项集同时是频繁的,也就是它的支持度大于等于最小支持度阈值,那它就称为闭频繁项集。
例如,有交易数据库
TID item
1 abc
2 abcd
3 bce
4 acde
5 de
因为项集{b,c}出现在TID为1,2,3的事务中,所以{b,c}的支持度计数为3。而{b,c}的直接超集:{a,b,c},{a,b,c,d}的支持度计数分别为2,1,都不等于{b,c}的支持度计数3,所以{b,c}为闭项集,如果支持度阈值为40%,则{b,c}也为闭频繁项集。
项集{a,b}出现在TID为1,2的事务中,其支持度计数为2。而它的直接超集{a,b,c}支持度计数也为2,所以{a,b}不是闭项集。
极大频繁项集:本身频繁,直接超集支持度小于等于本身支持度,且是频繁的。
若S的支持度≥给定最小支持度,称S为频繁项集(Frequent Itemset)。
如果频繁项集L的所有超集都是非频繁项集,那么称L为最大频繁项集或称最大频繁模式,记为MFI (Maximal Frequent Itemset)。
所谓闭项集,就是指一个项集X,它的**直接超集(最小的严格超集)**的支持度计数都不等于它本身的支持度计数。如果闭项集同时是频繁的,也就是它的支持度大于等于最小支持度阈值,那它就称为闭频繁项集。
数据挖掘 闭项集
最新推荐文章于 2022-11-21 16:34:09 发布