【发布时间】:2012-12-20 10:39:48
【问题描述】:
我正在尝试了解用于数据挖掘的 Apriori(篮子)算法的基础知识,
我最好用一个例子来解释我遇到的复杂情况:
这是一个交易数据集:
t1: Milk, Chicken, Beer
t2: Chicken, Cheese
t3: Cheese, Boots
t4: Cheese, Chicken, Beer
t5: Chicken, Beer, Clothes, Cheese, Milk
t6: Clothes, Beer, Milk
t7: Beer, Milk, Clothes
上述的最小限制是 0.5 或 50%。
从上面来看,我的事务数显然是 7,这意味着要使一个项集“频繁”,它的计数必须是 4/7。因此,这是我的频繁项集 1:
F1:
Milk = 4
Chicken = 4
Beer = 5
Cheese = 4
然后,我为第二次改进 (C2) 创建了候选对象并将其缩小到:
F2:
{Milk, Beer} = 4
这是我感到困惑的地方,如果要求我显示所有频繁项集,我是写下所有F1 和F2 还是只写下F2? F1 对我来说不是“集合”。
然后我被要求为我刚刚定义的频繁项集创建关联规则并计算它们的“置信度”数字,我得到了:
Milk -> Beer = 100% confidence
Beer -> Milk = 80% confidence
将F1 的项集放在这里似乎是多余的,因为无论如何它们都会有 100% 的置信度,并且实际上不会“关联”任何东西,这就是我现在质疑 F1 是否是确实“频繁”?
【问题讨论】:
-
空集也是集合。并且有些集合具有 1 个元素。它们可以是常用项集,而无需提供有用的关联规则。
标签: algorithm data-mining apriori