【发布时间】:2015-04-29 19:49:25
【问题描述】:
我有一个主要是整数值的数据集。我想对其应用关联规则挖掘。我查看了流行的算法,如 Apriori 等,但它们都适用于具有布尔值的数据,即该项目存在于事务中或不存在于事务中。
有没有一种算法可以让我们在属性的计数之外考虑属性的值? (我计划将数据标准化为 0 到 1 之间的值)
【问题讨论】:
标签: data-mining
我有一个主要是整数值的数据集。我想对其应用关联规则挖掘。我查看了流行的算法,如 Apriori 等,但它们都适用于具有布尔值的数据,即该项目存在于事务中或不存在于事务中。
有没有一种算法可以让我们在属性的计数之外考虑属性的值? (我计划将数据标准化为 0 到 1 之间的值)
【问题讨论】:
标签: data-mining
项目-项目协同过滤与关联规则挖掘等基于相似性的数据挖掘技术非常相似。此外,协同过滤被构建用于处理连续和有序值,例如星级或李克特量表:这通常是来自用户的偏好信息。
基于内容的过滤可能是您描述的情况的最佳选择。它允许项目属性和权重(不会因该项目的每个用户而改变),然后考虑每个项目的用户偏好(该项目的每个用户都会改变)。
如果您希望每个用户-项目对的偏好(计数)和属性都发生变化,我不知道有什么算法可以处理这个问题。通常算法是为每个用户-项目对的一个输入构建的。
【讨论】:
是的。项集挖掘问题有一些变体,可以让您指定附加信息。例如,高效用项集挖掘算法允许您为交易中出现的每个项目指定数量,以及每个项目的权重。
【讨论】:
如果您的 nubers 是整数(为什么要归一化为 0 1?)并且很小,您可以“破解”这个限制:
apple banana apple
变成
apple banana apple_2
这将允许找到像
这样的关联规则banana => apple, apple_2
但您需要混合一些巧妙的过滤器,以免得到无用的规则,例如
apple_2 => apple
【讨论】: