【发布时间】:2011-05-16 11:52:54
【问题描述】:
首先从数据库中找到最小频繁模式。
然后将它们划分为各种数据类型,如基于区间、二进制、有序变量等,并为所有变量定义各种距离度量。
最后应用聚类分析方法。
这个顺序是对的还是我错过了什么?
【问题讨论】:
标签: database cluster-analysis data-mining
首先从数据库中找到最小频繁模式。
然后将它们划分为各种数据类型,如基于区间、二进制、有序变量等,并为所有变量定义各种距离度量。
最后应用聚类分析方法。
这个顺序是对的还是我错过了什么?
【问题讨论】:
标签: database cluster-analysis data-mining
你是否正确取决于你想做什么。您描述的一般方法似乎朝着正确的方向发展,但在您回答以下问题之前,您永远不会知道自己是否达到目标:
根据您的描述,在我看来,您想要执行“预处理”步骤,例如特征选择和矢量化。不幸的是,这本身就非常具有挑战性。例如,最大的特殊问题之一是距离函数的设计(有大量研究可用)。
因此,请向我们提供有关您的特定目标应用程序的更多信息。
【讨论】: