【发布时间】:2013-12-12 01:17:11
【问题描述】:
返回一个关于数据挖掘的问题,并与 Weka 和 WekaSharp 合作进行数据挖掘。通过 WekaSharp,我一直在对一个相当大的数据集进行一些分析,该数据集是 KDD Cup 1999 10% 数据库(~70 mb)。我使用决策树 J48 算法和朴素贝叶斯算法都取得了很好的结果,每个算法都需要 10 到 30 分钟才能完成。当我通过 KNN 算法运行相同的数据并且它从未完成分析时,它不会出错,它只是永远运行。我已经尝试了所有不同的参数,但没有任何效果。当我在较小的样本数据集(例如 iris.arff)上运行相同的 KNN 算法时,它可以轻松完成。这是我对 KNN 参数的设置: "-K 1 -W 0 -A \"weka.core.neighboursearch.KDTree -A \\"weka.core.EuclideanDistance -R first-last\\"\"" KNN 和大型数据集是否存在固有问题,或者是否存在设置问题?非常感谢。
【问题讨论】:
标签: algorithm weka data-mining knn large-data