【发布时间】:2016-02-25 01:18:57
【问题描述】:
我对机器学习很陌生。对不起,如果我的英语有任何错误。
我正在使用 weka J48 分类来预测真假。我有将近 999K 的训练集用于训练模型。我使用了 3 折交叉验证方法来训练模型,其准确率约为 84%。
现在在存储模型之后。我试图在 50k 数据集上对其进行测试。这给出了非常糟糕的结果,其中 50% 是不匹配的。我有 11 个带有名义和数字字段的属性。
我不知道为什么会这样。
我有两个问题。
- 如何训练才能在测试集上表现得更好。
- 可能存在哪些问题。
我在 java 中使用 weka api。
【问题讨论】:
-
您是如何选择 50K 集进行测试的?
-
其实我用了30天的训练数据和1天的数据进行测试和预测。
-
你是如何获取1天的测试数据的?
-
我正在获取 CSV 文件,然后将其转换为 ARFF。
标签: classification weka prediction