【发布时间】:2021-12-25 15:42:39
【问题描述】:
我有一个数据集。我想使用分层采样拆分数据集。我想要 70% 的数据在训练集中,30% 在测试集中。所以我在 weka 中使用StratifiedRemoveFold 过滤器将数据集拆分为 10 个相等的子集。然后我追加 7 个数据集以制作 70% 的训练数据集,并追加其余 3 个数据集以制作 30% 的训练数据集。但是,这不是一个好的选择。我发现,对于 test test 的第一个属性,缺少一个值。就像,我的第一个属性有 7 个值。但是测试集中的第一个属性只有 6 个值。结果,当我在训练集上运行分类器时,出现错误Training set and Test set are incompatible。
我浏览了链接Stratified Sampling in WEKA。我发现if I want to generate a 5% subsample, set the folds to 20. 如果这是策略,那么对于 30% 的测试集,我是否需要设置 numberofFold 的 StratifiedRemoveFold 过滤器 = 120?还有测试集呢?在测试集占整个数据集 70% 的测试集中,我应该设置多少折数?
【问题讨论】:
标签: data-science weka sampling