【发布时间】:2013-12-14 22:03:15
【问题描述】:
我有一个包含 250,000 个实例的训练集,这对于 Weka 分类器来说太大而无法处理(虽然数据加载到 Weka UI 中很好,但任何运行非平凡分类器的尝试都会导致内存不足,即使机器的整个 8GB RAM 专用于 JVM 堆)。
因为这涉及地理数据,如果我在纬度/经度上进行聚类并在每个聚类上训练单独的分类器,它应该会表现得很好。
有没有办法在 Weka 命令行或 KnowledgeFlow 上轻松完成此操作,而不必弄乱 ARFF 文件? (我更喜欢保留一个大的 ARFF 文件,以便可以在 Weka 中评估不同的拆分策略)
我研究了 Bagging 和 Cross-Fold Validation,但我认为它们不适合我的问题,因为我不希望数据随机拆分,而是根据位置的相似性保持在一起。
【问题讨论】:
-
100k 行,5 列,给 WEKA 80GB(不是 8、80),但这还不够。我感觉到你的痛苦。
标签: machine-learning weka