【发布时间】:2012-05-16 04:01:52
【问题描述】:
我正在使用 Java 读取和处理来自 UCI Machine Learning Repository 的一些数据集。 我开始为每个数据集创建一个类并使用特定的类文件。数据集中的每个属性都由所需类型的类中的相应数据成员表示。这种方法效果很好,直到没有。归因于
问题: 我现在必须处理很多大型数据集。具有> 20-30个属性的那些以这种方式工作非常乏味。我不需要查询。我的数据离散化算法只需要对数据进行 4 次扫描即可对其进行离散化。我的工作在离散化后立即结束。这里有什么有效的策略?
我希望我能够清楚地说明我的问题。
【问题讨论】:
-
一些问题:1)您打算如何使用这些数据?如果你想查询或做类似的事情,可能数据库是你最好的选择。 2)如何从存储库中获取数据?
-
大数据集是什么意思?数据到底有什么问题?你能举个例子吗?
-
我正在测试一种新的数据离散化算法。为此,我需要读取数据并用 Java 处理它
标签: java types large-data-volumes