【发布时间】:2012-03-02 05:11:30
【问题描述】:
我的文件非常大,大约有 1500 万个条目。 文件中的每一行都包含一个字符串(称为键)。
我需要使用 java.xml 查找文件中的重复条目。 我尝试使用哈希图并检测重复条目。 显然这种方法给我一个“java.lang.OutOfMemoryError: Java heap space”错误。
我该如何解决这个问题?
我想我可以增加堆空间并尝试一下,但我想知道是否有更有效的解决方案而无需调整堆空间。
【问题讨论】:
-
Offtopic:你最初是如何获得 1500 万个条目的?
-
最好的工作方式是不要重复。不需要删除重复项。
-
@Martijn Courteaux:你不知道这是什么数据。例如,如果您有一本书,并且想知道书中使用了哪些单词,那么首先没有办法避免像
the这样的重复。 -
@Martijn Courteaux - 你在哪里工作?您是否总是要求系统的所有输入都采用使您的生活更轻松的格式?我想在那里工作!
-
@Martijn Courteaux - 啊,所以你还年轻和乐观:) 问题不只是“菜鸟”。现实世界是混乱的。我们的部分工作是克服混乱并产生有用的东西。想象一下,如果 Google 只索引具有正确拼写的英语单词和完美语法的网页。或者,如果福特制造的汽车只能在阳光明媚的天气下在全新的道路上行驶。