【问题标题】:Is there something faster than Collections.sort() in Java?有没有比 Java 中的 Collections.sort() 更快的东西?
【发布时间】:2015-08-10 12:48:16
【问题描述】:

我做了一个中值滤波算法,我想优化它。目前过滤 2MM 行大约需要 1 秒(将文件读入 ArrayList elements),我正试图将其减少到更少(可能是一半时间?)嵌套循环也是为了避免增加时间,但是我仍然无法达到低于 0.98 秒的最高值。

这是一个执行中值过滤的代码 sn-p:

//Start Filter Algorithm 2
        int index=0;
        while(index<filterSize){
            tempElements.add(this.elements.get(index+counter)); //Add element to a temporary arraylist
            index+=1;
            if(index==filterSize){
                outputElements.add(tempElements.get((filterSize-1)/2)); //Add median Value to output ArrayList
                tempElements.clear(); //Clear temporary ArrayList
                index = 0; //Reset index
                counter+=1; //Counter increments by 1 to move to start on next element in elements ArrayList                    
            }
            if(elementsSize-counter <filterSize){
                break; //Break if there is not enough elements for the filtering to work
            }
        }

发生的情况是,我正在循环遍历 elements 数组列表以获取我提供的 filterSize。然后我将元素添加到临时(tempElements)数组列表中,使用Collections.sort()(这是我想要避免的)对其进行排序,找到中间值并将其添加到我的最终输出数组列表中。然后我清除 tempElements 数组列表并继续循环,直到由于缺少元素(小于 filterSize)而无法再过滤。

我只是在寻找一种方法来优化它并让它更快。我尝试使用 TreeSet,但无法从中获取索引处的值。

谢谢

【问题讨论】:

    标签: java algorithm performance sorting arraylist


    【解决方案1】:

    Java Collections.sort() 实现在排序(双枢轴快速排序)方面是最快的。

    这里的问题不在于细节,而在于您正在排序!您只需要找到中位数,并且有线性算法(排序是对数线性的)。请参阅selection 以获得一些灵感。您可能需要自己编写代码,因为我认为 java 库没有任何可用的公共实现。

    我建议的另一件事是使用固定大小的数组(创建一次)而不是ArrayList。由于您事先知道过滤器的大小,这会给您带来小的速度提升。

    我也看不出避免 for 循环如何以任何方式提高性能。除非您对其进行分析并证明这是正确的做法,否则我只会编写最易读的代码。

    最后,TreeSet 或任何其他类型的排序数据结构也无济于事,因为 n 次插入的时间复杂度是对数线性的。

    【讨论】:

      【解决方案2】:

      作为 Giovanni Botta 出色答案的替代方案:

      假设您有一个数组[7, 3, 8, 4, 6, 6, 2, 4, 6] 和一个为4 的filterSize。那么我们的第一个临时数组将是[7, 3, 8, 4],我们可以对其进行排序得到[3, 4, 7, 8]。当我们计算下一个临时数组时,我们可以在线性(或更好?)时间内完成,如下所示:

      1. 删除 7
      2. 在排序位置插入 6

      我们可以在初始排序后对所有临时数组重复此操作。如果您花费大量时间对子数组进行排序,这可能不是一个坏方法。诀窍在于它增加了所需的存储空间,因为您需要记住删除条目的顺序,但这应该没什么大不了的(我不认为)。

      【讨论】:

      • 很难说哪个是最优的,这个还是基于选择的。在这种情况下,您在每次迭代的比较和分配之间总共执行 n ;您可以编写选择以仅执行一次分配(通过跟踪要删除的第一个元素,如在循环缓冲区中),然后在比较和分配之间最多执行 n 。我认为这是一个分析和大量测试数据会告诉你哪种算法更快的情况。
      • 我将同时执行两种算法并报告哪个更快。我有一组很好的数据来测试算法。非常感谢您的帮助
      猜你喜欢
      • 2020-10-02
      • 2010-11-24
      • 1970-01-01
      • 2010-10-05
      • 2012-04-15
      • 1970-01-01
      • 2015-07-07
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多