【问题标题】:Which stl container should I use when doing few inserts?进行少量插入时应该使用哪个 stl 容器?
【发布时间】:2012-03-04 01:47:18
【问题描述】:

我不知道我的确切数字,但我会尽力而为。我有一开始就填充了 10000 个元素的双端队列。比我扫描每个元素并让每 20 个元素我需要插入一个新元素。插入将发生在当前位置,也可能发生在一个元素后面。

我并不完全需要记住位置,但我也不完全需要随机访问。我想要快速插入。 deque 和 vector 是否需要为插入付出沉重的代价?我应该使用列表吗?

我的另一个选择是有一个第二个双端队列列表,当我遍历每个元素时,将其插入另一个双端队列列表,除非我需要执行我正在谈论的插入。这确实需要快速,因为它是一个性能密集型应用程序。但是我使用了很多指针(每个元素都是一个指针),这让我很沮丧,但没有办法解决这个问题,所以我应该假设 L1 缓存总是会丢失?

【问题讨论】:

    标签: c++ performance stl containers insertion


    【解决方案1】:

    首先,所有性能问题的答案都是“基准测试”。总是。现在...

    如果您不关心内存开销,并且您不需要随机访问,但您确实关心常量时间插入,list 可能适合您。

    std::vector 有足够的容量时会在末尾进行恒定时间插入。当超过容量时,它需要一个线性时间的副本。 deque 更好,因为它链接离散分配,避免完整复制并让您在前面进行恒定时间插入。随机插入(每 20 个元素)总是线性时间。

    至于缓存局部性,vector 尽可能好(连续内存),但您说您关心插入而不是查找;根据我的经验,在这种情况下,您并不关心在扫描转储时缓存有多热,因此list 的不良行为并不重要。

    【讨论】:

    • 我不同意你的看法。如果我们谈到在随机位置的插入,向量总是线性的。当您在容器末端插入时,向量始终在摊销速度上保持不变。在这种情况下,Vector 的表现将非常出色。
    • @BorisStrandjev 我清楚地限制了我的陈述-当您将reserve 调用为大于向量大小的容量时,最后的下一次插入将是常数时间。这是 C++ 标准的一部分。而“摊销常数”并不意味着特定的插入是常数时间——这就是我所说的。
    • 你认为列表比我在经历时构建的第二个容器(可能是向量)更好吗?
    • @Borealid - 是的,我错过了结尾这句话。也许是因为它很大胆:P?但是,我认为在这种情况下,我们更担心的是一系列操作的摊销速度,而不是单个操作。此外,我看不出有人会在这种情况下调用 reserve 的原因,因为容器的默认行为已经使我们达到了相同的时间复杂度,而且没有人必须首先考虑要保留多少元素(更不用说如何当储备用完时还有更多)。
    • 关于deque的评论有误。当容量已满时,它只是另一个被分配的“页面”,不需要复制之前的元素。 deque 基本上是一个指针数组,指向固定数量的元素所在的页面。
    【解决方案2】:

    当您经常想在集合中间插入元素或经常删除它们时,列表很有用。但是,列表读起来很慢。

    当您只想在集合末尾添加或删除元素时,向量的读取速度非常快并且非常快,但是当您在中间插入元素时它们非常慢。这是因为它必须将所需位置之后的所有元素移动一个位置,以便为新元素腾出空间。

    Deques 基本上是可以用作向量的双向链表。

    如果你不需要在集合中间插入元素(你不关心顺序),我建议你使用vector。如果您可以从一开始就可以估计将在向量中引入的元素的数量,您还应该使用std::vector::reserve 从一开始就分配必要的内存。您传递给reserve 的值不需要精确,只需近似值即可;如果它比需要的小,向量将在必要时自动调整大小。

    【讨论】:

      【解决方案3】:

      在这种情况下,我会从 std::vector 开始,但是使用第二个 std::vector 来表示你的大规模突变,reserve() 适当地,然后是 swap() 向量。

      更新

      一般形式如下:

      std:vector<t_object*> source; // << source already holds 10000 elements
      
      std:vector<t_object*> tmp;
      
      // to minimize reallocations and frees to 1 and 1, if possible.
      // if you do not swap or have to grow more, reserving can really work against you.
      tmp.reserve(aMeaningfulReserveValue);
      
      while (performingMassMutation) {
        // "i scan through each element and lets every 20 elements"
        for (twentyElements)
          tmp.push_back(source[readPos++]);
      
        // "every 20 elements i'll need to insert an new element"
        tmp.push_back(newElement);
      }
      
      // approximately 500 iterations later…
      
      source.swap(tmp);
      

      Borealid 提出了一个很好的观点,即 measure -- 执行因您的 std 库实现、数据大小、复制的复杂性等而异。

      对于具有 my 配置的这种大小的集合的原始指针,上面的 vector 质量突变和 push_backstd::list 插入快 7 倍。 push_backvector 的范围插入要快。

      正如 Emile 在下面指出的那样,std::vector::swap() 不需要移动或重新分配元素——它可以只交换内部(只要分配器的类型相同)。

      【讨论】:

      • 嗯,交换而不是复制。好主意。它们都是某种类型的指针,因此交换要么无关紧要,要么更慢(从清零另一个条目)。但如果它不是指针,我不会想到交换。很好的答案。
      • @acidzombie24: vector::swap 是常数时间。向量之间只交换两个或三个指针,即使它们每个都有数百万个元素。这些指针类似于m_startm_endm_storage_endvector::swap 会非常快,即使您在向量中按值存储大量对象。
      • 如果您的算法有多次通过,您可以继续以 ping-pong 方式使用相同的两个向量。
      • 感谢您的 ping。哦,我明白了。
      • @acidzombie24 不客气。在我的好奇心战胜了我并进行了一些测试之后,我再次更新了 =) 享受!
      【解决方案4】:

      您可以采用两种方式:列表始终是随机插入位置的一个选项,但是当您分别分配每个元素时,这也会导致一些性能影响。在双端队列中就地插入的另一种选择也不好 - 因为您将为每次插入支付线性时间。也许你在新的双端队列中插入的想法是最好的——你支付两倍的内存,但另一方面,你总是在第二个双端队列的末尾或之前的一个元素中插入——这一切都给出了恒定的摊销时间,并且您仍然可以很好地缓存容器。

      【讨论】:

        【解决方案5】:

        如果您需要在中间快速插入,但不关心随机访问,vectordeque 绝对不适合您:对于那些,每次插入内容时,全部 必须移动那个和结尾之间的元素。在内置容器中,list 几乎可以肯定是您最好的选择。但是,对于您的方案,更好的数据结构可能是 VList,因为它提供了更好的缓存局部性,但 C++ 标准库没有提供。 Wikipedia 页面链接到 C++ 实现,但是从界面的快速查看来看,它似乎并不完全兼容 STL;我不知道这对你来说是不是一个问题。

        当然,最终确定哪个是最佳解决方案的唯一方法是衡量性能。

        【讨论】:

          【解决方案6】:

          std::vector/deque ::insert 等完成的复制数量与插入位置和容器末尾之间的元素数量(需要移动以腾出空间的元素数量)成正比。 std::vector 的最坏情况是 O(N) - 当您插入容器的前面时。如果您要插入 M 元素,那么最坏的情况就是 O(M*N) 这不是很好。

          如果超出容器容量,还可能涉及重新分配。您可以通过确保在前面有足够的空间来防止重新分配::reserve'd。

          您的另一个建议 - 复制到第二个 std::vector/deque 容器可能会更好,因为它总是可以组织以实现 O(N) 复杂性,但代价是临时存储两个容器。

          使用std::list 可以让您实现就地O(1) 插入,但代价是额外的内存开销(存储列表指针等)和减少的内存局部性(不连续分配列表节点)。您可以通过使用池化内存分配器来改善内存局部性(也许是 Boost pools?)。

          总体而言,您必须进行基准测试才能真正找出“最快”的方法。

          希望这会有所帮助。

          【讨论】:

          • 有趣的是人们说我会支付两个容器的费用,但我不知道 list&lt;void*&gt; 是否与 2 vector&lt;void*&gt; 一样大。
          • @acidzombie24:嗯,我希望大多数列表实现包含每个节点的两个指针 + 实际数据,因此粗略估计内存使用量为:2 个向量 = 2 * N * sizeof(data_type)。 1 个列表为:N * sizeof(data_type) + 2 * N * sizeof(void *)。如果您的 data_type 的大小很小(我认为您说它只是一个指针),则列表可以使用更多内存...
          猜你喜欢
          • 2012-11-23
          • 2018-12-03
          • 2010-11-18
          • 1970-01-01
          • 2010-12-06
          • 2012-05-20
          • 1970-01-01
          • 1970-01-01
          • 2011-12-17
          相关资源
          最近更新 更多