如果你能原谅我这么说的话,在我看来,大多数答案听起来像是在说“我不知道”,而不是真正承认他们不知道。虽然我普遍同意他们给出的建议,但他们似乎都没有尝试直接解决您提出的问题:盈亏平衡点是什么。
公平地说,当我读到这个问题时,我也不知道。这是我们都知道的基础知识之一:对于足够小的集合,线性搜索可能会更快,而对于足够大的集合,二进制搜索无疑会更快。然而,我从来没有真正有太多的理由去调查什么是盈亏平衡点。然而,你的问题让我很好奇,所以我决定写一些代码来了解一下。
这段代码绝对是一个非常快速破解(很多重复,目前只支持一种类型的密钥等),但至少它可以让你知道会发生什么:
#include <set>
#include <vector>
#include <string>
#include <time.h>
#include <iostream>
#include <algorithm>
int main() {
static const int reps = 100000;
std::vector<int> data_vector;
std::set<int> data_set;
std::vector<int> search_keys;
for (int size=10; size<100; size += 10) {
data_vector.clear();
data_set.clear();
search_keys.clear();
int num_keys = size / 10;
for (int i=0; i<size; i++) {
int key = rand();
if (i % num_keys == 0)
search_keys.push_back(key);
data_set.insert(key);
data_vector.push_back(key);
}
// Search for a few keys that probably aren't present.
for (int i=0; i<10; i++)
search_keys.push_back(rand());
long total_linear =0, total_binary = 0;
clock_t start_linear = clock();
for (int k=0; k<reps; k++) {
for (int j=0; j<search_keys.size(); j++) {
std::vector<int>::iterator pos = std::find(data_vector.begin(), data_vector.end(), search_keys[j]);
if (pos != data_vector.end())
total_linear += *pos;
}
}
clock_t stop_linear = clock();
clock_t start_binary = clock();
for (int k=0; k<reps; k++) {
for (int j=0; j<search_keys.size(); j++) {
std::set<int>::iterator pos = data_set.find(search_keys[j]);
if (pos != data_set.end())
total_binary += *pos;
}
}
clock_t stop_binary = clock();
std::cout << "\nignore: " << total_linear << " ignore also: " << total_binary << "\n";
std::cout << "For size = " << size << "\n";
std::cout << "\tLinear search time = " << stop_linear - start_linear << "\n";
std::cout << "\tBinary search time = " << stop_binary - start_binary << "\n";
}
return 0;
}
这是我在我的机器上运行的结果:
ignore: 669830816 ignore also: 669830816
For size = 10
Linear search time = 37
Binary search time = 45
ignore: 966398112 ignore also: 966398112
For size = 20
Linear search time = 60
Binary search time = 47
ignore: 389263520 ignore also: 389263520
For size = 30
Linear search time = 83
Binary search time = 63
ignore: -1561901888 ignore also: -1561901888
For size = 40
Linear search time = 106
Binary search time = 65
ignore: -1741869184 ignore also: -1741869184
For size = 50
Linear search time = 127
Binary search time = 69
ignore: 1130798112 ignore also: 1130798112
For size = 60
Linear search time = 155
Binary search time = 75
ignore: -1949669184 ignore also: -1949669184
For size = 70
Linear search time = 173
Binary search time = 83
ignore: -1991069184 ignore also: -1991069184
For size = 80
Linear search time = 195
Binary search time = 90
ignore: 1750998112 ignore also: 1750998112
For size = 90
Linear search time = 217
Binary search time = 79
显然,这不是唯一可能的测试(甚至接近最好的测试),但在我看来,即使是一点硬数据也总比没有好。
编辑:我要郑重说明,我认为使用两个向量(或成对向量)的代码不能像使用集合或映射的代码一样干净。显然你想把它的代码放到一个自己的小类中,但我完全看不出它不能精确地向外界呈现与@987654323相同的界面@ 做。事实上,我可能只是称它为“tiny_map”(或按此顺序排列的东西)。
OO 编程的基本点之一(在泛型编程中至少在某种程度上仍然如此)是将接口与实现分离。在这种情况下,您谈论的纯粹是一个完全不需要影响接口的实现细节。事实上,如果我正在编写一个标准库,我很想将其合并为类似于常见的小字符串优化的“小地图优化”。基本上,只需直接在地图对象本身中分配一个由value_type 的 10 个(左右)对象组成的数组,并在/如果地图很小时使用它们,然后将数据移动到一棵树上,只要它长到足以证明它的合理性.唯一真正的问题是人们是否经常使用小地图来证明这项工作的合理性。