【发布时间】:2010-09-29 01:33:19
【问题描述】:
有两组 URL,都包含数百万个 URL。现在,如何从 A 获取不在 B 中的 URL。最好的方法是什么?
注意:您可以使用任何技术,使用任何工具,如数据库、mapreduce、hashcode 等。我们应该考虑内存效率,时间效率。您必须考虑每组(A 和 B)都有数百万个 URL。我们应该尝试使用更少的内存和更少的时间找到特定的 URL。
【问题讨论】:
-
在什么意义上最好?内存效率?省时吗?
-
您要查找一个网址还是全部?
-
有几百万个网址?特别是,我们是否可以期望它们都适合记忆?这是您只需要做一次的事情,还是需要重复做一次?
-
我们应该考虑内存效率,时间效率。您必须考虑每组(A 和 B)都有数百万个 URL。我们应该尝试使用更少的内存和更少的时间找到特定的 URL。
标签: algorithm find mapreduce hashcode match