【发布时间】:2015-06-06 08:51:52
【问题描述】:
我有一个包含 2000 万条记录的文件。它有 30% 的重复值。 我们考虑实施两种方法。
- 编写 shell 脚本删除重复文件,文件将上传到 unix box。
- 在 sybase 中使用 ignore_dup_key 和 BCP 将文件按原样创建到表中。以便表格消除重复项。
我已经阅读过,当重复百分比增加时,ignore_dup_key 会影响性能。 Unix - uniq 方法的性能如何?哪一个适用于此?
欢迎输入!
【问题讨论】:
-
我会选择选项 2。不想重新发明轮子。由于您要在表上创建索引,因此请务必使用
-B提及事务的批量大小。