【发布时间】:2011-10-23 09:41:43
【问题描述】:
我的任务是根据第 1 列和第 3 列比较 2 个未排序的大型 .csv 文件。
每个文件包含大约 200k 条记录。对于输出,我需要知道基于第 1 列和第 3 列的哪些记录存在于第一个文件中,而不是第二个文件中。这些文件是引用的逗号分隔值文件。第 3 列在比较时需要忽略大小写。
示例文件1:
"id", "name", "email", "country"
"1233", "jake", "jake@mailinator.com", "USA"
"2345", "alison", "Alison@mailinator.com", "Canada"
"3456", "jacob", "jacob@mailinator.com", "USA"
"5678", "natalia", "natalia@mailinator.com", "USA"
文件 2
"id", "name", "email", "country"
"2345", "alison", "alison@mailinator.com", "Canada"
"3456", "jacob", "jacob@mailinator.com", "USA"
"5690", "lina", "lina@mailinator.com", "Canada"
所需的输出文件
"5678", "natalia", "natalia@mailinator.com", "USA"
非常感谢代码示例。
【问题讨论】:
-
到目前为止你做了什么语言和什么,有什么问题?
-
为什么输出中没有出现
"1233", "jake", "jake@mailinator.com", "USA"这一行? -
嗨,马克,我用 HashMaps 尝试了 java,但速度非常慢。
-
brandizzi,你是对的,杰克应该出现