【发布时间】:2020-09-24 15:35:38
【问题描述】:
我需要一种有效的方法来消除存储在文本文件中的重复整数 np 数组。情况如下:
在文件夹 C:\z_data\6_8_arrays 中,有几千个小文本文件,每个文件包含一个相同形状的数组(在本例中为 6 行 8 列)。文本文件的格式如下:
0 4 5 7 3 4 6 2
8 6 0 9 9 1 2 4
6 6 7 4 5 6 3 1
3 1 3 2 3 3 5 3
4 1 2 0 9 6 0 0
9 9 8 2 4 1 0 1
虽然许多文本数组是独一无二的,但也存在大量重复。有些数组甚至可能以相同的副本出现 25 到 30 次。
问题:有没有一种有效的方法来删除包含重复数组的文本文件 (.txt)?
我想第一步将涉及将文件夹中的所有文本数组加载到 (6,8,n) numpy 数组中,然后消除重复项。不过,最大的挑战是我实际上需要从文件夹中删除重复的文本文件。 如果一个给定的数组在例如 10 个文件中出现相同的情况,我需要消除其中的 9 个。保留 10 个文件中的哪一个并不重要。
【问题讨论】: