【发布时间】:2020-10-23 09:29:07
【问题描述】:
我想在 Linux 上使用特定变量“SAMPLE”下的值从 .csv 文件(名为“mydata”)中删除特定行。实际上,我的文件中有 250 个重复项,原始文件有 15000 行和 66 列,我想删除每个重复项的一份副本并保留一份。如果您查看其他变量,例如“ID”,您会看到重复项。因此,如果我可以根据“SAMPLE”列中的值删除重复项或特定行,任何解决方案都对我有用。 SAMPLE 是我的数据中唯一重复名称不同的列。我的数据是这样的;
ID SAMPLE LABNO Oth_ID sex age bmi ca_1 pd_7
1003341 21863 21863 NA 1 48.68 22.42 0 0
1003343 22697 22697 NA 1 48.98 23.25 0 0
1003347 4421 4421 NA 1 48.70 25.56 NA NA
1003348 1642 1642 NA 1 48.72 16.57 NA NA
1003349 4163 4163 6069 1 49.02 23.47 1 NA
1003349 6069 4163 6069 1 49.02 23.47 1 NA
1003356 5347 9053 5347 1 49.08 24.81 0 0
1003356 9053 9053 5347 1 49.08 24.81 0 0
1003357 695 695 NA 1 49.08 22.32 NA NA
1003360 19833 19833 NA 1 48.55 22.48 0 0
1003365 5392 6843 5392 1 48.70 23.08 0 0
1003365 6843 6843 5392 1 48.70 23.08 0 0
【问题讨论】:
标签: csv duplicates rows