【发布时间】:2018-07-03 08:06:43
【问题描述】:
希望这不会在标题上被否决,但想不出更好的方法来解释这个问题。
根据我在 Stack 上看到的建议,我正在使用 Sets 来忽略重复的行,这很有效,直到我得到一个用例,其中行略有变化,但我仍然想将该行作为重复项过滤掉。在我的示例中,我似乎无法在字符串中搜索某个关键字,因此在下面的示例中,我排除了任何新行,其中第一列(即 ID)已经存在,在本例中为伦敦。
例如。
London,Sold,2021-12-07,1000000,301909
London,Sold,2021-12-07,1000000,999999
所以我想知道是否可以在添加或忽略之前检查 ID London 是否存在于我的 Set 中,但我找不到任何方法来做到这一点。我尝试了元组,但不确定这是我的解决方案,我无法从列表中创建一个集合。我的简单测试用例如下,最终结果是我只得到了我的集合中的行,而不是现在发生的测试行。
testline = 'London,Sold,2021-12-07,1000000,301909'
id = 'London'
j="testline2"
seen = set()
seen.add(testline)
if id not in seen:
seen.add(j)
print seen
【问题讨论】:
-
如果你发现这样一个近乎重复的东西,你想保留第一个还是第二个遇到的项目?
-
保留第一次出现
标签: python string list duplicates set