【发布时间】:2022-10-31 11:17:22
【问题描述】:
我有一个我想对标记数据进行完整性检查的情况。我有数百个特征,想找到具有相同特征但标签不同的点。然后应该对这些发现的不一致标签簇进行编号并放入新的数据框中。 这并不难,但我想知道最优雅的解决方案是什么。 这里有一个例子:
import pandas as pd
df = pd.DataFrame({
"feature_1" : [0,0,0,4,4,2],
"feature_2" : [0,5,5,1,1,3],
"label" : ["A","A","B","B","D","A"]
})
result_df = pd.DataFrame({
"cluster_index" : [0,0,1,1],
"feature_1" : [0,0,4,4],
"feature_2" : [5,5,1,1],
"label" : ["A","B","B","D"]
})
【问题讨论】:
标签: pandas