【发布时间】:2021-12-09 10:02:38
【问题描述】:
我正在尝试删除列中每一行的重复项,与第二列中的对应行进行比较(相同的 df) 例如,如果列 initial_data 包含存在于 additional_data 中的值,则从 initial_data 行中删除该值并使用该数据创建一个新列。
我的 df
initial_data additional_data
HJC, casco helmets integral de moto HJC Helmets
Silverstone Technology Concentrador de Datos SilverStone Technology
Urban Leather UR-52 Chaqueta de Cuero URBAN 5884
预期输出
new_data
casco integral de moto
Concentrador de Datos
Leather UR-52 Chaqueta de Cuero
df = [['HJC, casco helmets integral de moto', 'HJC Helmets'], ['Silverstone Technology Concentrador de Datos ', 'SilverStone Technology'], ['Urban Leather UR-52 Chaqueta de Cuero', 'URBAN 5884']]
df = pd.DataFrame(df, columns = ['initial_data', 'additional_data'])
提一下,我需要保持相同的顺序,相同的大小写,基本上,只是为了删除匹配的单词,而不更改任何其他内容。
非常感谢您分享的任何建议。 我在发布问题之前尝试了多个版本,但没有任何效果(zip、列表等)。
【问题讨论】:
标签: python pandas duplicates rows