【发布时间】:2022-01-07 07:00:30
【问题描述】:
我有如下熊猫数据框,
loc_1 loc_2
[mumbai, gujarat, sri lanka] [chennai, UP]
[Goa, telangana] [Kashmir, Goa, Rajkot]
NaN [Bihar, Orissa]
我想创建一个由上述两列组合而成的新列, 我确实搜索了其他类似的问题,但我面临的问题是,
当我这样做时,
data['locations'] = data['loc_1'] + data['loc_2']
Output
--------
loc_1 loc_2 locations
[mumbai, gujarat, sri lanka] [chennai, UP] [mumbai, gujarat, sri lanka,chennai, UP]
[Goa, telangana] [Kashmir, Goa, Rajkot] [Goa, telangana,Kashmir, Goa, Rajkot]
NaN [Bihar, Orissa] NaN
问题
正如您在上面看到的,存在重复值以及形成的 NaN 值。 如何避免它们?
记住
原始数据集包含 list、str 和 NaN 格式的值。
数据集:
loc = pd.DataFrame({
'loc_1': [['mumbai', 'gujarat', 'sri lanka'],['Goa', 'telangana'],np.nan],
'loc_2':[['chennai','UP'],['kashmir','goa','rajkot'],['bihar','orissa']],
'loc_3':['Chennai','Bangalore','Vizag']
})
【问题讨论】:
标签: python pandas list dataframe