【发布时间】:2022-01-09 06:29:35
【问题描述】:
我有一个从 json 文件导入的 DataFrame。 json 文件中的部分数据包括某些字符串/分类属性的替代拼写,从而导致具有相似名称的列中的值填充在一个、另一个或两者中。我希望能够将具有替代拼写的列组合成一个列。理想情况下,我会去源代码,json文件,并修复它。在这种情况下我无法更改源,我只能使用它。
理想情况下,循环不会发生这种情况,因为对于真正的 DataFrame 有很多数据,这太慢了。
是条件
df_is = pd.DataFrame({"C1": [1, 2, 3, 4, 5, 6, 7, 8, 9, 10],
"C2": ["a", "b", "c", "d", "e", "f", "g", "h", "i", "j"],
"C3": ["A", "B", "C", "D", "E", "F", "G", "H", "I", "J"],
"C4": ["S", np.NaN, "F", np.NaN, np.NaN, "S", "F", np.NaN, np.NaN, np.NaN],
"c4": [np.NaN, "S", np.NaN, np.NaN, "S", np.NaN, np.NaN, np.NaN, np.NaN, "F"]})
display(df_is)
C1 C2 C3 C4 c4
0 1 a A S NaN
1 2 b B NaN S
2 3 c C F NaN
3 4 d D NaN NaN
4 5 e E NaN S
5 6 f F S NaN
6 7 g G F NaN
7 8 h H NaN NaN
8 9 i I NaN NaN
9 10 j J NaN F
应该是条件
C1 C2 C3 C4
0 1 a A S
1 2 b B S
2 3 c C F
3 4 d D NaN
4 5 e E S
5 6 f F S
6 7 g G F
7 8 h H NaN
8 9 i I NaN
9 10 j J F
【问题讨论】:
标签: python pandas dataframe jupyter-notebook