【发布时间】:2019-05-07 23:04:29
【问题描述】:
在我的数据框中,我有一些包含 100 多个不同类别的分类列。我想按最常见的类别对类别进行排名。我保留前 9 个最常见的类别,而不太常见的类别会自动将它们重命名为:OTHER
例子:
这里是我的 df:
print(df)
Employee_number Jobrol
0 1 Sales Executive
1 2 Research Scientist
2 3 Laboratory Technician
3 4 Sales Executive
4 5 Research Scientist
5 6 Laboratory Technician
6 7 Sales Executive
7 8 Research Scientist
8 9 Laboratory Technician
9 10 Sales Executive
10 11 Research Scientist
11 12 Laboratory Technician
12 13 Sales Executive
13 14 Research Scientist
14 15 Laboratory Technician
15 16 Sales Executive
16 17 Research Scientist
17 18 Research Scientist
18 19 Manager
19 20 Human Resources
20 21 Sales Executive
valCount = df['Jobrol'].value_counts()
valCount
Sales Executive 7
Research Scientist 7
Laboratory Technician 5
Manager 1
Human Resources 1
我保留前 3 个类别,然后将其余类别重命名为“OTHER”,我应该如何继续?
谢谢。
【问题讨论】:
-
我的类别中有一些NaN值,如果我不想重命名它们我应该如何进行过滤?
-
如果我想重命名所有分类
标签: python pandas dataframe counter categorical-data