【发布时间】:2021-10-19 17:03:36
【问题描述】:
我有一个包含 3 列的文件,年份:“HRYEAR4”,月份:“HRMONTH”,当时的就业状况:“PEMPLR_1”。就业状态是一个虚拟变量,如果就业则为 1,否则为 0。
我想计算某年某月内受雇的个人百分比。
我有 jan 的数据。 2018 年 - 4 月数据框df_CPS中的2020:
HRMONTH HRYEAR4 PEMLR_1
0 1 2018 1
1 1 2018 1
2 1 2018 1
3 1 2018 0
4 1 2018 0
... ... ... ...
1498116 4 2020 1
1498117 4 2020 1
1498118 4 2020 0
1498119 4 2020 1
1498120 4 2020 1
我可以得到按年和月分组的就业人数以及按年和月分组的数据集中的总人数:
# Individuals who have answered PEMLR = 1 (employed) in a given month, year
df_CPS.groupby(['HRYEAR4', 'HRMONTH']).agg({'PEMLR_1': 'sum'})
# Individuals in total in a given month, year
df_CPS.groupby(['HRYEAR4', 'HRMONTH']).size()
但是,我如何计算按月和年分组的就业人数百分比? 并将其添加到原始数据集中?
我想结束:
HRMONTH HRYEAR4 PEMLR_1 PEMLR_PCT
0 1 2018 1 90.1
1 1 2018 1 90.1
2 1 2018 1 90.1
3 1 2018 0 90.1
4 1 2018 0 90.1
... ... ... ... ...
1498116 4 2020 1 73.8
1498117 4 2020 1 73.8
1498118 4 2020 0 73.8
1498119 4 2020 1 73.8
1498120 4 2020 1 73.8
【问题讨论】: