【发布时间】:2014-02-06 00:03:21
【问题描述】:
我想使用 dataframe 框架将我以前的 SAS 代码改编为 Python。
在 SAS 中,我经常使用这种类型的代码(假设列按 group_id 排序,其中 group_id 取值 1 到 10,其中每个 group_id 有多个观察值):
data want;set have;
by group_id;
if first.group_id then c=1; else c=0;
run;
所以这里发生的事情是,我为每个 id 选择第一个观察值,并创建一个新变量 c,它的值为 1 和 0 为其他值。数据集如下所示:
group_id c
1 1
1 0
1 0
2 1
2 0
2 0
3 1
3 0
3 0
如何在 Python 中使用 dataframe 执行此操作?假设我只从group_id 向量开始。
【问题讨论】: