【发布时间】:2016-05-03 06:22:12
【问题描述】:
我的问题介绍
我有一个数据框,每个人的观察结果不相等,我只想包括相差超过一半的观察结果。
我想选择first每个人的last观察,然后选择半年前最少的下一个观察。
示例 df
ID Date Var1 ... Var12
100 13/02/2012 x x
100 14/09/2012 x x
100 31/01/2013 x x
100 18/12/2012 x x
101 29/04/2012 x x
102 01/11/2012 x x
103 12/08/2012 x x
103 22/08/2013 x x
103 26/09/2013 x x
103 22/01/2014 x x
104 19/01/2012 x x
104 17/02/2014 x x
104 15/03/2014 x x
104 12/05/2015 x x
选择正确的观察结果后,预期的 df 应该是这样的
ID Date Var1 ... Var12
100 13/02/2012 x x
100 14/09/2012 x x
100 18/12/2013 x x
101 29/04/2012 x x
102 01/11/2012 x x
103 12/08/2012 x x
103 22/08/2013 x x
103 22/01/2014 x x
104 19/01/2012 x x
104 17/02/2014 x x
104 12/05/2015 x x
我尝试过的
我试图写一个循环,但我无法处理选择问题。 提前感谢您的任何建议
【问题讨论】:
-
您能否添加语言/图书馆标签,以便跟踪这些标签的人看到您的问题。这是一个 R 数据框或 Python/Pandas 还是 Spark?
-
感谢您的建议!我添加了标签。
-
你的数据有多大(也就是说,效率有多重要)?
-
只有几千个观察结果
-
我不确定
ID=100的输出是否正确。可以验证吗?