【发布时间】:2017-12-22 08:09:43
【问题描述】:
对于这个问题的标题不可靠,我深表歉意。但是我在解决 R 中的这个争论问题时遇到了麻烦。这是数据的 sn-p 的样子:
example
# A tibble: 6 x 6
# Groups: id, rel [4]
id rel post_w avg_w b_wages a_wages
<int> <date> <lgl> <dbl> <dbl> <dbl>
1 2699 2005-12-05 FALSE 904.5028 904.5028 NA
2 2739 2008-02-12 FALSE 1220.8129 1220.8129 NA
3 2739 2008-02-12 TRUE 2544.8736 NA 2544.874
4 2757 2008-02-06 TRUE 2624.3018 NA 2624.302
5 3240 2005-03-30 FALSE 18718.6454 18718.6454 NA
6 3240 2005-03-30 TRUE 15206.3203 NA 15206.320
对于我的分析,变量 id 和 rel 一起创建了一个唯一标识符。我试图让每个唯一的 id、rel 组合成为一行,其中包含 avg_w、b_wages 和 a_wages 的值。例如,在上面列出的数据中,id 2739 和 rel 2008-02-12 有两个条目,即使它们是我分析的相同观察值。在一行中,观察有 b_wages 的数据,而在另一行中,它有 a_wages 的数据。我正在尝试做的是折叠这些观察结果,使其看起来像这样
id rel post_w avg_w b_wages a_wages
<int> <date> <lgl> <dbl> <dbl> <dbl>
2 2739 2008-02-12 (dropped) (dropped) 1220.8129 2544.874
post_w 和 avg_w 列没有意义,如有必要,我可以删除它们。但我想弄清楚的是如何折叠具有相同 id 的行,rel 到一行并将 b_wages 和 a_wages 值合并在一起,替换 NA 值,如图所示。
【问题讨论】:
标签: r join dataframe merge dplyr