【发布时间】:2015-10-09 08:08:51
【问题描述】:
我正在尝试自定义匹配 2 个数据框(我认为与连接不同)。我想从 df1 和 df2 得到 df3。这是示例代码--
df1=data.frame(c1=c(1,1),c2=c(1,0),c3=c(0,0),c4=c(0,1))
> df1
c1 c2 c3 c4
1 1 1 0 0
2 1 0 0 1
> df2=data.frame(c2=c(6,8),c3=c(4,5),c5=c(1,2))
> df2
c2 c3 c5
1 6 4 1
2 8 5 2
> df3=data.frame(c1=c(NA,NA),c2=c(6,8),c3=c(4,5),c4=c(NA,NA))
> df3
c1 c2 c3 c4
1 NA 6 4 NA
2 NA 8 5 NA
任何帮助表示赞赏!
【问题讨论】:
-
为什么列名匹配时只选择第二组?关于如何到达
df3的一些解释会很好。 -
也许
merge(df1, df2, all.y = TRUE)? -
@RichardScriven - 对不起,如果我不清楚。我基本上想把 df2 放在 df1 格式。 df1 是我的模型训练集,df2 是我的测试集。我想在 df2 上使用 predict() 但列的顺序和数量应该相同..
-
这听起来像 RandomForest。如果是这样,您应该将较大的数据集子集到训练和测试集中,因为模型中的偶数列必须是一致的。