【发布时间】:2022-01-20 17:39:34
【问题描述】:
我有一个数据框,其中包含多个 Boruta 变量选择的结果,其中来自不同来源的环境变量作为预测变量。这些预测变量通常来自不同的来源(例如来源 a、b、c),因此有些已使用不同的后缀进行编码,但代表相同的参数(例如,nitrogen_a、nitrogen_b、nitrogen_c、磷酸盐_a、磷酸盐_b 等)。
我需要一种方法来使用类似 grepl() 的方法来识别和分组具有相同名称开头的变量,并将它们折叠成具有共享变量(例如氮、磷酸盐)的单个变量。
注意,对于每一行,具有共享变量名称前缀的集合中只有一个变量包含非 NA 值。因此,应该可以通过简单地排除 NA 值来将多个变量合并为一个。所有变量都是字符向量。
我该怎么办?
【问题讨论】:
-
See here 关于制作一个更易于人们帮助的可重现示例,包括一个可行的数据样本