【发布时间】:2020-01-24 12:32:38
【问题描述】:
我有一个分类变量,我想将其转换为分类任务的虚拟变量。问题是某些级别只出现了几次,因此当我将样本拆分为训练集和测试集时,它们会产生完美多重共线性问题。
我怎样才能以一种快速而优雅的方式摆脱这些关卡? 这是我的数据的一个简单示例:
label var_x
1 1
0 2
1 1
0 3
1 2
0 4
0 5
1 5
1 1
....
假设我只想保留出现大于 1(或任何其他数字)的级别 我想将这些情况重新编码为“0”并获得如下内容:
label var_x
1 1
0 2
1 1
0 0
1 2
0 0
0 5
1 5
1 1
....
感谢您的帮助
【问题讨论】:
标签: r dataframe dummy-variable