【发布时间】:2018-04-16 02:54:15
【问题描述】:
我有一个包含 200 多个数值变量(类型:int)的数据集。在这些变量中,有一些是具有 (0,1)、(0,1,2,3,4) 等值的分类变量。
我需要识别这些分类变量并将它们虚拟化。 识别和虚拟化它们需要大量时间 - 有什么方法可以轻松完成?
【问题讨论】:
-
这取决于非分类变量的外观。如果它们都是 int,您使用什么标准来识别分类变量?您还尝试过什么?
-
没有通用的方法,因为您可能比任何算法都更了解这些特性。但是您可以从计算每个功能的不同实现的数量开始。
标签: python-3.x machine-learning data-science data-cleaning