【发布时间】:2013-03-29 21:15:59
【问题描述】:
您好,我有一个大数据集,其中包含字符串和数值 例如。
用户名(str),手机(str),请求数(int),下载次数(int),.......
我有大约 200 个这样的专栏。
有没有一种方法/算法可以在特征选择期间同时处理字符串和整数? 或者我应该如何处理这个问题。
谢谢
【问题讨论】:
-
你的问题太宽泛了。你试过什么?您需要如何处理这些数据?
-
这是一个特定于包的问题吗?
-
不是一个特定于包的问题,但是很高兴知道在这种情况下哪些包有帮助。我有一个如上所述的数据,每一列都是整数和字符串类型的特征(总共 200 个特征)。我想了解所有功能对“下载(布尔 0/1)”的贡献。所以我只想选择那些影响“下载”的功能。我猜大多数特征选择算法只接受实数作为输入。
标签: python machine-learning weka rapidminer feature-selection