【发布时间】:2018-05-04 08:40:57
【问题描述】:
我对在 Python Pandas 中使用特征散列有点迷茫。
我有一个包含多个列的 DataFrame,其中包含许多不同类型的信息。有一列代表数据的一个类。
例子:
col1 col2 colType
1 1 2 'A'
2 1 1 'B'
3 2 4 'C'
我的目标是为 ColType 应用 FeatureHashing,以便能够应用机器学习算法。
我为 colType 创建了一个单独的 DataFrame,如下所示:
colType value
1 'A' 1
2 'B' 2
3 'C' 3
4 'D' 4
然后,对此类数据框应用特征散列。但我不明白如何将特征散列的结果与信息一起添加到我的 DataFrame 中,以便将其用作机器学习算法中的输入。
这就是我使用 FeatureHashing 的方式:
from sklearn.feature_extraction import FeatureHasher
fh = FeatureHasher(n_features=10, input_type='string')
result = fh.fit_transform(categoriesDF)
如何将此 FeatureHasher 结果插入我的 DataFrame?我的方法有多糟糕?有没有更好的方法来实现我正在做的事情?
谢谢!
【问题讨论】:
标签: python pandas scikit-learn data-science