【发布时间】:2020-01-21 03:56:50
【问题描述】:
我有 pandas 代码,我在其中为 one-hot-encoding 执行以下操作。
from sklearn.preprocessing import MultiLabelBinarizer
...
mlb = MultiLabelBinarizer()
df_tmp = pd.DataFrame(mlb.fit_transform(df['CatData']), columns=mlb.classes_, index=df.index)
我的 CatData 列包含类别列表。
为了处理更大的数据集,我正在尝试使用 dask。大多数 pandas 函数都可以直接替换。但是,one-hot-encoding 很棘手,因为事先不知道类别。我正在考虑在整个数据集中逐行扫描该列,将列表中找到的每个类别放入字典中。然后使用这些字典为 one-hot 编码创建列名。有没有办法在 dask 中更稳健地做到这一点?
【问题讨论】:
标签: python dask one-hot-encoding