【发布时间】:2017-03-10 03:44:50
【问题描述】:
我可以将相同的字符串持续编码到同一列吗? Label encoding across multiple columns in scikit-learn 提出了一种处理具有多个分类值的数据框的好方法。但是,我不确定这是否正确地持续存在(在泡菜中)并且是否会再次为新传入的数据应用相同的标签。
到目前为止,我直接使用 pandas 并通过.cat.codes 获取类别值的标签。但是现在我需要将标签编码集成到管道中来处理新的传入数据。
想要什么
le = LabelEncoder()
for col in df.select_dtypes([], ['object'].columns:
df[col] = le.fit_transform(df[col])
或者MultiColumnLabelEncoder 的建议解决方案足以完成我的任务?
【问题讨论】:
标签: python pandas encoding scikit-learn pipeline