【发布时间】:2018-07-29 02:57:22
【问题描述】:
我正在尝试使用 Python 的 Scikit-learn 将 .csv 文件中的所有文本数据编码为数字。我在数据类型为object 的列上使用LabelEncoder 和OneHotEncoder。我想知道如何将新的编码列与原始数据帧连接起来——在这种情况下是df。我是新手,非常感谢一些帮助。这是我的代码:
"""Encode all columns with type Object using LabelEncoder"""
columnsToEncode=df.select_dtypes(include=[object])
labelEncoder = preprocessing.LabelEncoder()
df_2 = columnsToEncode.apply(labelEncoder.fit_transform)
"""Now encode using OneHotEncoder"""
oneHotEncoder = preprocessing.OneHotEncoder()
df_3=oneHotEncoder.fit_transform(df_2)
【问题讨论】:
-
所以您希望您的数据框拥有实际的文本数据以及编码数据?您想将编码的列/数据与原始数据帧连接/合并的任何特殊原因?
-
@asimo 我想用编码数据替换实际的文本数据列以应用 K-means 聚类
标签: python pandas scikit-learn one-hot-encoding