【发布时间】:2016-04-27 05:30:54
【问题描述】:
我是数据分析新手。我正在 python Sklearn 中尝试一些模型。我有一个数据集,其中一些列有文本列。如下所示,
数据集
有没有办法将这些列值转换为 pandas 或 Sklearn 中的数字?为这些值分配数字是对的吗?如果测试数据中弹出一个新字符串怎么办?
请指教。
【问题讨论】:
-
考虑使用 pandas 中的get_dummies 函数。忽略测试数据中遇到的所有新值,您不能使用训练期间未出现的值。
-
我正在考虑使用它。但有些列有许多唯一值(最多 400+)。
标签: python numpy pandas scikit-learn