【发布时间】:2020-01-01 11:18:27
【问题描述】:
我正在尝试在 sci-kit 学习模型中使用高基数特征 (siteid),并正在使用 get_dummies 对该特征进行一次性编码。我得到了大约 800 个新的二进制列,它们使用逻辑回归返回了不错的准确性。我的问题是,当我通过我的模型传递一个新数据集时,我在这个特性上有一个不同的基数,比如 300 个唯一值,并且模型正确地问,你训练我的其他 500 列在哪里?我该如何解决这个问题?
我不想在每次基数变化时都训练模型,也不想在我的 SQL 数据加载中对这些列进行硬编码。
cat_columns = ["siteid"]
df = pd.get_dummies(df, prefix_sep="__",
columns=cat_columns)
【问题讨论】:
标签: python pandas machine-learning scikit-learn cardinality