【发布时间】:2019-01-27 07:24:57
【问题描述】:
在生产层面,我想使用预先保存的模型来预测我的实时数据。
但是,在分解分类数据时,我不知道如何设置我的实时数据以与训练数据保持一致的映射。
From this article我知道我可以将训练数据和新数据叠加在一起并保持一致。
但是,堆叠和遍历整个过程(进行整个特征工程、训练和预测)太耗时了。
- 整个过程:15 分钟 v.s. 仅 model.prediction:3 秒
由于生产级系统对时间敏感,我可以使用任何方法将新数据分解为与训练数据具有相同的映射?
或者我只能通过«手动»来完成,例如
df.loc[df['col_name']=='YES', 'col_name'] = '1'
这会导致很长的编码?
【问题讨论】:
-
我找到了 pd.factorize 的替代工具 LabelEncoder。如果可能的话,让我试着报告一下效果。
标签: python pandas machine-learning