【发布时间】:2020-02-11 11:10:06
【问题描述】:
我有一个相当大的数据集(> 100k 行),其中包含物流运输的信息。 (出口货物)
数据集如下所示:
|shipper|consignee |origin|destination |
|-------|-----------------------------|------|---------------------------------------------|
|6409292|288882 |USSFO |CNPVG |
|6409292|288882 |USSFO |CNPVG |
|6409292|182724 |USSFO |HKHKG |
|6409292|182724 |USSFO |HKHKG |
|8201922|948292 |USSFO |FRCDG |
|8201922|948292 |USSFO |FRCDG |
|8201922|948292 |USSFO |FRNIC |
|8201922|291222 |USEWR |AEDXB |
所以我们这里有一份过去发货的清单。它显示了托运人和收货人之间的关系,以及货物的发运地和发运地。
根据过去的数据,我希望能够通过查看consignee code 和origin 来预测何时添加新货件。
示例
以以下新预订为例:
|shipper|consignee |origin|destination |
|-------|-----------------------------|------|---------------------------------------------|
|1234567|948292 |USMOB |? |
如何训练模型来预测 destination? ML 中的这个领域是指什么?
【问题讨论】:
-
这是一个单类分类问题。您可以使用 sklearn 或 XGBoost 库对其进行训练,将目标设置为可预测的特征(通常在 sklearn 中为“y”)。此外,您必须确保该算法将收货人作为分类变量而不是数字。但是,如果您只有这 3 个变量和如此少量的数据,我不会期望得到很好的结果
-
@JavierLópezTomás 谢谢!我最终有更多的列,我将考虑这些列和更多的行(> 100k 正在增长)。对于如何开始使用 XGBoost 或 sklearn 训练模型,您有什么建议吗?
-
@oliverbj 这是一个简单的用例。我感觉 Extra Tree 分类器算法适用于您的情况。您可以在此处找到有关 Extra Tree 分类器算法的所有详细信息:scikit-learn.org/stable/modules/generated/… 和 towardsdatascience.com/…。但请记住,您必须进行一些数据预处理。
标签: python machine-learning prediction