【发布时间】:2021-09-29 22:48:52
【问题描述】:
我正在研究车辆占用率预测,我对此非常陌生,我使用随机森林回归来预测占用率值。
Jupyter notebook_Random forest
我有大约 4800 万行,我已经使用所有数据来预测入住率,因为人口和入住率由于更高的数字而被标准化,我已经预测。我确定模型不好,我如何解释 RMSE 和 MAE 的结果。此外,该图表明它没有很好地预测,我是否以正确的方式预测车辆的占用率。
请帮我解决以下问题,
- 随机森林回归是解决这个问题的好方法吗?
- 如何改进模型结果?
- 如何解释结果中的结果
【问题讨论】:
-
@JamesZ,对不起,我已经更新了链接。请看一看。
-
使用基于树的模型对列应用规范化不会影响结果。
-
如果我是你,我会做一个更好的流程,我们可以测试不同的预处理和使用 GridSearchCV 的模型来找到最佳超参数。首先删除具有唯一行的所有列。对地理位置数据进行特征工程。使用基于树的模型时,不要规范化您的数据。否则为数据预处理创建一个管道。
-
@PraysonW.Daniel,感谢您的解释。请您向我解释一下有关地理定位数据的特征工程的更多信息,可以做些什么来在模型中使用它??
-
通过地理定位,您可以找到锚点位置。在一个预测房价的项目中,我选择了位置(例如医院、学校、主要车站,然后我计算了到这些位置的短距离。因此,富裕地区的房屋被组合在一起,因为它们与锚点位置的距离相似。
标签: python machine-learning random-forest prediction