【问题标题】:Artificially increasing training data for regression by Random Forest and Neural Networks通过随机森林和神经网络人工增加回归训练数据
【发布时间】:2018-01-11 04:00:58
【问题描述】:

我们正在尝试根据它们的属性值来预测销售数量。我们有大约 8000 条数据记录用于训练。通过为相同的 8000 条记录添加销售数量的小变化来增加训练数据是否正确? 我想为这 8000 条记录准备 24000(3*8000) 条销售量 + 或 - 0.1 条记录的新训练集

例如:像原始数据 sales quantity=2 那么新数据对于同一商品将有 2,2.1 和 1.9。

【问题讨论】:

  • 这是一个方法问题,最好发布在 crossValidated 或 datascience.stackexchange.com 上。我建议您从此处删除问题并在其中一个网站上提问。
  • 这个问题更适合在 DataScience 或 CrossValidated 堆栈中提出,因为它更多的是关于概念计算而不是代码。话虽如此,如果我对您的理解正确,您是在问是否应该稍微改变预测变量并创建更多数据以尝试构建更强大的预测变量。我的答案是否定的!您将基于噪声进行训练,这不会建立更好的模型。从您当前的数据中引导是一种更好的方法,它是随机森林抽样方法的基础。

标签: r machine-learning neural-network regression random-forest


【解决方案1】:

变化的有用性取决于属性的标量。例如,如果您的特征范围是 (0-100),则添加 +/- 0.1 是没有用的。如果是(0

我认为更好的方法是标准化您的数据 (http://scikit-learn.org/stable/modules/generated/sklearn.preprocessing.normalize.html),然后添加变体。

如果您有分类数据,可以根据需要将它们转换为虚拟变量 (https://pandas.pydata.org/pandas-docs/stable/generated/pandas.get_dummies.html)。

【讨论】:

    【解决方案2】:

    坏主意!因为直觉上它并没有真正的帮助。它可能会不必要地过度拟合随机森林或 NN 模型。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2013-04-27
      • 1970-01-01
      • 2018-12-06
      • 1970-01-01
      • 2017-01-22
      • 2021-03-21
      • 2020-04-04
      • 2021-12-12
      相关资源
      最近更新 更多