【发布时间】:2018-01-11 04:00:58
【问题描述】:
我们正在尝试根据它们的属性值来预测销售数量。我们有大约 8000 条数据记录用于训练。通过为相同的 8000 条记录添加销售数量的小变化来增加训练数据是否正确? 我想为这 8000 条记录准备 24000(3*8000) 条销售量 + 或 - 0.1 条记录的新训练集
例如:像原始数据 sales quantity=2 那么新数据对于同一商品将有 2,2.1 和 1.9。
【问题讨论】:
-
这是一个方法问题,最好发布在 crossValidated 或 datascience.stackexchange.com 上。我建议您从此处删除问题并在其中一个网站上提问。
-
这个问题更适合在 DataScience 或 CrossValidated 堆栈中提出,因为它更多的是关于概念计算而不是代码。话虽如此,如果我对您的理解正确,您是在问是否应该稍微改变预测变量并创建更多数据以尝试构建更强大的预测变量。我的答案是否定的!您将基于噪声进行训练,这不会建立更好的模型。从您当前的数据中引导是一种更好的方法,它是随机森林抽样方法的基础。
标签: r machine-learning neural-network regression random-forest