【问题标题】:Artificially increasing the size of a dataset through duplication?通过复制人为地增加数据集的大小?
【发布时间】:2020-09-17 16:52:51
【问题描述】:

我正在从事一个机器学习项目,我正在使用神经网络来解决二进制分类问题,但是,我的数据集(.csv 格式)相对较小。它只有大约 60 个是/否案例,虽然它能够训练,但准确性不是很好。我的解决方案只是复制数据集并在每次复制时对数字进行微小的更改,即为每个数字添加 +-1 或乘以 0.999。通过这样做,我将数据集的大小增加到大约 1100 个新案例,并实现了更高水平的准确度。我想知道这是否是 ML 研究人员使用的实际技术,如果是,它是否有实际的官方/学术名称?

谢谢!

【问题讨论】:

    标签: machine-learning neural-network dataset conv-neural-network data-science


    【解决方案1】:

    是的,您所指的过程称为数据增强。

    但是,我强烈建议您不要在只有数百到数千行的数据集上使用神经网络。理想情况下,神经网络用于在大型数据集上训练模型。

    【讨论】:

    • 多年来,使用几百行的神经网络是常见的做法。实际上,作为神经网络的逻辑回归可以用一百个例子进行训练
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-11-02
    • 2018-03-07
    • 1970-01-01
    • 1970-01-01
    • 2019-04-04
    • 2018-05-10
    相关资源
    最近更新 更多