【发布时间】:2019-10-03 18:08:03
【问题描述】:
我是机器学习和学习回归基本概念的新手。通过放置一个带有目标值的输入样本示例可以很好地解释我的困惑。因此,例如(请注意,我所举的示例是一般情况,我观察了大型自定义图像数据集的性能和预测值。另外,请注意目标值不是浮点数。),我有:
xtrain = [1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12]
ytrain = [10, 10, 10, 20, 20, 20, 30, 30, 30, 40, 40, 40]
和
xtest = [13, 14, 15, 16]
ytest = [25, 25, 35, 35]
您可以注意到,三个(测试集中的两个)样本具有相似的目标值。假设我有一个包含一个 Flatten() 和两个 Dense() 层的多层感知器网络。网络在训练后预测测试样本的目标值都相同:
yPredicted = [40, 40, 40, 40]
由于预测值都相同,ytest 和 yPredicted 之间的相关性返回 null 并给出错误。
但是当我有的时候:
xtrain = [1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12]
ytrain = [332, 433, 456, 675, 234, 879, 242, 634, 789, 432, 897, 982]
还有:
xtest = [13, 14, 15, 16]
ytest = [985, 341, 354, 326]
预测值为:
yPredicted = [987, 345, 435, 232]
这给出了非常好的相关性。
我的问题是,当每个输入具有不同的目标值时,机器学习算法中的什么东西或过程可以使学习更好?当大量输入具有重复值时,为什么网络不起作用?
【问题讨论】:
标签: machine-learning neural-network regression