【发布时间】:2019-06-01 12:32:13
【问题描述】:
我是机器学习的初学者,我目前正在尝试预测对象在图像中的位置,该图像是我创建的数据集的一部分。
这个数据集总共包含大约 300 张图像,包含 2 个类别(Ace 和 Two)。
我创建了一个 CNN,它以大约 88% 的准确率预测它是 Ace 还是 2。
由于这个数据集做得很好,我决定尝试预测卡片的位置(而不是类)。我阅读了一些文章,据我了解,我所要做的就是采用我用来预测类的相同 CNN,并将最后一层更改为 4 个节点的密集层。 这就是我所做的,但显然这不起作用。
这是我的模型:
model = Sequential()
model.add(Conv2D(64,(3,3),input_shape = (150,150,1)))
model.add(Activation("relu"))
model.add(MaxPooling2D(pool_size=2))
model.add(Conv2D(32,(3,3)))
model.add(Activation("relu"))
model.add(MaxPooling2D(pool_size=2))
model.add(Dense(64))
model.add(Activation("relu"))
model.add(Flatten())
model.add(Dense(4))
model.compile(loss="mean_squared_error",optimizer='adam',metrics=[])
model.fit(X,y,batch_size=1,validation_split=0,
epochs=30,verbose=1,callbacks=[TENSOR_BOARD])
我提供给我的模型的内容:
X:150x150 像素的灰度图像。每个像素在 [0-1] 之间重新缩放
y:对象的最小 X 坐标、最大 Y 坐标、宽度和高度(每个值都在 [0-1] 之间。
这是它给我的预测示例:
[array([ 28.66145 , 41.278576, -9.568813, -13.520659], dtype=float32)]
但我真正想要的是:
[0.32, 0.38666666666666666, 0.4, 0.43333333333333335]
我知道这里出了点问题,所以我决定在单个图像上训练和测试我的 CNN(因此它应该过拟合并预测该单个图像的正确边界框(如果它有效))。即使在这张单张图像上过拟合后,预测值也高得离谱。
所以我的问题是: 我做错了什么?
编辑 1
在尝试了@Matias 的解决方案之后,即在最后一层添加一个 sigmoid 激活函数,所有输出值现在都在 [0,1] 之间。
但是,即使这样,模型仍然会产生不好的输出。 例如,在同一张图像上训练 10 个 epoch 后,它预测到:
[array([0.0000000e+00, 0.0000000e+00, 8.4378130e-18, 4.2288357e-07],dtype=float32)]
但我的预期是:
[0.2866666666666667, 0.31333333333333335, 0.44666666666666666, 0.5]
编辑 2
好的,所以,经过一段时间的试验,我得出的结论是,问题要么是我的模型(它的构建方式) 或缺乏训练数据。
但即使它是由于缺乏训练数据造成的,我也应该能够在 1 张图像上过度拟合,以便得到正确的预测,对吧?
我创建了另一个帖子,询问我的最后一个问题,因为原始问题已得到回答,我不想完全重新编辑帖子,因为它会使第一个答案毫无意义。
【问题讨论】:
-
这是一个回归问题,精度对回归没有意义。只能用于分类。
标签: tensorflow machine-learning keras conv-neural-network object-detection