【问题标题】:custom keras metric returns nan自定义 keras 指标返回 nan
【发布时间】:2019-02-06 23:31:09
【问题描述】:

我想在分类问题中进一步将输出类分成更少的桶。 我有 4 个输出类(即 0、1、2、3)。但在训练期间,我还想跟踪 2 个类的准确性:

  • 将 0 和 1 视为 0 类
  • 将 2 和 3 视为 1 类

为此,我创建了一个新指标并将其与模型一起编译:

def new_classes_acc(y_true, y_pred):
  actual = tf.floor( y_true / 2 )
  predicted = tf.floor( y_pred / 2 )
  return K.categorical_crossentropy(actual, predicted)

这样编译:

model.compile(loss='categorical_crossentropy', optimizer=optimizer, metrics=['accuracy', new_classes_acc])

我得到nan 作为准确度值。这样做的正确方法是什么?

【问题讨论】:

  • 当你使用tf.floor(y_true/2)时,所有class 1都将转换为class 0,class 2和class 3将转换为class 1,最后class 2将保持不变。所以你创建了 3 个类 class 0,1,2 而不是 2 个。
  • 感谢您的指出。更正了我的问题陈述。是一个错字。无论哪种方式,我仍然不清楚如何在 tf.keras 中正确执行此操作

标签: python tensorflow machine-learning keras loss-function


【解决方案1】:

由于有 4 个类别,并且您已将 categorical_crossentropy 设置为损失,因此标签是 one-hot 编码的并且形状为 (n_samples, 4)。因此,首先您需要使用argmax 函数找到真实类和预测类,然后使用floor 函数(此外,您要创建一个度量而不是损失函数;因此您不应该使用K.categorical_crossentropy):

from keras import backend as K
import tensorflow as tf

def custom_metric(y_true, y_pred):
    tr = tf.floor(K.argmax(y_true, axis=-1) / 2)
    pr = tf.floor(K.argmax(y_pred, axis=-1) / 2)
    return K.cast(K.equal(tr, pr), K.floatx())

现在,让我们测试一下。首先我们创建一个简单的模型并编译它:

model = Sequential()
model.add(Dense(4, activation='softmax', input_shape=(2,)))

model.compile(loss='categorical_crossentropy', optimizer='adam', metrics=['accuracy', custom_metric])

然后我们创建虚拟数据:

import numpy as np
data = np.array([1, 2]).reshape(1, 2)

并使用我们的模型来预测给定数据的标签:

print(model.predict(data))
# prints: [0.04662106, 0.8046941 , 0.07660434, 0.0720804 ] 

所以第二类的概率最高,将是预测的标签。现在,考虑到我们定义的自定义指标,给定 [1, 0, 0, 0] 或 [0, 1, 0, 0] 作为真实标签,自定义指标应该给我们 1(即 100%)。让我们确认一下:

true_labels = np.array([1, 0, 0, 0]).reshape(1,4)
print(model.evaluate(data, true_labels))    # gives: [3.0657029151916504, 0.0, 1.0]  

返回列表的第一个元素对应于损失,第二个元素对应于accuracy,第三个元素对应于我们的自定义指标。如您所见,准确度为零(因为真实类是一类,但预测类是二类),自定义指标为 1,正如预期的那样。

另外一种情况:

true_labels = np.array([0, 1, 0, 0]).reshape(1,4)
print(model.evaluate(data, true_labels))    # gives: [0.21729297935962677, 1.0, 1.0]

这里的准确率是一(因为真实类和预测类都是二类),自定义指标也是一。对于剩下的[0, 0, 1, 0]和[0, 0, 0, 1]这两种情况,你可以进一步确认为真标签;对于自定义指标的值,两者都应返回零。


奖励:如果标签是稀疏的,即 0、1、2 和 3,该怎么办?然后,您可以使用keras.np_utils.to_categorical() 方法对它们进行一次热编码,然后使用上面定义的自定义指标。

【讨论】:

  • 很好的解释。在处理之前清除了我们为什么需要K.argmax 的概念。只是为了了解更多信息,稀疏标签是什么意思 - 它们是如何存储和检索的以及它们何时使用?
  • @Nitin 通过稀疏标签我的意思是它们表示为整数,如 1 或 2 或 3 等。因此标签数组的形状为 (n_samples,) ,即每个样本一个整数标签。要训​​练模型,如果您不想对标签进行一次性编码,可以使用sparse_categorical_crossentropy 作为损失函数。
猜你喜欢
  • 2017-11-29
  • 2019-10-07
  • 2018-05-14
  • 1970-01-01
  • 2020-03-04
  • 2017-09-20
  • 2022-11-30
  • 1970-01-01
  • 2018-01-25
相关资源
最近更新 更多