【问题标题】:Keras model.fit ValueError: Input arrays should have the same number of samples as target arraysKeras model.fit ValueError:输入数组应具有与目标数组相同数量的样本
【发布时间】:2018-04-29 06:07:17
【问题描述】:

我正在尝试将通过运行 resnet50 获得的bottleneck_features 加载到顶层模型中。我在 resnet 上运行 predict_generator 并将生成的bottleneck_features 保存到 npy 文件中。由于以下错误,我无法拟合我创建的模型:

    Traceback (most recent call last):
  File "Labeled_Image_Recognition.py", line 119, in <module>
    callbacks=[checkpointer])
  File "/home/dillon/anaconda3/envs/tensorflow/lib/python3.6/site-packages/keras/models.py", line 963, in fit
    validation_steps=validation_steps)
  File "/home/dillon/anaconda3/envs/tensorflow/lib/python3.6/site-packages/keras/engine/training.py", line 1630, in fit
    batch_size=batch_size)
  File "/home/dillon/anaconda3/envs/tensorflow/lib/python3.6/site-packages/keras/engine/training.py", line 1490, in _standardize_user_data
    _check_array_lengths(x, y, sample_weights)
  File "/home/dillon/anaconda3/envs/tensorflow/lib/python3.6/site-packages/keras/engine/training.py", line 220, in _check_array_lengths
    'and ' + str(list(set_y)[0]) + ' target samples.')
ValueError: Input arrays should have the same number of samples as target arrays. Found 940286 input samples and 14951 target samples.

我不太确定这意味着什么。我的火车目录中有 940286 个图像,这些图像被分成 14951 个子目录。我的两个假设是:

  1. 我可能没有正确格式化 train_data 和 train_labels。
  2. 我的模型设置不正确

任何正确方向的指导将不胜感激!

代码如下:

# Constants
num_train_dirs = 14951 #This is the total amount of classes I have
num_valid_dirs = 13168 

def load_labels(path):
    targets = os.listdir(path)
    labels = np_utils.to_categorical(targets, len(targets))
    return labels

def create_model(train_data):
    model = Sequential()
    model.add(Flatten(input_shape=train_data.shape[1:]))
    model.add(Dense(num_train_dirs, activation='relu'))
    model.add(Dropout(0.2))
    model.add(Dense(num_train_dirs, activation='softmax'))
    model.compile(loss='categorical_crossentropy', optimizer='rmsprop', metrics=['accuracy'])
    return model    

train_data = np.load(open('bottleneck_features/bottleneck_features_train.npy', 'rb'))
train_labels = load_labels(raid_train_dir)

valid_data = np.load(open('bottleneck_features/bottleneck_features_valid.npy', 'rb'))
valid_labels = train_labels

model = create_model(train_data)
model.summary()

checkpointer = ModelCheckpoint(filepath='weights/first_try.hdf5', verbose=1, save_best_only=True)

print("Fitting model...")

model.fit(train_data, train_labels,
     epochs=50,
     batch_size=100,
     verbose=1,
     validation_data=(valid_data, valid_labels),
     callbacks=[checkpointer])

【问题讨论】:

    标签: python machine-learning keras


    【解决方案1】:

    在监督学习的情况下,输入样本的数量 (X) 必须与输出(标签)样本的数量 (Y) 匹配。

    例如:如果我们想要拟合(学习)神经网络来识别手写数字,并且我们将 10000 张图像 (X) 输入到我们的模型中,那么我们还应该传递 10000 个标签 (Y)。

    在你的情况下,这些数字不匹配。

    【讨论】:

    • 啊,我明白了。因此,要使其正常工作,我的 train_labels 需要与 train_data 长度相同。如果在 train_labels 一个热编码数组中重复类名是否重要?还是应该是 train_labels 直接描述了 train_data 数组中的内容?
    猜你喜欢
    • 2018-07-10
    • 1970-01-01
    • 2018-09-28
    • 2020-06-13
    • 1970-01-01
    • 2020-08-31
    • 2023-03-10
    • 2019-05-30
    • 2018-10-15
    相关资源
    最近更新 更多