【问题标题】:How to deal with thousands of images for CNN training KerasCNN训练Keras如何处理数千张图像
【发布时间】:2018-10-17 09:46:32
【问题描述】:

我有大约 10000k 图像无法放入内存。所以现在我只能读取 1000 张图像并对其进行训练......

我的代码在这里:

img_dir = "TrainingSet" # Enter Directory of all images 
image_path = os.path.join(img_dir+"/images",'*.bmp')
files = glob.glob(image_path)
images = []
masks = []
contours = []
indexes = []
files_names = []

for f1 in np.sort(files):
  img = cv2.imread(f1)
  result = re.search('original_cropped_(.*).bmp', str(f1))
  idx = result.group(1)
  mask_path = img_dir+"/masks/mask_cropped_"+str(idx)+".bmp"
  mask = cv2.imread(mask_path,0)
  contour_path = img_dir+"/contours/contour_cropped_"+str(idx)+".bmp"
  contour = cv2.imread(contour_path,0)

  indexes.append(idx)
  images.append(img)
  masks.append(mask)
  contours.append(contour)

train_df = pd.DataFrame({"id":indexes,"masks": masks, "images": images,"contours": contours })
train_df.sort_values(by="id",ascending=True,inplace=True)
print(train_df.shape)

img_size_target = (256,256)

ids_train, ids_valid, x_train, x_valid, y_train, y_valid, c_train, c_valid = train_test_split(
    train_df.index.values,
    np.array(train_df.images.apply(lambda x: cv2.resize(x,img_size_target).reshape(img_size_target[0],img_size_target[1],3))), 
    np.array(train_df.masks.apply(lambda x: cv2.resize(x,img_size_target).reshape(img_size_target[0],img_size_target[1],1))), 
    np.array(train_df.contours.apply(lambda x: cv2.resize(x,img_size_target).reshape(img_size_target[0],img_size_target[1],1))), 
    test_size=0.2, random_state=1337)

#Here we define the model architecture... 
#.....
#End of model definition

# Training 
optimizer = Adam(lr=1e-3,decay=1e-10)    
model.compile(loss="binary_crossentropy", optimizer=optimizer, metrics=["accuracy"])

early_stopping = EarlyStopping(patience=10, verbose=1)
model_checkpoint = ModelCheckpoint("./keras.model", save_best_only=True, verbose=1)
reduce_lr = ReduceLROnPlateau(factor=0.5, patience=5, min_lr=0.00001, verbose=1)

epochs = 200
batch_size = 32

history = model.fit(x_train, y_train,
                validation_data=[x_valid, y_valid], 
                epochs=epochs,
                batch_size=batch_size,
                callbacks=[early_stopping, model_checkpoint, reduce_lr])

我想知道的是如何修改我的代码以便批量处理一小组图像而不将所有其他 10000 个图像加载到内存中?这意味着该算法将在每个时期从目录中读取 X 图像并对其进行训练,然后继续下一个 X 直到最后一个。

这里的 X 是可以放入内存的合理数量的图像。

【问题讨论】:

  • 每批 500 张图片?!你有这么多内存吗?
  • 当我执行 print(tensorflow.python.client.device_lib.list_local_devices()) 我得到这个:化身:2232866153152631050,名称:“/device:GPU:0” device_type:“GPU” memory_limit:11281553818

标签: python machine-learning keras conv-neural-network visual-recognition


【解决方案1】:

使用 fit_generator 代替 fit

def generate_batch_data(num):
    #load X images here
    return images

model.fit_generator(generate_batch_data(X),
        samples_per_epoch=10000, nb_epoch=10)

您也可以使用 train_on_batch 代替 fit

GitHub上关于这个话题的讨论:https://github.com/keras-team/keras/issues/2708

【讨论】:

    【解决方案2】:

    np.array(train_df.images.apply(lambda x:cv2.resize(x,img_size_target).reshape(img_size_target[0],img_size_target[1],3)))

    您可以先将此过滤器(和其他 2 个过滤器)应用到每个单独的文件,并将它们保存到一个单独的脚本中的特殊文件夹(images_prepoc、masks_preproc 等)中,然后将它们加载回已经准备好在当前脚本。

    假设实际图像尺寸大于 256x256,您将拥有更快的算法,以单个准备阶段为代价使用更少的内存。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-12-28
      • 1970-01-01
      • 2017-07-07
      • 2019-01-25
      • 1970-01-01
      相关资源
      最近更新 更多