【发布时间】:2021-10-14 20:59:30
【问题描述】:
我正在一个 ml.p3.2xlarge 实例上的 Tensorflow 上训练一个 Seq2Seq 模型。当我尝试在 google colab 上运行代码时,每个 epoch 的时间约为 40 分钟。但是在实例上大约需要 5 个小时!
这是我的训练代码
def train_model(train_translator, dataset, path, num=8):
with tf.device("/GPU:0"):
cp_callback = tf.keras.callbacks.ModelCheckpoint(filepath=path,
save_weights_only=True,
verbose=1)
batch_loss = BatchLogs('batch_loss')
train_translator.fit(dataset, epochs=num,callbacks=[batch_loss,cp_callback])
return train_translator
我也试过不使用tf.device 命令,我仍然得到相同的时间。我做错了吗?
【问题讨论】:
标签: python-3.x amazon-web-services machine-learning tensorflow2.0 amazon-sagemaker