【发布时间】:2018-10-01 12:13:50
【问题描述】:
Mask RCNN Resource Exhausted 需要帮助 -
硬件 - i7-8700、32G RAM、单个 ASUS ROG STRIX 1080ti (11GB)
虚拟环境设置 - tensorflow-gpu==1.5.0, python==3.6.6, Cuda==9.0.176, cudnn==7.2.1
图像分辨率 - 最大宽度 = 900 像素,最大高度 = 675 像素,最小宽度 = 194 像素,最小高度 = 150 像素,用于训练的 11 张图像
S/W - IMAGES_PER_GPU = 1(在类 xxConfig(Config)、xxx.py 中)、BACKBONE = "resnet50"、POST_NMS_ROIS_TRAINING = 1000、POST_NMS_ROIS_INFERENCE = 500、IMAGE_RESIZE_MODE = "square"、IMAGE_MIN_DIM = 400、IMAGE_MAX_DIM = 512 , TRAIN_ROIS_PER_IMAGE = 100
让我感到奇怪的是,nvidia-smi 显示
ResourceExhaustedError(有关回溯,请参见上文):在分配具有 shape[3,3,256,256] 的张量并通过分配器 GPU_0_bfc 在 /job:localhost/replica:0/task:0/device:GPU:0 上键入 float 时出现 OOM [[节点:fpn_p5/random_uniform/RandomUniform = RandomUniformT=DT_INT32,dtype=DT_FLOAT,seed=87654321,seed2=5038409,_device="/job:localhost/replica:0/task:0/device:GPU:0"]]
【问题讨论】:
-
顺便说一下,layers='heads'
-
不过,使用相同的虚拟环境,我能够训练“samples/shapes/train_shapes.ipynb”。
-
是cudnn版本的原因吗?我重新启动并在重新启动后首次运行时显示错误消息 - E tensorflow/stream_executor/cuda/cuda_dnn.cc:378] Loaded runtime CuDNN library: 7201 (compatibility version 7200) but source was compiled with 7004 (compatibility version 7000). ...
标签: tensorflow memory resources gpu mask