【问题标题】:Pytorch: no CUDA-capable device is detected on LinuxPytorch:在 Linux 上未检测到支持 CUDA 的设备
【发布时间】:2019-05-26 05:56:07
【问题描述】:

当尝试运行一些 Pytorch 代码时,我收到此错误:

THCudaCheck FAIL file=/pytorch/aten/src/THC/THCGeneral.cpp line=74 error=38 : no CUDA-capable device is detected
Traceback (most recent call last):
File "demo.py", line 173, in test
pca = torch.FloatTensor( np.load('../basics/U_lrw1.npy')[:,:6]).cuda()
RuntimeError: cuda runtime error (38) : no CUDA-capable device is detected at /pytorch/aten/src/THC/THCGeneral.cpp:74

我使用“Google 深度学习虚拟机”运行云虚拟机 版本:tf-gpu.1-13.m25 基于:Debian GNU/Linux 9.9 (stretch) (GNU/Linux 4.9.0-9-amd64 x86_64\n) Linux tf-gpu-interruptible 4.9.0-9-amd64 #1 SMP Debian 4.9.168-1 (2019-04-12) x86_64

环境信息:

$ nvidia-smi
Sun May 26 05:32:33 2019       
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 410.72       Driver Version: 410.72       CUDA Version: 10.0     |
|-------------------------------+----------------------+----------------------+
| GPU  Name        Persistence-M| Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp  Perf  Pwr:Usage/Cap|         Memory-Usage | GPU-Util  Compute M. |
|===============================+======================+======================|
|   0  Tesla K80           Off  | 00000000:00:04.0 Off |                    0 |
| N/A   42C    P0    74W / 149W |      0MiB / 11441MiB |    100%      Default |
+-------------------------------+----------------------+----------------------+

+-----------------------------------------------------------------------------+
| Processes:                                                       GPU Memory |
|  GPU       PID   Type   Process name                             Usage      |
|=============================================================================|
|  No running processes found                                                 |
+-----------------------------------------------------------------------------+

 $ echo $CUDA_PATH

 $ echo $LD_LIBRARY_PATH
/usr/local/cuda/lib64:/usr/local/nccl2/lib:/usr/local/cuda/extras/CUPTI/lib64

$ env | grep CUDA
CUDA_VISIBLE_DEVICES=0

$ pip freeze
DEPRECATION: Python 2.7 will reach the end of its life on January 1st, 2020. Please upgrade your Python as Python 2.
7 won't be maintained after that date. A future version of pip will drop support for Python 2.7.
audioread==2.1.7
backports.functools-lru-cache==1.5
certifi==2019.3.9
chardet==3.0.4
cloudpickle==1.1.1
cycler==0.10.0
dask==1.2.2
decorator==4.4.0
dlib==19.17.0
enum34==1.1.6
filelock==3.0.12
funcsigs==1.0.2
future==0.17.1
gdown==3.8.1
idna==2.8
joblib==0.13.2
kiwisolver==1.1.0
librosa==0.6.3
llvmlite==0.28.0

【问题讨论】:

  • torch 错误消息:no CUDA-capable device is detected 告诉您当前用户没有权限从您闪亮的 nvidia GPU 读取或写入。默认情况下,视频卡或 GPU 通常归 root 所有。尝试使用sudo 只运行一次程序,或者暂时以root 身份运行,如果解决了,那么您需要将video 组添加到您的用户,例如:man useradd; useradd -a youruser video

标签: pytorch google-dl-platform


【解决方案1】:

我没有找到您的问题的主要原因。但我注意到一件事,GPU-Util 100%,而没有任何进程在后面运行。

您可以按照以下方向尝试。

  1. sudo nvidia-smi -pm 1

在持久模式下启用。这可能会解决您的问题。 ECC 与非持久化模式的结合可以实现 GPU 的 100% 利用率。

  1. 您还可以使用命令 nvidia -smi -e 0 禁用 ECC

  2. 或者最好从头开始重新启动整个过程,即再次重新启动操作系统。

注意:我不确定它是否适合您。我之前遇到过类似的问题,所以我只是根据我的经验告诉我。 希望这会对你有所帮助。

【讨论】:

    猜你喜欢
    • 2012-10-31
    • 2023-01-04
    • 1970-01-01
    • 1970-01-01
    • 2020-12-30
    • 1970-01-01
    • 2022-01-01
    • 2012-10-14
    • 2019-07-01
    相关资源
    最近更新 更多