【发布时间】:2019-04-11 10:34:33
【问题描述】:
我正在尝试在带有 GPU 的 Kubernetes 引擎上部署 ML 应用程序。我使用 nvidia/cuda:9.0-runtime 创建了 docker 映像,并在它之上构建了我的应用程序。当我将映像部署到 Kubernetes Engine 时,我收到一条错误消息,指出它无法导入 libcuda.so.1。
ImportError: libcuda.so.1: cannot open shared object file: No such file or directory
我查看了一些发布的解决方案,但似乎没有一个有效。
在尝试这些解决方案时,我还发现
提到的路径
echo $LD_LIBRARY_PATH
这给了
/usr/local/nvidia/lib:/usr/local/nvidia/lib64
似乎不存在。
此外,文件系统中的任何位置都没有名称为 libcuda.so.1(或任何数字)的文件。 /usr/lib/cuda/lib64 包含共享库。 我目前在这里执行什么错误
【问题讨论】:
-
能否分享您的应用程序 Dockerfile 和应用程序 pod/daemonset/deployment YAML?
标签: docker tensorflow kubernetes