
# GPU节点使用nvidia驱动启动容器排查思路
#### 集群中的节点是否有资源调度失败的事件？
**问题现象：**
节点运行正常且有GPU资源，但报如下失败信息：
0/9 nodes are available: 9 insufficient nvidia.com/gpu
**排查思路：**
1. 确认节点标签是否已经打上nvidia资源。 ![](https://support.huaweicloud.com/cce_faq/zh-cn_image_0000002218569244.png "点击放大")
   ![](https://support.huaweicloud.com/cce_faq/zh-cn_image_0235189276.png "点击放大")
   
2. 查看nvidia驱动运行是否正常。 到插件运行所在的节点上，查看驱动的安装日志，路径为"/opt/cloud/cce/nvidia/nvidia_installer.log"或" /usr/local/nvidia/nvidia-installer.log"。
   查看nvidia容器标准输出日志：
   过滤容器id
   ```
   crictl ps -a | grep nvidia
   ```
   查看日志
   ```
   crictl logs 容器id
   ```
   
 
#### 业务上报nvidia版本和cuda版本不匹配？
1. 在业务容器中确认cuda版本，执行类似如下命令（以cuda官方查询方法为准）：
   ```
   cat /usr/local/cuda/version.txt
   ```
   
2. 查看容器所在节点的nvidia驱动版本支持的cuda版本范围，是否包含容器中的cuda版本。节点中查看驱动支持的最高cuda版本，执行"nvidia-smi"命令。
 
#### 相关链接
[工作负载异常：GPU节点部署服务时报错](https://support.huaweicloud.com/cce_faq/cce_faq_00109.html)
