nvidia-smi 命令解读

nvidia-smi是用来查看GPU使用情况的。我常用这个命令判断哪几块GPU空闲,但是最近的GPU使用状态让我很困惑,于是把nvidia-smi命令显示的GPU使用表中各个内容的具体含义解释一下。

这里写图片描述

这是服务器上特斯拉K80的信息。
上面的表格中:
第一栏的Fan:N/A是风扇转速,从0到100%之间变动,这个速度是计算机期望的风扇转速,实际情况下如果风扇堵转,可能打不到显示的转速。有的设备不会返回转速,因为它不依赖风扇冷却而是通过其他外设保持低温(比如我们实验室的服务器是常年放在空调房间里的)。
第二栏的Temp:是温度,单位摄氏度。
第三栏的Perf:是性能状态,从P0到P12,P0表示最大性能,P12表示状态最小性能。
第四栏下方的Pwr:是能耗,上方的Persistence-M:是持续模式的状态,持续模式虽然耗能大,但是在新的GPU应用启动时,花费的时间更少,这里显示的是off的状态。
第五栏的Bus-Id是涉及GPU总线的东西,domain:bus:device.function
第六栏的Disp.A是Display Active,表示GPU的显示是否初始化。
第五第六栏下方的Memory Usage是显存使用率。
第七栏是浮动的GPU利用率。
第八栏上方是关于ECC的东西。
第八栏下方Compute M是计算模式。
下面一张表示每个进程占用的显存使用率。

显存占用和GPU占用是两个不一样的东西,显卡是由GPU和显存等组成的,显存和GPU的关系有点类似于内存和CPU的关系。我跑caffe代码的时候显存占得少,GPU占得多,师弟跑TensorFlow代码的时候,显存占得多,GPU占得少。

### nvidia-smi 输出界面详细说明及各项指标含义 `nvidia-smi` 是 NVIDIA 提供的一个用于管理和监控 GPU 设备的命令行工具。它能够实时显示 GPU 的状态信息,包括但不限于显存使用情况、计算进程占用、功耗等重要参数[^1]。 以下是 `nvidia-smi` 命令输出的主要部分及其具体含义: #### 1. **GPU Index** 显示每张 GPU 卡的编号,便于区分多卡环境下的不同设备。例如,在单机多卡环境中,可能会看到多个 GPU 编号如 `0`, `1`, `2` 等[^3]。 #### 2. **Name / Product Name** 表示当前 GPU 的型号名称,比如 Tesla V100 或 GeForce RTX 3090。这有助于确认所使用的硬件规格。 #### 3. **Driver Version & CUDA Version** 列出了驱动程序版本和已安装的 CUDA 版本信息。这对于验证系统配置是否满足特定软件需求非常重要[^4]。 #### 4. **Memory Usage (MiB)** 展示了总显存容量以及已被分配给运行中的应用程序的实际用量。单位通常是 MiB(兆字节)。这一项对于调试内存泄漏或者优化模型大小非常有用。 #### 5. **Utilization (%)** 包括以下几个子字段: - **Gpu Utilization**: 当前 GPU 芯片核心利用率百分比。 - **Memory Utilization**: 显存带宽被利用的程度。 这些数值反映了 GPU 是否处于高效工作状态还是闲置过多时间[^2]。 #### 6. **Temperature (°C)** 实时监测 GPU 温度变化范围,并标注正常操作范围内允许的最大温度界限。如果超过安全阈值会触发保护机制降低频率甚至关闭电源以防损坏硬件组件。 #### 7. **Power Draw (Watts)** 和 Power Limit 记录实际消耗功率与设定最大限额之间的对比关系。帮助管理员评估能源效率并调整策略以减少成本支出. #### 8. **Processes Running on the Device** 如果存在任何正在使用该 GPU 的进程,则会在表格底部列出它们对应的 PID(process ID), 用户名(username), 所属应用(application name) 及其各自占用了多少 MB 的 VRAM(memory usage). --- ```bash # 示例:执行 nvidia-smi 查看完整的统计报告 $ nvidia-smi ``` 上述命令将会返回类似于下面结构化的文本格式化输出: | Field | Description | |---------------------|-----------------------------------------------------------------------------| | GPU | Number of GPUs present | | PCI Bus Id | Unique identifier per physical slot | | Fan Speed | Percentage fan speed | | Performance State | Current performance state | --- ###
评论 5
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值