“平均负载”那些事--这一篇就够了

最新推荐文章于 2023-05-29 16:05:09 发布

流一恩典

最新推荐文章于 2023-05-29 16:05:09 发布

阅读量917

点赞数 1

分类专栏： Linux

本文链接：https://blog.csdn.net/czz1141979570/article/details/104496707

版权

本文深入探讨了“平均负载”的概念，澄清了它与CPU使用率的区别。平均负载实际上是单位时间内系统中活跃进程的平均数量，包括运行和等待CPU或I/O的进程。文章通过实例分析了CPU密集型、I/O密集型和大量进程场景下平均负载的变化，强调平均负载高于CPU数量70%时需要关注。同时，提到了使用mpstat、pidstat等工具帮助诊断负载来源。

摘要由CSDN通过智能技术生成

每次发现系统变慢时，我们通常做的第一件事，就是执行 top 或者 uptime 命令，来了解系统的负载情况。比如像下面这样，我在命令行里输入了 uptime 命令，系统也随即给出了结果。

$ uptime

02:34:03 up 2 days, 20:14,  1 user,  load average: 0.63, 0.83, 0.88

我相信你对前面的几列比较熟悉，它们分别是02:34:03当前时间、up 2 days, 20:14系统运行时间以及1 user正在登录用户数。

而最后三个数字呢，依次则是过去 1 分钟、5 分钟、15 分钟的平均负载（Load Average）。

平均负载？

这个词对很多人来说，可能既熟悉又陌生，我们每天的工作中，也都会提到这个词，但你真正理解它背后的含义吗？我猜一定有人会说，平均负载不就是单位时间内的 CPU 使用率吗？上面的 0.63，就代表 CPU使用率是 63%。其实并不是这样，如果你方便的话，可以通过执行 man uptime 命令，来了解平均负载的详细解释。

简单来说，平均负载是指单位时间内，系统处于可运行状态和不可中断状态的平均进程数，也就是平均活跃进程数，它和 CPU 使用率并没有直接关系。这里我先解释下，可运行状态和不可中断状态这俩词儿。

所谓可运行状态的进程，是指正在使用 CPU 或者正在等待 CPU 的进程，也就是我们常用 ps 命令看到的，处于 R 状态（Running 或 Runnable）的进程。

不可中断状态的进程则是正处于内核态关键流程中的进程，并且这些流程是不可打断的，比如最常见的是等待硬件设备的 I/O 响应，也就是我们在 ps 命令中看到的 D 状态（Uninterruptible Sleep，也称为 Disk Sleep）的进程。比如，当一个进程向磁盘读写数据时，为了保证数据的一致性，在得到磁盘回复前，它是不能被其他进程或者中断打断的，这个时候的进程就处于不可中断状态。如果此时的进程被打断了，就容易出现磁盘数据与进程数据不一致的问题。

所以，不可中断状态实际上是系统对进程和硬件设备的一种保护机制。

因此，你可以简单理解为，平均负载其实就是平均活跃进程数。平均活跃进程数，直观上的理解就是单位时间内的活跃进程数，但它实际上是活跃进程数的指数衰减平均值。这个“指数衰减平均”的详细含义你不用计较，这只是系统的一种更快速的计算方式，你把它直接当成活跃进程数的平均值也没问题。

既然平均的是活跃进程数，那么最理想的，就是每个 CPU 上都刚好运行着一个进程，这样每个 CPU 都得到了充分利用。比如当平均负载为 2 时，意味着什么呢？