全部产品
Search
文档中心

云服务器 ECS:CPU利用率高演练

更新时间:May 26, 2026

CPU利用率是衡量业务系统是否健康的一个重要指标,为使业务达到足够的稳定性,CPU利用率需保持在合理的范围内。过高的CPU利用率会导致业务延迟甚至中断。通过注入高CPU故障,可以测试业务系统在特定CPU负载时的反应、检测系统恢复能力、验证监控和告警机制的有效性等,并基于演练结果制定应对策略,确保生产环境高CPU利用率时系统能够迅速恢复正常运行,降低业务中断风险。

实现原理

本方案使用云助手插件ecs-fault-highcpu,启动注入进程AliFaultHighCpu以特定占空比消耗CPU时间片。

使用指南

演练准备

请确保您的ECS实例已安装云助手Agent,并且云助手状态正常。具体操作,请参见查看云助手状态及异常状态处理

故障注入

  1. 使用具有sudo访问权限的用户,运行云助手插件ecs-fault-highcpu

    sudo acs-plugin-manager --exec --plugin ecs-fault-highcpu --params inject,[cpu-percent=paramA],[cpu-list=paramB]

    []内为可选故障注入参数,参数说明:

    • cpu-percent(可选):要达到的CPU利用率,为空时默认100。

      说明

      cpu-percent为注入进程的CPU利用率,总CPU利用率还会受到其他进程的影响。

    • cpu-list(可选):用于对特定vCPU绑定负载,如cpu-list=0-2/4表示对core 0、core 1、core 2和core 4绑定CPU负载,为空时对全部vCPU绑定负载。

  2. 查看故障注入是否成功。

    • 在ECS实例中,执行top命令,CPU利用率上升,说明故障注入成功。其中内核态(sy)和用户态(us)之和约等于设置的CPU利用率。

      top - 17:54:43 up 56 min,  1 user,  load average: 2.75, 3.07, 2.79
      Tasks: 110 total,   3 running, 106 sleeping,   0 stopped,   1 zombie
      %Cpu(s): 46.9 us, 51.7 sy,  0.0 ni,  0.0 id,  0.0 wa,  0.8 hi,  0.5 si,  0.0 st
      MiB Mem :   3566.0 total,   2432.8 free,    226.1 used,    907.1 buff/cache
      MiB Swap:      0.0 total,      0.0 free,      0.0 used.   3114.8 avail Mem
        PID USER      PR  NI    VIRT    RES    SHR S  %CPU  %MEM     TIME+ COMMAND
       2269 root      20   0  222124   3304   2992 R  10.3   0.1   3:46.48 AliFaultHighCpu
       2099 root      20   0  222124   3288   2976 S   9.7   0.1   3:45.34 AliFaultHighCpu
       1849 root      10 -10  138968  40156  16872 S   9.0   1.1   3:34.35 AliYunDunMonito
        749 root      20   0  474984  29068  13556 S   0.3   0.8   0:06.57 tuned
        778 root      20   0 1798724  39300  20744 S   0.3   1.1   0:01.46 containerd
       1838 root      20 -10   88356  17364   1200 S   0.3   0.5   0:12.94 AliYunDun
          1 root      20   0  103420  11464   8640 S   0.0   0.3   0:01.36 systemd
          2 root      20   0       0      0      0 S   0.0   0.0   0:00.00 kthreadd
    • 在云监控监控图表中,注入后CPU利用率上升,说明故障注入成功。

      image

故障恢复

您可以使用以下方式,恢复ECS实例状态。

  • 方法一(推荐):在ECS实例中执行故障恢复命令,查看CPU利用率是否下降到故障注入前的水平。

    sudo acs-plugin-manager --exec --plugin ecs-fault-highcpu --params recover

    如下所示,CPU利用率已下降到故障注入前的水平,系统已恢复正常。

    top - 17:03:18 up 30 min,  1 user,  load average: 0.06, 0.01, 0.00
    Tasks: 109 total,   1 running, 108 sleeping,   0 stopped,   0 zombie
    %Cpu(s):  0.5 us,  0.2 sy,  0.0 ni, 99.2 id,  0.0 wa,  0.2 hi,  0.0 si,  0.0 st
    MiB Mem :   3565.9 total,   2918.7 free,    148.9 used,    498.3 buff/cache
    MiB Swap:      0.0 total,      0.0 free,      0.0 used.   3200.3 avail Mem
      PID USER      PR  NI    VIRT    RES    SHR S  %CPU  %MEM     TIME+ COMMAND
     1546 root      10 -10  121036  22296  16412 S   0.7   0.6   0:06.96 AliYunDunMonito
      753 root      20   0   43200   7632   6152 S   0.3   0.2   0:00.80 AliYunDunUpdate
     1008 root      20   0  689936  20344  13780 S   0.3   0.6   0:02.37 aliyun-service
     1535 root      10 -10   88300  17472  11296 S   0.3   0.5   0:04.14 AliYunDun
        1 root      20   0  103332  11164   8480 S   0.0   0.3   0:00.97 systemd
        2 root      20   0       0      0      0 S   0.0   0.0   0:00.00 kthreadd
        3 root       0 -20       0      0      0 I   0.0   0.0   0:00.00 rcu_gp
        4 root       0 -20       0      0      0 I   0.0   0.0   0:00.00 rcu_par_gp
        6 root       0 -20       0      0      0 I   0.0   0.0   0:00.00 kworker/0:0H-kblockd
        7 root      20   0       0      0      0 I   0.0   0.0   0:00.00 kworker/u4:0-ext4-rsv-conversion
        8 root       0 -20       0      0      0 I   0.0   0.0   0:00.00 mm_percpu_wq
        9 root      20   0       0      0      0 S   0.0   0.0   0:00.00 rcu_tasks_rude_
  • 方法二:自行终止名为AliFaultHighCpu的进程。

    为不影响后续重复对该场景故障注入,终止AliFaultHighCpu进程后,再次执行方法一的故障恢复命令。

    sudo kill <AliFaultHighCpu PID>