CPU利用率是衡量业务系统是否健康的一个重要指标,为使业务达到足够的稳定性,CPU利用率需保持在合理的范围内。过高的CPU利用率会导致业务延迟甚至中断。通过注入高CPU故障,可以测试业务系统在特定CPU负载时的反应、检测系统恢复能力、验证监控和告警机制的有效性等,并基于演练结果制定应对策略,确保生产环境高CPU利用率时系统能够迅速恢复正常运行,降低业务中断风险。
实现原理
本方案使用云助手插件ecs-fault-highcpu,启动注入进程AliFaultHighCpu以特定占空比消耗CPU时间片。
使用指南
演练准备
请确保您的ECS实例已安装云助手Agent,并且云助手状态为正常。具体操作,请参见查看云助手状态及异常状态处理。
故障注入
-
使用具有sudo访问权限的用户,运行云助手插件
ecs-fault-highcpu。sudo acs-plugin-manager --exec --plugin ecs-fault-highcpu --params inject,[cpu-percent=paramA],[cpu-list=paramB][]内为可选故障注入参数,参数说明:-
cpu-percent(可选):要达到的CPU利用率,为空时默认100。
说明cpu-percent为注入进程的CPU利用率,总CPU利用率还会受到其他进程的影响。
-
cpu-list(可选):用于对特定vCPU绑定负载,如cpu-list=0-2/4表示对core 0、core 1、core 2和core 4绑定CPU负载,为空时对全部vCPU绑定负载。
-
-
查看故障注入是否成功。
-
在ECS实例中,执行
top命令,CPU利用率上升,说明故障注入成功。其中内核态(sy)和用户态(us)之和约等于设置的CPU利用率。top - 17:54:43 up 56 min, 1 user, load average: 2.75, 3.07, 2.79 Tasks: 110 total, 3 running, 106 sleeping, 0 stopped, 1 zombie %Cpu(s): 46.9 us, 51.7 sy, 0.0 ni, 0.0 id, 0.0 wa, 0.8 hi, 0.5 si, 0.0 st MiB Mem : 3566.0 total, 2432.8 free, 226.1 used, 907.1 buff/cache MiB Swap: 0.0 total, 0.0 free, 0.0 used. 3114.8 avail Mem PID USER PR NI VIRT RES SHR S %CPU %MEM TIME+ COMMAND 2269 root 20 0 222124 3304 2992 R 10.3 0.1 3:46.48 AliFaultHighCpu 2099 root 20 0 222124 3288 2976 S 9.7 0.1 3:45.34 AliFaultHighCpu 1849 root 10 -10 138968 40156 16872 S 9.0 1.1 3:34.35 AliYunDunMonito 749 root 20 0 474984 29068 13556 S 0.3 0.8 0:06.57 tuned 778 root 20 0 1798724 39300 20744 S 0.3 1.1 0:01.46 containerd 1838 root 20 -10 88356 17364 1200 S 0.3 0.5 0:12.94 AliYunDun 1 root 20 0 103420 11464 8640 S 0.0 0.3 0:01.36 systemd 2 root 20 0 0 0 0 S 0.0 0.0 0:00.00 kthreadd -
在云监控监控图表中,注入后CPU利用率上升,说明故障注入成功。

-
故障恢复
您可以使用以下方式,恢复ECS实例状态。
-
方法一(推荐):在ECS实例中执行故障恢复命令,查看CPU利用率是否下降到故障注入前的水平。
sudo acs-plugin-manager --exec --plugin ecs-fault-highcpu --params recover如下所示,CPU利用率已下降到故障注入前的水平,系统已恢复正常。
top - 17:03:18 up 30 min, 1 user, load average: 0.06, 0.01, 0.00 Tasks: 109 total, 1 running, 108 sleeping, 0 stopped, 0 zombie %Cpu(s): 0.5 us, 0.2 sy, 0.0 ni, 99.2 id, 0.0 wa, 0.2 hi, 0.0 si, 0.0 st MiB Mem : 3565.9 total, 2918.7 free, 148.9 used, 498.3 buff/cache MiB Swap: 0.0 total, 0.0 free, 0.0 used. 3200.3 avail Mem PID USER PR NI VIRT RES SHR S %CPU %MEM TIME+ COMMAND 1546 root 10 -10 121036 22296 16412 S 0.7 0.6 0:06.96 AliYunDunMonito 753 root 20 0 43200 7632 6152 S 0.3 0.2 0:00.80 AliYunDunUpdate 1008 root 20 0 689936 20344 13780 S 0.3 0.6 0:02.37 aliyun-service 1535 root 10 -10 88300 17472 11296 S 0.3 0.5 0:04.14 AliYunDun 1 root 20 0 103332 11164 8480 S 0.0 0.3 0:00.97 systemd 2 root 20 0 0 0 0 S 0.0 0.0 0:00.00 kthreadd 3 root 0 -20 0 0 0 I 0.0 0.0 0:00.00 rcu_gp 4 root 0 -20 0 0 0 I 0.0 0.0 0:00.00 rcu_par_gp 6 root 0 -20 0 0 0 I 0.0 0.0 0:00.00 kworker/0:0H-kblockd 7 root 20 0 0 0 0 I 0.0 0.0 0:00.00 kworker/u4:0-ext4-rsv-conversion 8 root 0 -20 0 0 0 I 0.0 0.0 0:00.00 mm_percpu_wq 9 root 20 0 0 0 0 S 0.0 0.0 0:00.00 rcu_tasks_rude_ -
方法二:自行终止名为
AliFaultHighCpu的进程。为不影响后续重复对该场景故障注入,终止
AliFaultHighCpu进程后,再次执行方法一的故障恢复命令。sudo kill <AliFaultHighCpu PID>