Résolvez l'erreur de type softlockup provoquée par la suppression de cgroups dans une instance ECS en mettant à niveau la version du noyau.
Description du problème
Une erreur de type softlockup se produit lorsque vous supprimez des cgroups dans une instance ECS, avec une pile d'appels similaire à la suivante :
[3302742.447940] Kernel panic - not syncing: softlockup: hung tasks
[3302742.448677] CPU: 18 PID: 1 Comm: systemd Kdump: loaded Tainted: G OEL ------------ T 3.10.0-862.14.4.el7.x86_64 #1
[3302742.450167] Hardware name: Alibaba Cloud Alibaba Cloud ECS, BIOS 8a46cfe 04/01/2014
[3302742.462123] [] mem_cgroup_reparent_charges+0x16d/0x3c0
[3302742.463243] [] mem_cgroup_css_offline+0x84/0x140
[3302742.464327] [] cgroup_destroy_locked+0xea/0x370
[3302742.465414] [] cgroup_rmdir+0x22/0x40
[3302742.466434] [] vfs_rmdir+0xdc/0x150
[3302742.467449] [] do_rmdir+0x1f1/0x220
[3302742.468470] [] ? ____fput+0xe/0x10
[3302742.469495] [] ? task_work_run+0xc0/0xe0
[3302742.470578] [] SyS_rmdir+0x16/0x20
[3302742.471628] [] system_call_fastpath+0x22/0x27
Cause
Lorsque des cgroups sont supprimés, le noyau réattribue les pages mémoire utilisées à la hiérarchie parente des cgroups. Si les cgroups consomment une grande quantité de mémoire, ce processus prend beaucoup de temps. Comme aucun point de planification n'existe pendant le calcul, une erreur de type softlockup se produit.
Solution
Avant de poursuivre, créez des snapshots pour sauvegarder les données de l'instance et éviter toute perte de données. Consultez la rubrique Créer un snapshot manuellement.
Les opérations varient selon le système d'exploitation de l'instance.
-
Si votre instance exécute CentOS, mettez à niveau la version du noyau.
-
Mettez à jour le noyau :
yum update kernel -
Redémarrez l'instance :
reboot -
Vérifiez que la version du noyau est 3.10.0-1160 ou ultérieure :
uname -r
-
Si votre instance exécute Alibaba Cloud Linux, ce problème ne se produit pas.
Pour les autres systèmes d'exploitation, mettez à niveau le noyau vers la version 4.17 ou ultérieure.