Container Service for Kubernetes (ACK) propose une fonctionnalité de diagnostic des pods pour vous aider à identifier les pods anormaux. Cette rubrique décrit les vérifications de diagnostic effectuées et les corrections recommandées.
La plateforme de service de conteneurs intègre un système de diagnostic des pannes qui combine l'expertise technique avec un modèle d'intelligence artificielle entraîné sur des données à grande échelle. La fonctionnalité de diagnostic des pods exploite ces deux approches pour réaliser une analyse approfondie et identifier les causes racines. Un diagnostic de pod comprend des éléments de vérification et l'identification des causes racines.
Éléments de vérification du diagnostic : ils incluent la vérification du pod , la vérification du nœud, la vérification NodeComponent, la vérification ClusterComponent et la vérification ECSControllerManager.
Causes racines du diagnostic : causes identifiées et solutions recommandées. La fonctionnalité de diagnostic des pods collecte les informations du cluster et de ses nœuds, détecte les anomalies, puis effectue un diagnostic approfondi de celles-ci.
La fonctionnalité de diagnostic des pannes exécute un programme de collecte de données sur les nœuds de votre cluster afin de recueillir les résultats des vérifications. Les informations collectées comprennent la version du système, l'état d'exécution des composants tels que Docker et Kubelet, la charge des nœuds et les messages d'erreur clés issus des journaux système. Ce programme ne collecte ni vos données métier ni vos données sensibles.
Scénarios d'exception pris en charge
Le tableau suivant répertorie les scénarios d'exception couverts par le diagnostic des pods et le diagnostic assisté par IA.
|
Catégorie |
Description |
|
Diagnostic des pods |
Un pod n'est pas traité par l'ordonnanceur. |
|
Un pod ne peut pas être planifié car il ne respecte pas les contraintes de planification. |
|
|
Un pod est planifié mais n'est pas traité par kubelet. |
|
|
Un pod attend qu'un volume soit prêt. |
|
|
Un pod est expulsé. |
|
|
Un pod est expulsé en raison d'un espace disque insuffisant sur le nœud. |
|
|
Un pod est expulsé en raison d'une mémoire insuffisante sur le nœud. |
|
|
Un pod est expulsé en raison d'un nombre d'inodes insuffisant sur le nœud. |
|
|
La création du conteneur sandbox d'un pod échoue. |
|
|
Un pod reste bloqué dans l'état Terminating. |
|
|
Un conteneur d'un pod rencontre une erreur OOM (Out Of Memory). |
|
|
Un conteneur d'un pod se termine de manière inattendue. |
|
|
Un conteneur d'un pod se trouve dans l'état CrashLoopBackOff. |
|
|
Un conteneur d'un pod n'est pas prêt. |
|
|
Un pod ne parvient pas à extraire l'image du conteneur. |
|
|
Le délai d'attente est dépassé lors de l'extraction de l'image du conteneur par un pod. |
|
|
Diagnostic assisté par IA |
Un pod se trouve dans un état anormal. |
|
Un pod rencontre une erreur OOM. |
|
|
Un conteneur d'un pod se termine de manière inattendue. |
|
|
La configuration ConfigMap ou Secret d'un pod n'est pas valide. |
|
|
Un pod échoue au test de santé. |
|
|
La configuration PersistentVolumeClaim d'un pod n'est pas valide. |
|
|
Un pod ne parvient pas à extraire l'image du conteneur. |
Processus de diagnostic
Le diagnostic du cluster collecte les informations du cluster et de ses nœuds pour identifier les anomalies, puis réalise un diagnostic approfondi. Ce processus allie l'expertise humaine à l'intelligence artificielle pour cibler précisément la cause racine. Le déroulement du diagnostic comporte quatre étapes : détection des anomalies, collecte des données, évaluation des éléments de vérification et analyse des causes racines. À l'issue du processus, un rapport de diagnostic est généré.

Détection des anomalies : collecte des données de base, telles que l'état des nœuds, l'état des pods et le flux d'événements du cluster, afin d'identifier rapidement les anomalies.
Collecte des données : rassemblement des données contextuelles selon les anomalies détectées. Par exemple, un diagnostic de nœud recueille les informations relatives au nœud dans K8s, les détails de l'instance ECS correspondante et l'état des processus tels que Docker et Kubelet.
Évaluation des éléments de vérification : analyse des métriques clés issues des données collectées pour déterminer leur normalité. Par exemple, les éléments de vérification d'un diagnostic de nœud incluent l'état du processus Docker et l'état ECS. Chaque type de diagnostic dispose d'un ensemble d'éléments de vérification correspondant. Les résultats présentent la liste de ces éléments ainsi qu'une explication pour chacun d'eux.
Analyse des causes racines : exploitation des données collectées et des résultats des vérifications pour identifier automatiquement les causes racines lorsque cela est possible.
Résultats du diagnostic
Les résultats se divisent en deux catégories :
Root cause analysis results : incluent les anomalies détectées, la cause racine identifiée et des suggestions de correction.
Diagnostic item check results : incluent les résultats de chaque élément vérifié. Ces résultats peuvent révéler des causes que l'analyse des causes racines aurait pu manquer.
Les éléments de diagnostic varient selon la configuration du cluster et reflètent votre environnement réel.
Éléments de diagnostic des pods
|
Catégorie |
Description |
|
Diagnostique les problèmes courants des pods, notamment l'état du pod, l'extraction d'images et la connectivité réseau. |
|
|
Diagnostique les problèmes courants des nœuds, y compris l'état du nœud, l'état du réseau, les journaux du noyau, les processus essentiels et la disponibilité des services. |
|
|
Diagnostique les composants essentiels du nœud, notamment les composants réseau et de stockage. |
|
|
Diagnostique les problèmes courants du cluster, notamment la disponibilité du service API, la disponibilité DNS et l'état de la passerelle NAT. |
|
|
Diagnostique les problèmes courants des instances ECS, notamment l'état de l'instance ECS, la connectivité réseau, le système d'exploitation et les E/S disque. |
Pod
|
Paramètre |
Description |
Solution |
|
Nombre de redémarrages du conteneur du pod |
Compte les redémarrages des conteneurs au sein du pod. |
Vérifiez l'état et les journaux du pod. Pour plus d'informations, consultez la rubrique Résolution des problèmes liés aux pods. |
|
Blocage de l'extraction de l'image du conteneur |
Vérifie si d'autres pods sur le même nœud échouent également à extraire les images de conteneur. |
Vérifiez l'état et les journaux du pod. Pour plus d'informations, consultez la rubrique Résolution des problèmes liés aux pods. |
|
Validité des Secrets pour l'extraction d'images |
Vérifie si les Secrets utilisés par le pod pour extraire les images de conteneur sont valides. |
Vérifiez l'état et les journaux du pod. Pour plus d'informations, consultez la rubrique Résolution des problèmes liés aux pods. |
|
Validité des variables d'environnement des pods GPU |
Vérifie si la variable d'environnement NVIDIA_VISIBLE_DEVICES est définie dans le pod, car elle peut entrer en conflit avec kubelet. |
Vérifiez l'état et les journaux du pod. Pour plus d'informations, consultez la rubrique Résolution des problèmes liés aux pods. |
|
Connectivité vers les pods CoreDNS |
Vérifie si le pod peut se connecter aux pods CoreDNS. |
Vérifiez la connectivité réseau entre le pod et les pods CoreDNS. |
|
Connectivité vers le service CoreDNS |
Vérifie si le pod peut se connecter au service CoreDNS. |
Vérifiez la connectivité réseau entre le pod et le service CoreDNS. |
|
Connectivité vers le serveur DNS du réseau hôte |
Vérifie si le pod peut se connecter au serveur DNS du réseau hôte. |
Vérifiez la connectivité réseau entre le pod et le serveur DNS du réseau hôte. |
|
État D des processus du conteneur |
Vérifie si un processus de conteneur se trouve dans l'état D (sommeil ininterruptible). Cet état est généralement causé par un processus en attente d'E/S disque. |
Un processus en état D attend généralement des E/S disque. Essayez de redémarrer l'instance ECS hôte. |
|
État d'initialisation du pod |
Vérifie si le pod a été initialisé avec succès. |
Vérifiez l'état et les journaux du pod. Pour plus d'informations, consultez la rubrique Résolution des problèmes liés aux pods. |
|
Demandes de ressources GPU |
Vérifie si le pod demande des ressources GPU. Cela permet de déterminer si l'absence de demande de ressource empêche le pod d'utiliser un GPU. |
Le pod ne demande pas de ressources GPU. Si des GPU sont requis, vérifiez la configuration du pod. |
|
État de planification du pod |
Vérifie si le pod a été planifié sur un nœud. |
Si le pod n'a pas été planifié, vérifiez sa configuration. |
Nœud
Si le problème persiste après application de la correction suggérée, collectez les journaux du nœud et soumettez un ticket.
| Élément de diagnostic | Ce qu'il détecte | Correction |
|---|---|---|
| Erreurs de connectivité vers le serveur API Kubernetes | Indique si le nœud peut atteindre le serveur API du cluster. Une perte de connectivité empêche le nœud de recevoir les affectations de charge de travail. | Vérifiez la configuration du cluster. Consultez la rubrique Résolution des problèmes des clusters ACK. |
| Blocages des montages AUFS | Indique si des blocages de montage AUFS se produisent sur le nœud. | Soumettez un ticket. |
| Erreurs BufferIOError | Indique la présence d'erreurs BufferIOError dans le noyau du nœud. | Soumettez un ticket. |
| Fuites de cgroup | Indique la présence de fuites de cgroup. Les fuites de cgroup peuvent interrompre la collecte des données de surveillance et provoquer des échecs de démarrage des conteneurs. | Connectez-vous au nœud et supprimez les répertoires cgroup concernés. |
| État anormal du processus chronyd | Indique si le processus chronyd s'exécute normalement. Un processus chronyd anormal perturbe la synchronisation de l'horloge, ce qui affecte les opérations sensibles au temps. | Exécutez systemctl restart chronyd pour redémarrer le processus. |
| Extraction d'images par containerd | Indique si le runtime containerd peut extraire les images comme prévu. | Vérifiez la configuration réseau du nœud et les paramètres des images. |
| État de containerd | Indique si le runtime containerd est en cours d'exécution. | Soumettez un ticket. |
| Disponibilité du pod CoreDNS | Indique si le nœud peut atteindre l'adresse IP du pod CoreDNS. Des pods CoreDNS inaccessibles provoquent des échecs de résolution DNS pour les charges de travail sur ce nœud. | Vérifiez si le nœud peut accéder à l'adresse IP du pod CoreDNS. Consultez la rubrique Que faire si la charge des requêtes DNS n'est pas équilibrée entre les pods CoreDNS ?. |
| État des images | Indique si les images sont intactes. Des images endommagées empêchent le démarrage des conteneurs. | Soumettez un ticket. |
| État overlay2 des images | Indique si le système de fichiers overlay2 dans les images est endommagé. | Soumettez un ticket. |
| Heure système | Indique si l'horloge système est précise. | Aucune. |
| Démarrage des conteneurs Docker | Indique si les conteneurs Docker ne parviennent pas à démarrer. | Soumettez un ticket. |
| Extraction des images Docker | Indique si le nœud peut extraire les images Docker comme prévu. | Vérifiez la configuration réseau du nœud et les paramètres des images. |
| État de Docker | Indique si le runtime Docker est en cours d'exécution. | Soumettez un ticket. |
| Temps de démarrage de Docker | Temps de démarrage de Dockerd. | Aucune. |
| Erreurs de blocage Docker | Indique la présence d'erreurs de blocage Docker sur le nœud. Les blocages Docker peuvent rendre les conteneurs non réactifs. | Exécutez systemctl restart docker pour redémarrer Docker. |
| Existence de l'instance ECS | Indique si l'instance ECS sous-jacente existe. | Vérifiez l'état de l'instance ECS. Consultez la rubrique FAQ sur les nœuds et les pools de nœuds. |
| État de l'instance ECS | Indique si l'instance ECS est dans un état sain. | Vérifiez l'état de l'instance ECS. Consultez la rubrique FAQ sur les nœuds et les pools de nœuds. |
| Erreurs Ext4FsError | Indique la présence d'erreurs Ext4FsError dans le noyau du nœud. | Soumettez un ticket. |
| Système de fichiers du nœud en lecture seule | Indique si le système de fichiers du nœud est passé en mode lecture seule. Cela signale généralement une défaillance du disque et bloque toutes les opérations d'écriture, ce qui affecte les charges de travail. | Exécutez fsck pour réparer le système de fichiers, puis redémarrez le nœud. |
| Heure matérielle | Indique si l'horloge matérielle et l'horloge système sont synchronisées. Une différence supérieure à 2 minutes peut provoquer des erreurs de composants. | Exécutez hwclock --systohc pour synchroniser l'heure système avec l'horloge matérielle. |
| DNS | Indique si les noms de domaine peuvent être résolus sur le nœud. | Consultez la rubrique Résolution des problèmes DNS. |
| Erreurs oops du noyau | Indique la présence d'erreurs oops dans le noyau du nœud. Elles signalent des chemins de code inattendus et peuvent provoquer une instabilité. | Soumettez un ticket. |
| Versions du noyau | Indique si la version du noyau est obsolète. Les noyaux obsolètes peuvent présenter des problèmes de stabilité connus. | Mettez à jour le noyau du nœud. Consultez la rubrique FAQ sur les nœuds et les pools de nœuds. |
| Disponibilité DNS | Indique si le nœud peut atteindre l'adresse IP du cluster du service kube-dns pour utiliser le service DNS du cluster. | Vérifiez l'état et les journaux des pods CoreDNS. Consultez la rubrique Résolution des problèmes DNS. |
| État de kubelet | Indique si kubelet s'exécute normalement. Un kubelet défaillant empêche le nœud de gérer les pods. | Vérifiez les journaux de kubelet. Consultez la rubrique Résolution des problèmes des clusters ACK. |
| Temps de démarrage de kubelet | Temps de démarrage de kubelet. | Aucune. |
| Utilisation du processeur | Indique si l'utilisation du processeur du nœud est excessivement élevée. | Aucune. |
| Utilisation de la mémoire | Indique si l'utilisation de la mémoire du nœud est excessivement élevée. | Aucune. |
| Fragmentation de la mémoire | Indique la présence de fragmentation de la mémoire sur le nœud. La fragmentation réduit la mémoire contiguë et peut dégrader les performances des charges de travail. | Connectez-vous au nœud et exécutez echo 3 \> /proc/sys/vm/drop_caches pour vider le cache. |
| Mémoire swap | Indique si la mémoire swap est activée. Kubernetes exige que la swap soit désactivée ; son activation peut provoquer un comportement inattendu de kubelet. | Connectez-vous au nœud et désactivez la mémoire swap. |
| Chargement des pilotes de périphérique réseau | Indique si les pilotes VirtIO des périphériques réseau sont correctement chargés. | Soumettez un ticket. |
| Utilisation CPU du nœud excessivement élevée | Indique si l'utilisation du processeur a été élevée au cours de la semaine dernière. Si de nombreux pods sont planifiés sur un nœud dont l'utilisation du processeur est constamment élevée, la contention des ressources peut entraîner des interruptions de service. | Définissez les demandes et limites de ressources de manière appropriée pour éviter de surcharger le nœud. |
| Existence de l'IP privée du nœud | Indique si le nœud dispose d'une adresse IP privée attribuée. Sans adresse IP privée, le nœud ne peut pas communiquer au sein du cluster. | Supprimez le nœud du cluster, puis ajoutez-le à nouveau. Ne libérez pas l'instance ECS lors de sa suppression. Consultez les rubriques Supprimer un nœud et Ajouter des instances ECS existantes. |
| Utilisation mémoire du nœud excessivement élevée | Indique si l'utilisation de la mémoire a été élevée au cours de la semaine dernière. Une utilisation élevée de la mémoire combinée à une planification intensive des pods peut provoquer des erreurs d'insuffisance de mémoire (OOM) et des interruptions de service. | Définissez les demandes et limites de ressources de manière appropriée pour éviter de surcharger le nœud. |
| État du nœud | Indique si le nœud est dans l'état Ready. | Redémarrez le nœud. Consultez la rubrique FAQ sur les nœuds et les pools de nœuds. |
| Planifiabilité du nœud | Indique si le nœud est marqué comme non planifiable. Un nœud non planifiable ne reçoit pas de nouvelles affectations de pods. | Vérifiez la configuration de planification du nœud. Consultez la rubrique Drainage des nœuds et état de planification. |
| Erreurs OOM | Indique la présence d'erreurs d'insuffisance de mémoire (OOM) sur le nœud. Les erreurs OOM peuvent entraîner la terminaison des pods et des processus système. | Soumettez un ticket. |
| Vérification du runtime | Indique si le runtime de conteneur du nœud correspond au runtime configuré pour le cluster. Une incompatibilité peut empêcher le démarrage des pods. | Consultez la rubrique Puis-je changer le runtime de conteneur d'un cluster de containerd à Docker ?. |
| Versions du système d'exploitation obsolètes | Indique si la version du système d'exploitation du nœud présente des bogues ou des problèmes de stabilité connus. Les versions obsolètes du système d'exploitation peuvent empêcher le bon fonctionnement des runtimes Docker et containerd. | Mettez à jour la version du système d'exploitation. |
| Accès Internet | Indique si le nœud peut atteindre Internet. | Vérifiez si SNAT est activé pour le cluster. Consultez la rubrique Activer l'accès Internet pour un cluster ACK existant. |
| Erreurs RCUStallError | Indique la présence d'erreurs RCUStallError dans le noyau du nœud. Ces erreurs indiquent qu'un cœur de processeur est bloqué dans une section critique read-copy-update (RCU), ce qui peut figer le nœud. | Soumettez un ticket. |
| Versions du système d'exploitation | Version du système d'exploitation utilisée par le nœud. Les versions obsolètes du système d'exploitation peuvent empêcher le fonctionnement normal du cluster. | Aucune. |
| Fuites de processus runc | Indique la présence de fuites de processus runc. Les fuites de processus runc peuvent amener le nœud à entrer périodiquement dans l'état NotReady. | Identifiez les processus runc orphelins et terminez-les manuellement. |
| Erreurs SoftLockupError | Indique la présence d'erreurs SoftLockupError dans le noyau du nœud. Elles signalent qu'un cœur de processeur ne répond pas aux interruptions, ce qui peut provoquer une instabilité du nœud. | Soumettez un ticket. |
| Blocages systemd | Indique la présence de blocages systemd. Un systemd bloqué peut empêcher le démarrage ou l'arrêt des services, affectant la stabilité du nœud. | Connectez-vous au nœud et exécutez systemctl daemon-reexec pour redémarrer systemd. |
| Versions systemd obsolètes | Indique si la version de systemd présente des bogues connus. Les versions obsolètes peuvent empêcher le bon fonctionnement de Docker et containerd. | Mettez à jour la version de systemd. Consultez la rubrique systemd. |
| Processus bloqués | Indique la présence de processus bloqués sur le nœud. Les processus bloqués consomment des ressources sans avancer et dégradent les performances du nœud. | Soumettez un ticket. |
| Erreurs unregister_netdevice | Indique la présence d'erreurs unregister_netdevice dans le noyau du nœud. Elles peuvent provoquer des fuites de ressources du noyau et une instabilité réseau. | Soumettez un ticket. |
NodeComponent
| Élément de diagnostic | Ce qu'il détecte | Correction |
|---|---|---|
| État du composant CNI | Indique si le plug-in Container Network Interface (CNI) s'exécute comme prévu. Un plug-in CNI défaillant interrompt la mise en réseau des pods sur le nœud. | Vérifiez l'état du composant réseau du cluster. Consultez la rubrique FAQ sur la gestion réseau. |
| État du composant CSI | Indique si le plug-in Container Storage Interface (CSI) s'exécute comme prévu. Un plug-in CSI défaillant empêche les pods de monter des volumes. | Vérifiez l'état du composant de stockage du cluster. Consultez la rubrique FAQ sur CSI. |
ClusterComponent
| Élément de diagnostic | Ce qu'il détecte | Correction |
|---|---|---|
| Version d'aliyun-acr-credential-helper | Indique si la version du composant aliyun-acr-credential-helper est obsolète. | Mettez à jour aliyun-acr-credential-helper. Consultez la rubrique Utiliser le composant aliyun-acr-credential-helper pour extraire des images sans secret. |
| Disponibilité du service API | Indique si le service API du cluster est disponible. Un service API indisponible bloque les opérations de gestion des charges de travail. | Exécutez kubectl get apiservice pour vérifier la disponibilité. En cas d'indisponibilité, exécutez kubectl describe apiservice pour identifier la cause. |
| Nombre insuffisant de blocs CIDR de pod disponibles | Indique si le nombre de blocs CIDR de pod disponibles dans un cluster Flannel est inférieur à cinq. Chaque nœud nécessite un bloc CIDR de pod ; si tous les blocs sont utilisés, les nouveaux nœuds ne peuvent pas rejoindre le cluster. | Soumettez un ticket. |
| Points de terminaison CoreDNS | Nombre de points de terminaison CoreDNS actifs. Un nombre insuffisant de points de terminaison réduit la disponibilité DNS. | Vérifiez l'état et les journaux des pods CoreDNS. Consultez la rubrique Résolution des problèmes DNS. |
| Adresses IP du cluster CoreDNS | Indique si des adresses IP de cluster sont attribuées aux pods CoreDNS. Sans adresse IP de cluster, les requêtes DNS ne peuvent pas atteindre CoreDNS, ce qui provoque des échecs DNS généralisés. | Vérifiez l'état et les journaux des pods CoreDNS. Consultez la rubrique Résolution des problèmes DNS. |
| État de la passerelle NAT | Indique si la passerelle NAT du cluster fonctionne normalement. Une passerelle NAT défaillante bloque le trafic Internet sortant des nœuds sans adresse IP publique. | Connectez-vous à la console NAT Gateway et vérifiez si la passerelle est verrouillée en raison d'impayés. |
| Taux excessivement élevé de pertes de connexions simultanées sur la passerelle NAT | Indique si la passerelle NAT abandonne un taux anormalement élevé de connexions simultanées. Des taux d'abandon élevés indiquent que la passerelle a atteint sa capacité maximale de connexions. | Mettez à niveau la passerelle NAT. Consultez la rubrique FAQ sur la mise à niveau des passerelles NAT Internet standard vers des passerelles NAT Internet améliorées. |
ECSControllerManager
| Élément de diagnostic | Ce qu'il détecte | Correction |
|---|---|---|
| Impayés liés aux composants de l'instance ECS | Indique si le disque ou la bande passante réseau de l'instance est restreint en raison d'impayés. Les ressources restreintes peuvent provoquer des échecs des charges de travail. | Rechargez votre compte pour rétablir l'accès. |
| Impayés liés à l'instance ECS | Indique si l'instance ECS à la demande a été suspendue en raison d'impayés. | Rechargez votre compte, puis redémarrez l'instance. |
| État de la carte réseau de l'instance ECS | Indique si la carte réseau (NIC) de l'instance fonctionne normalement. Une carte réseau anormale entraîne une perte de connectivité réseau. | Redémarrez l'instance. |
| État de démarrage de l'instance ECS | Indique si l'instance peut démarrer normalement. | En cas d'échec du démarrage, créez une nouvelle instance. |
| État du système de gestion backend de l'instance ECS | Indique si le système de gestion backend de l'instance fonctionne normalement. | Redémarrez l'instance. |
| État des processeurs de l'instance ECS | Indique la présence d'une contention de processeur ou d'échecs de liaison de processeur au niveau sous-jacent de l'instance. La contention de processeur peut empêcher l'instance d'acquérir des ressources CPU et dégrader les performances. | Redémarrez l'instance. |
| Verrous fractionnés (split locks) dans les processeurs de l'instance ECS | Indique la présence de verrous fractionnés dans les processeurs de l'instance ECS. Les verrous fractionnés peuvent dégrader sévèrement les performances du processeur. | Consultez la rubrique Détection et gestion des verrous fractionnés. |
| État de l'atténuation DDoS pour l'instance ECS | Indique si l'adresse IP publique de l'instance subit une attaque DDoS. | Souscrivez à un service anti-DDoS. Consultez la rubrique Comparaison des solutions Anti-DDoS d'Alibaba Cloud. |
| Capacités de lecture/écriture limitées du disque cloud | Indique si le débit de lecture/écriture du disque cloud est limité. La limitation se produit lorsque le nombre maximal d'IOPS est atteint, ce qui ralentit ou met en file d'attente les opérations d'E/S. | Consultez la rubrique Performances du stockage par blocs. |
| Chargement du disque de l'instance ECS | Indique si le disque cloud peut être attaché au démarrage de l'instance. | Arrêtez l'instance, puis redémarrez-la. |
| Expiration de l'instance ECS | Indique si l'instance par abonnement a expiré. Une instance expirée est arrêtée et ses ressources deviennent indisponibles. | Renouvelez l'instance. Consultez la rubrique Renouveler une instance par abonnement. |
| Plantages du système d'exploitation de l'instance ECS | Indique si des plantages du système d'exploitation se sont produits au cours des 48 dernières heures. | Consultez les journaux système pour identifier la cause. Consultez la rubrique Afficher les journaux système et les captures d'écran. |
| État de l'hôte de l'instance ECS | Indique si le serveur physique hébergeant l'instance présente des défaillances. Les défaillances de l'hôte peuvent dégrader les performances de l'instance. | Redémarrez l'instance. |
| Chargement de l'image de l'instance ECS | Indique si l'instance peut charger son image lors de l'initialisation. | Redémarrez l'instance. |
| Blocages d'E/S sur le disque de l'instance ECS | Indique la présence de blocages d'E/S sur le disque système. Les blocages d'E/S disque peuvent rendre le système d'exploitation non réactif. | Vérifiez les métriques du disque. Consultez la rubrique Afficher les données de surveillance d'un disque cloud. Pour Alibaba Cloud Linux 2, consultez la rubrique Détecter les blocages d'E/S des systèmes de fichiers et des couches de blocs. |
| Limite supérieure de bande passante de l'instance ECS | Indique si la bande passante totale de l'instance a atteint le maximum autorisé pour son type d'instance. Lorsque la limite est atteinte, le débit réseau est plafonné et des paquets peuvent être perdus. | Passez à un type d'instance offrant une bande passante supérieure. Consultez la rubrique Aperçu des modifications de configuration des instances. |
| Limite supérieure de la bande passante burst de l'instance ECS | Indique si la bande passante burst de l'instance a dépassé le maximum autorisé pour son type d'instance. | Passez à un type d'instance offrant une bande passante supérieure. Consultez la rubrique Aperçu des modifications de configuration des instances. |
| Chargement de la carte réseau de l'instance ECS | Indique si la carte réseau peut être chargée sur l'instance. Si le chargement de la carte réseau échoue, l'instance perd sa connectivité réseau. | Redémarrez l'instance. |
| Établissement de session NIC sur l'instance ECS | Indique si des sessions peuvent être établies vers la carte réseau. Si la carte réseau ne peut pas établir de sessions ou a atteint sa limite de sessions, la connectivité ou le débit réseau est affecté. | Redémarrez l'instance. |
| Opérations clés sur l'instance ECS | Indique si les opérations récentes sur l'instance — telles que le démarrage, l'arrêt ou la mise à niveau — se sont terminées avec succès. | Retentez l'opération ayant échoué. |
| Perte de paquets sur la carte réseau de l'instance ECS | Indique la présence d'une perte de paquets entrants ou sortants sur la carte réseau. La perte de paquets provoque des erreurs réseau et peut perturber les services. | Redémarrez l'instance. |
| Dégradation des performances de l'instance ECS | Indique si les performances de l'instance ont été temporairement dégradées en raison de problèmes logiciels ou matériels. | Consultez les événements historiques ou les journaux système de l'instance pour identifier la cause. Consultez la rubrique Afficher les événements système historiques. |
| Performances compromises de l'instance ECS | Indique si les performances de l'instance sont réduites. Des crédits CPU insuffisants obligent les instances éclatables à revenir à leurs performances de base. | L'instance ECS ne peut fournir que les performances de base en raison de crédits CPU disponibles insuffisants. |
| Redimensionnement du disque de l'instance ECS | Indique si le disque a été redimensionné mais que le système d'exploitation n'a pas encore étendu le système de fichiers. L'espace disque supplémentaire reste indisponible tant que le système de fichiers n'est pas redimensionné. | Le système d'exploitation ne redimensionne pas automatiquement le système de fichiers après le redimensionnement du disque. Si le disque reste inutilisable, redimensionnez-le à nouveau. |
| Demande de ressources de l'instance ECS | Indique si suffisamment de ressources physiques de processeur et de mémoire sont disponibles pour l'instance. Si les ressources sont insuffisantes, l'instance ne peut pas démarrer. | Attendez quelques minutes et essayez de redémarrer l'instance. Si le problème persiste, créez une instance dans une autre région. |
| État du système d'exploitation de l'instance ECS | Indique la présence de paniques du noyau, d'erreurs OOM ou de défaillances internes dans le système d'exploitation de l'instance. Ces problèmes sont souvent causés par des paramètres mal configurés ou des programmes utilisateur. | Redémarrez l'instance. |
| État de virtualisation de l'instance ECS | Indique la présence d'exceptions dans la couche de virtualisation sous-jacente. Celles-ci peuvent amener l'instance à ne plus répondre ou à être suspendue de manière inattendue. | Redémarrez l'instance. |