Quelles métriques surveiller ?
Surveillez les métriques suivantes en fonction de votre type d'instance.
Reserved instances
| Métrique | Ce qu'elle mesure | Pourquoi c'est important |
|---|---|---|
instance_disk_capacity(%) |
Utilisation du disque sur l'ensemble de l'instance | Une utilisation élevée du disque peut entraîner des échecs de production de messages. Surveillez cette valeur pour éviter la saturation du stockage. |
InstanceInternetRxUtilizationByNode(%) |
Utilisation de la bande passante Internet entrante par nœud | Des valeurs élevées soutenues indiquent qu'un nœud approche sa limite de bande passante, ce qui peut provoquer des retards de message. |
InstanceInternetTxUtilizationByNode(%) |
Utilisation de la bande passante Internet sortante par nœud | Des valeurs élevées soutenues indiquent qu'un nœud approche sa limite de bande passante, ce qui peut ralentir le débit des consommateurs. |
Proportion of Production Traffic in Instance Type(%) |
Débit de production par rapport à la limite spécifiée de l'instance | Des valeurs proches de 100 % signifient que vous approchez le plafond de débit de production pour la spécification de votre instance. |
Proportion of Consumption Traffic in Instance Type(%) |
Débit de consommation par rapport à la limite spécifiée de l'instance | Des valeurs proches de 100 % signifient que vous approchez le plafond de débit de consommation pour la spécification de votre instance. |
Proportion of Partitions in Instance Type(%) |
Nombre de partitions par rapport à la limite spécifiée de l'instance | Des valeurs proches de 100 % indiquent que vous devez mettre à niveau la spécification de l'instance ou réduire le nombre de partitions. |
Serverless instances
| Métrique | Ce qu'elle mesure | Pourquoi c'est important |
|---|---|---|
InstanceMessageInputRatioV3(%) |
Taux d'entrée des messages en pourcentage de la capacité | Indique à quel point la production de messages sur l'ensemble de l'instance est proche de la limite de capacité. |
InstanceMessageOutputRatioV3(%) |
Taux de sortie des messages en pourcentage de la capacité | Indique à quel point la consommation de messages sur l'ensemble de l'instance est proche de la limite de capacité. |
InstanceMaxNodeInputRatioV3(%) |
Taux d'entrée maximal sur le nœud le plus sollicité | Identifie les nœuds critiques. Surveillez cette valeur pour détecter une répartition inégale de la charge entre les nœuds. |
InstanceMaxNodeOutputRatioV3(%) |
Taux de sortie maximal sur le nœud le plus sollicité | Identifie les nœuds critiques. Surveillez cette valeur pour détecter une répartition inégale de la charge entre les nœuds. |
Pourquoi certaines valeurs de métriques sont-elles inexactes ?
Trois causes courantes :
Faible volume de trafic. Le système calcule chaque valeur de métrique selon une formule spécifique. Lorsque le trafic est faible, de petites fluctuations produisent des écarts disproportionnés dans le résultat calculé.
Version obsolète du client. Les anciennes bibliothèques clientes Kafka omettent certains paramètres dont dépend le système de surveillance, ce qui fausse les valeurs rapportées. Mettez à jour vers la dernière version du client pour corriger ce problème.
Compression des données. Les producteurs compressent les données pour répondre à des exigences spécifiques de transmission ou de stockage. Cela peut entraîner des écarts dans les données de surveillance.
Pourquoi InstanceMessageOutput ou TopicMessageOutput affichent-ils zéro alors que InstanceReqsOutput ou TopicReqsOutput sont supérieurs à zéro ?
Il s'agit d'un comportement normal, et non d'une erreur. Cela se produit lorsque des consommateurs sont actifs, mais qu'aucun nouveau message n'a été publié sur le broker.
Les consommateurs Kafka interrogent continuellement le broker pour vérifier la présence de nouveaux messages, même lorsqu'il n'y en a pas. Chaque interrogation est enregistrée comme une demande de consommation, si bien que InstanceReqsOutput et TopicReqsOutput augmentent à chaque tentative. Comme aucun message n'est effectivement livré, InstanceMessageOutput et TopicMessageOutput restent à zéro.
Exemple : Supposons qu'aucun producteur ne publie de messages tandis qu'un groupe de consommateurs interroge le broker 50 fois. TopicReqsOutput affiche 50, mais TopicMessageOutput affiche 0. Dès qu'un producteur recommence à publier, les deux métriques commencent à augmenter simultanément.
