Este tópico descreve as variáveis e os painéis nos dashboards do plano de controle do Fluid e do cache JindoRuntime. As variáveis do dashboard permitem ajustar dimensões de observabilidade, como intervalo de monitoramento e namespace do conjunto de dados. Os painéis ajudam a avaliar a integridade dos componentes e o desempenho do cache para detectar problemas e oportunidades de otimização antecipadamente.
Painel do plano de controle do Fluid: monitora a integridade e o desempenho dos componentes do plano de controle do Fluid (controlador de conjunto de dados, controlador de runtime, webhook e plug-in CSI).
Painel de cache JindoRuntime do Fluid: monitora a eficiência do cache e o uso de recursos de um sistema de cache JindoRuntime específico.
Detecte falhas de componentes, diagnostique problemas de desempenho do cache e identifique otimizações antes que afetem as cargas de trabalho.
Pré-requisitos
Antes de começar, verifique se:
O Managed Service for Prometheus está ativado para o componente Fluid. Consulte Etapa 2: Visualize o painel do Fluid.
Painel do plano de controle do Fluid
Variáveis do dashboard
As variáveis controlam o escopo e a granularidade dos dados em todos os painéis. Alterar uma variável atualiza todos os painéis relacionados.
|
Variável |
Valores válidos |
Descrição |
|
|
1m, 5m, 10m, 30m, 1h, 6h |
Duração do ciclo de monitoramento. Intervalos menores mostram tendências mais detalhadas; intervalos maiores suavizam picos. |
|
|
0.5, 0.75, 0.90, 0.95, 0.99 |
Percentil para painéis de latência e tempo de processamento. Exemplo: 0.90 = P90. |
|
|
JindoRuntime, AlluxioRuntime, JuiceFSRuntime |
Tipo de runtime a monitorar. Filtra todos os painéis relacionados ao runtime pelo tipo selecionado. |
Tipos de runtime:
JindoRuntime: mecanismo de execução do JindoFS, desenvolvido pela equipe do Alibaba Cloud Elastic MapReduce (EMR). Desenvolvido em C++, oferece gerenciamento de conjuntos de dados, cache e suporte a OSS.
AlluxioRuntime: mecanismo de execução de código aberto Alluxio. Suporta gerenciamento de conjuntos de dados, cache e acesso acelerado a PVCs, Ceph e Cloud Parallel File System (CPFS). Ideal para cenários de nuvem híbrida.
JuiceFSRuntime: mecanismo de aceleração de cache distribuído baseado no JuiceFS. Oferece cache e aceleração específicos para cada cenário. Consulte Introdução ao JuiceFS.
Painéis
Há quatro grupos de painéis. Comece por Component running status para verificar a integridade e investigue Fluid Controller Detailed Indicator ou Fluid webhook detailed indicators para identificar a causa raiz. O grupo Resource usage fornece dados de CPU, memória e rede para todos os pods do controlador.
Component running status
Indica se cada componente do Fluid está em execução e a frequência de reinicialização dos pods. Reinicializações frequentes sinalizam instabilidade.
|
Painel |
Descrição |
|
Dataset Controller Ready Replicas |
Pods do controlador de conjunto de dados no estado Running. Se estiver abaixo da contagem esperada de réplicas, as operações de conjunto de dados podem travar. |
|
History of Dataset controller restarts |
Contagem de reinicializações dos pods do controlador de conjunto de dados. |
|
Runtime Number of ready copies of controller |
Pods do controlador de runtime no estado Running. |
|
History Runtime Controller Restart Times |
Contagem de reinicializações dos pods do controlador de runtime. |
|
Fluid Webhook ready copies |
Pods do webhook do Fluid no estado Running. |
|
Number of historical fluid Webhook restarts |
Contagem de reinicializações dos pods do webhook do Fluid. |
|
Fluid CSI Plug-in Ready Copies |
Pods do plug-in CSI do Fluid no estado Running. |
|
Historical Fluid CSI plug-in restarts |
Contagem de reinicializações dos pods do plug-in CSI do Fluid. |
|
Fluid Component Restart |
Os cinco principais componentes do Fluid por contagem de reinicializações no último ciclo de 2 minutos. Identifica qual componente requer atenção. |
Fluid Controller Detailed Indicator
Métricas internas de desempenho dos controladores de runtime e DataLoad. Verifique estes indicadores quando a reconciliação de conjuntos de dados ficar lenta ou a carga do servidor de API aumentar.
|
Painel |
Descrição |
|
Runtime Controller processing time |
Tempo de processamento do controlador de runtime por ciclo, em valores percentis. Valores consistentemente altos podem indicar sobrecarga. |
|
Number of Runtime controller processing failures |
Tipos e contagens de falhas durante o manuseio de recursos de runtime: falhas de implantação e de verificação de integridade. Valores diferentes de zero exigem investigação. |
|
Runtime Number of controller threads |
Contagem de threads ativas e máximas do controlador de runtime. Se as threads ativas se aproximarem do máximo, o controlador pode sofrer gargalos. |
|
DataLoad Controller Threads |
Contagem de threads ativas e máximas do controlador DataLoad. |
|
Controller Queue Length |
Tamanho da fila de trabalho de cada controlador do Fluid. Uma fila crescente indica atraso na reconciliação pelo controlador. |
|
Total number of Kubernetes API requests |
Total de solicitações de todos os pods do controlador do Fluid para o servidor de API do Kubernetes por ciclo. Picos repentinos podem causar limitação (throttling) no servidor de API. |
|
Runtime Controller Kubernetes API requests |
Solicitações do controlador de runtime para o servidor de API do Kubernetes, agrupadas por código de status HTTP. Altas taxas de erros 4xx ou 5xx apontam para configurações incorretas ou problemas de permissão. |
|
Total time consumed by unfinished processing of controller |
Tempo acumulado gasto por cada controlador do Fluid em tarefas em andamento. Valores persistentemente altos sugerem tarefas travadas. |
Fluid webhook detailed indicators
Monitora o webhook do Fluid, que intercepta solicitações de criação de pod para injetar sidecars FUSE. A latência do webhook afeta diretamente o tempo de inicialização do pod.
|
Painel |
Descrição |
|
Fluid Webhook Pod CPU Usage |
Utilização de CPU de cada pod do webhook do Fluid por ciclo. |
|
Fluid Webhook Pod Memory Usage |
Uso de memória de cada pod do webhook do Fluid por ciclo. |
|
Total number of requests processed in Fluid Webhook |
Total de solicitações processadas pelo webhook do Fluid por ciclo. |
|
The number of requests processed in each Fluid Webhook Pod |
Solicitações por pod do webhook do Fluid por ciclo. Permite identificar desequilíbrio de carga entre réplicas. |
|
Fluid Webhook Request Processing Delay |
Latência de processamento de solicitações do webhook do Fluid, em percentil. Um P99 alto retarda a inicialização de pods em todo o cluster. |
|
Request processing delay of each Fluid Webhook Pod |
Latência de processamento de solicitações por pod, em percentil. Identifica pods lentos que causam latência de cauda. |
Resource usage
Métricas de CPU, memória e rede para todos os pods do controlador do Fluid. Use estes dados para detectar pressão de recursos subjacente a problemas exibidos em outros grupos de painéis.
|
Painel |
Descrição |
|
CPU usage |
Utilização de CPU de cada pod do controlador do Fluid por ciclo. |
|
Memory usage |
Uso de memória de cada pod do controlador do Fluid por ciclo. |
|
Network Send Rate per Pod |
Taxa de transmissão de rede de cada pod do controlador do Fluid por ciclo. |
|
Network Receive Rate per Pod |
Taxa de recebimento de rede de cada pod do controlador do Fluid por ciclo. |
Painel de cache JindoRuntime do Fluid
Variáveis do dashboard
Selecione um conjunto de dados por namespace e nome para defina o escopo de todos os painéis para o sistema de cache desse conjunto de dados.
|
Variável |
Descrição |
|
|
Namespace do conjunto de dados de destino. |
|
|
Nome do conjunto de dados Fluid de destino. |
Painéis
Esta seção contém três grupos de painéis. Comece por Dataset overview para confirme a integridade dos pods de cache e verifique Cache system metrics para analisar a eficiência do cache e a largura de banda. Para problemas no nível FUSE, como alta latência de aplicação, use FUSE metrics para isolar a causa.
Dataset overview
|
Painel |
Descrição |
|
Ready Pod Num |
Contagem de pods prontos por componente (master, worker, FUSE) do sistema de cache selecionado. |
|
Pod Overview |
Informações de pods por componente: contagem de reinicializações (última hora), solicitações e limites de CPU e memória. |
Cache system metrics
Indicadores essenciais de integridade do cache: uso de capacidade, eficácia na entrega de dados e largura de banda fornecida às aplicações.
| Painel | Descrição |
|---|---|
| Cache Capacity Usage (%) | Proporção da capacidade de cache atualmente em uso. |
| Cache Capacity Usage | Capacidade máxima e atual do cache em valores absolutos. |
| Cache Hit Ratio Per Minute | Taxa de acerto de cache por minuto do sistema de cache selecionado. |
| Read Bytes Per Minute | Leituras por minuto divididas em acertos de cache (Cache Hit) e falhas provenientes do armazenamento backend (From Backend). Uma alta parcela de From Backend significa que a maioria das leituras ignora o cache. |
| Cache System Aggregated Bandwidth |
Tráfego total de saída em todas as interfaces de rede dos pods worker. Representa a largura de banda que o sistema de cache entrega às aplicações.
Nota
Se os pods worker executarem na rede do host, este valor pode estar inflado. Para leituras precisas, execute os pods worker na rede de contêineres. |
| Cache Worker Pod Network I/O |
E/S de rede por pod worker.
Nota
Se os pods worker executarem na rede do host, este valor pode estar inflado. Para leituras precisas, execute os pods worker na rede de contêineres. |
| Cache System Pod Memory Usage | Uso de memória dos pods master e worker. Se os workers usarem memória de processo como meio de cache, a capacidade do cache estará incluída. |
| Cache System Pod CPU Usage by Cores | Uso de CPU dos pods master e worker. |
| Aggregated File Operation Requests | Frequência agregada de operações de metadados de arquivo. Apenas GetAttr e ReadDir são contabilizados. |
FUSE metrics (via CSI)
Monitora pods FUSE injetados pelo driver CSI. Verifique estes painéis quando as aplicações relatarem alta latência de acesso a arquivos ou operações lentas de metadados.
| Painel | Descrição |
|---|---|
| FUSE Network I/O |
E/S de rede por pod FUSE.
Nota
Se um pod FUSE executar na rede do host, este valor pode estar inflado. Para leituras precisas, execute os pods FUSE na rede de contêineres. |
| FUSE Memory Usage/Limit (%) | Uso de memória como porcentagem do limite por pod FUSE. Vazio se nenhum limite for definido. |
| FUSE CPU Throttled Percent | Porcentagem de limitação de CPU por pod FUSE. Vazio se nenhum limite for definido. |
| Meta Ops Per Second | Operações de metadados por segundo (GetAttr, ReadDir, Open) por pod FUSE. |
| Meta Ops P99 Latency | Latência P99 das operações de metadados (GetAttr, ReadDir, Open) por pod FUSE. |
| Read/Write Ops Per Second | Operações de leitura/gravação por segundo por pod FUSE. |
| Read/Write Ops P99 Latency | Latência P99 das operações de leitura/gravação por pod FUSE. |
FUSE metrics (via sidecar)
Monitora contêineres sidecar FUSE injetados em pods de aplicação. Equivalente às métricas CSI, mas com escopo restrito aos sidecars.
|
Painel |
Descrição |
|
FUSE Memory Usage/Limit (%) |
Uso de memória como porcentagem do limite por sidecar FUSE. Vazio se nenhum limite for definido. |
|
FUSE CPU Throttled Percent |
Porcentagem de limitação de CPU por sidecar FUSE. Vazio se nenhum limite for definido. |
|
Meta Ops Per Second |
Operações de metadados por segundo (GetAttr, ReadDir, Open) por sidecar FUSE. |
|
Meta Ops P99 Latency |
Latência P99 das operações de metadados (GetAttr, ReadDir, Open) por sidecar FUSE. |
|
Read/Write Ops Per Second |
Operações de leitura/gravação por segundo por sidecar FUSE. |
|
Read/Write Ops P99 Latency |
Latência P99 das operações de leitura/gravação por sidecar FUSE. |