Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Parâmetros do painel do Fluid

Última atualização: Jun 27, 2026

Este tópico descreve as variáveis e os painéis nos dashboards do plano de controle do Fluid e do cache JindoRuntime. As variáveis do dashboard permitem ajustar dimensões de observabilidade, como intervalo de monitoramento e namespace do conjunto de dados. Os painéis ajudam a avaliar a integridade dos componentes e o desempenho do cache para detectar problemas e oportunidades de otimização antecipadamente.

  • Painel do plano de controle do Fluid: monitora a integridade e o desempenho dos componentes do plano de controle do Fluid (controlador de conjunto de dados, controlador de runtime, webhook e plug-in CSI).

  • Painel de cache JindoRuntime do Fluid: monitora a eficiência do cache e o uso de recursos de um sistema de cache JindoRuntime específico.

Detecte falhas de componentes, diagnostique problemas de desempenho do cache e identifique otimizações antes que afetem as cargas de trabalho.

Pré-requisitos

Antes de começar, verifique se:

Painel do plano de controle do Fluid

Variáveis do dashboard

As variáveis controlam o escopo e a granularidade dos dados em todos os painéis. Alterar uma variável atualiza todos os painéis relacionados.

Variável

Valores válidos

Descrição

interval

1m, 5m, 10m, 30m, 1h, 6h

Duração do ciclo de monitoramento. Intervalos menores mostram tendências mais detalhadas; intervalos maiores suavizam picos.

quantile

0.5, 0.75, 0.90, 0.95, 0.99

Percentil para painéis de latência e tempo de processamento. Exemplo: 0.90 = P90.

runtime

JindoRuntime, AlluxioRuntime, JuiceFSRuntime

Tipo de runtime a monitorar. Filtra todos os painéis relacionados ao runtime pelo tipo selecionado.

Tipos de runtime:

  • JindoRuntime: mecanismo de execução do JindoFS, desenvolvido pela equipe do Alibaba Cloud Elastic MapReduce (EMR). Desenvolvido em C++, oferece gerenciamento de conjuntos de dados, cache e suporte a OSS.

  • AlluxioRuntime: mecanismo de execução de código aberto Alluxio. Suporta gerenciamento de conjuntos de dados, cache e acesso acelerado a PVCs, Ceph e Cloud Parallel File System (CPFS). Ideal para cenários de nuvem híbrida.

  • JuiceFSRuntime: mecanismo de aceleração de cache distribuído baseado no JuiceFS. Oferece cache e aceleração específicos para cada cenário. Consulte Introdução ao JuiceFS.

Painéis

Há quatro grupos de painéis. Comece por Component running status para verificar a integridade e investigue Fluid Controller Detailed Indicator ou Fluid webhook detailed indicators para identificar a causa raiz. O grupo Resource usage fornece dados de CPU, memória e rede para todos os pods do controlador.

Component running status

Indica se cada componente do Fluid está em execução e a frequência de reinicialização dos pods. Reinicializações frequentes sinalizam instabilidade.

Painel

Descrição

Dataset Controller Ready Replicas

Pods do controlador de conjunto de dados no estado Running. Se estiver abaixo da contagem esperada de réplicas, as operações de conjunto de dados podem travar.

History of Dataset controller restarts

Contagem de reinicializações dos pods do controlador de conjunto de dados.

Runtime Number of ready copies of controller

Pods do controlador de runtime no estado Running.

History Runtime Controller Restart Times

Contagem de reinicializações dos pods do controlador de runtime.

Fluid Webhook ready copies

Pods do webhook do Fluid no estado Running.

Number of historical fluid Webhook restarts

Contagem de reinicializações dos pods do webhook do Fluid.

Fluid CSI Plug-in Ready Copies

Pods do plug-in CSI do Fluid no estado Running.

Historical Fluid CSI plug-in restarts

Contagem de reinicializações dos pods do plug-in CSI do Fluid.

Fluid Component Restart

Os cinco principais componentes do Fluid por contagem de reinicializações no último ciclo de 2 minutos. Identifica qual componente requer atenção.

Fluid Controller Detailed Indicator

Métricas internas de desempenho dos controladores de runtime e DataLoad. Verifique estes indicadores quando a reconciliação de conjuntos de dados ficar lenta ou a carga do servidor de API aumentar.

Painel

Descrição

Runtime Controller processing time

Tempo de processamento do controlador de runtime por ciclo, em valores percentis. Valores consistentemente altos podem indicar sobrecarga.

Number of Runtime controller processing failures

Tipos e contagens de falhas durante o manuseio de recursos de runtime: falhas de implantação e de verificação de integridade. Valores diferentes de zero exigem investigação.

Runtime Number of controller threads

Contagem de threads ativas e máximas do controlador de runtime. Se as threads ativas se aproximarem do máximo, o controlador pode sofrer gargalos.

DataLoad Controller Threads

Contagem de threads ativas e máximas do controlador DataLoad.

Controller Queue Length

Tamanho da fila de trabalho de cada controlador do Fluid. Uma fila crescente indica atraso na reconciliação pelo controlador.

Total number of Kubernetes API requests

Total de solicitações de todos os pods do controlador do Fluid para o servidor de API do Kubernetes por ciclo. Picos repentinos podem causar limitação (throttling) no servidor de API.

Runtime Controller Kubernetes API requests

Solicitações do controlador de runtime para o servidor de API do Kubernetes, agrupadas por código de status HTTP. Altas taxas de erros 4xx ou 5xx apontam para configurações incorretas ou problemas de permissão.

Total time consumed by unfinished processing of controller

Tempo acumulado gasto por cada controlador do Fluid em tarefas em andamento. Valores persistentemente altos sugerem tarefas travadas.

Fluid webhook detailed indicators

Monitora o webhook do Fluid, que intercepta solicitações de criação de pod para injetar sidecars FUSE. A latência do webhook afeta diretamente o tempo de inicialização do pod.

Painel

Descrição

Fluid Webhook Pod CPU Usage

Utilização de CPU de cada pod do webhook do Fluid por ciclo.

Fluid Webhook Pod Memory Usage

Uso de memória de cada pod do webhook do Fluid por ciclo.

Total number of requests processed in Fluid Webhook

Total de solicitações processadas pelo webhook do Fluid por ciclo.

The number of requests processed in each Fluid Webhook Pod

Solicitações por pod do webhook do Fluid por ciclo. Permite identificar desequilíbrio de carga entre réplicas.

Fluid Webhook Request Processing Delay

Latência de processamento de solicitações do webhook do Fluid, em percentil. Um P99 alto retarda a inicialização de pods em todo o cluster.

Request processing delay of each Fluid Webhook Pod

Latência de processamento de solicitações por pod, em percentil. Identifica pods lentos que causam latência de cauda.

Resource usage

Métricas de CPU, memória e rede para todos os pods do controlador do Fluid. Use estes dados para detectar pressão de recursos subjacente a problemas exibidos em outros grupos de painéis.

Painel

Descrição

CPU usage

Utilização de CPU de cada pod do controlador do Fluid por ciclo.

Memory usage

Uso de memória de cada pod do controlador do Fluid por ciclo.

Network Send Rate per Pod

Taxa de transmissão de rede de cada pod do controlador do Fluid por ciclo.

Network Receive Rate per Pod

Taxa de recebimento de rede de cada pod do controlador do Fluid por ciclo.

Painel de cache JindoRuntime do Fluid

Variáveis do dashboard

Selecione um conjunto de dados por namespace e nome para defina o escopo de todos os painéis para o sistema de cache desse conjunto de dados.

Variável

Descrição

namespace

Namespace do conjunto de dados de destino.

fluid_dataset

Nome do conjunto de dados Fluid de destino.

Painéis

Esta seção contém três grupos de painéis. Comece por Dataset overview para confirme a integridade dos pods de cache e verifique Cache system metrics para analisar a eficiência do cache e a largura de banda. Para problemas no nível FUSE, como alta latência de aplicação, use FUSE metrics para isolar a causa.

Dataset overview

Painel

Descrição

Ready Pod Num

Contagem de pods prontos por componente (master, worker, FUSE) do sistema de cache selecionado.

Pod Overview

Informações de pods por componente: contagem de reinicializações (última hora), solicitações e limites de CPU e memória.

Cache system metrics

Indicadores essenciais de integridade do cache: uso de capacidade, eficácia na entrega de dados e largura de banda fornecida às aplicações.

Painel Descrição
Cache Capacity Usage (%) Proporção da capacidade de cache atualmente em uso.
Cache Capacity Usage Capacidade máxima e atual do cache em valores absolutos.
Cache Hit Ratio Per Minute Taxa de acerto de cache por minuto do sistema de cache selecionado.
Read Bytes Per Minute Leituras por minuto divididas em acertos de cache (Cache Hit) e falhas provenientes do armazenamento backend (From Backend). Uma alta parcela de From Backend significa que a maioria das leituras ignora o cache.
Cache System Aggregated Bandwidth Tráfego total de saída em todas as interfaces de rede dos pods worker. Representa a largura de banda que o sistema de cache entrega às aplicações.
Nota

Se os pods worker executarem na rede do host, este valor pode estar inflado. Para leituras precisas, execute os pods worker na rede de contêineres.

Cache Worker Pod Network I/O E/S de rede por pod worker.
Nota

Se os pods worker executarem na rede do host, este valor pode estar inflado. Para leituras precisas, execute os pods worker na rede de contêineres.

Cache System Pod Memory Usage Uso de memória dos pods master e worker. Se os workers usarem memória de processo como meio de cache, a capacidade do cache estará incluída.
Cache System Pod CPU Usage by Cores Uso de CPU dos pods master e worker.
Aggregated File Operation Requests Frequência agregada de operações de metadados de arquivo. Apenas GetAttr e ReadDir são contabilizados.

FUSE metrics (via CSI)

Monitora pods FUSE injetados pelo driver CSI. Verifique estes painéis quando as aplicações relatarem alta latência de acesso a arquivos ou operações lentas de metadados.

Painel Descrição
FUSE Network I/O E/S de rede por pod FUSE.
Nota

Se um pod FUSE executar na rede do host, este valor pode estar inflado. Para leituras precisas, execute os pods FUSE na rede de contêineres.

FUSE Memory Usage/Limit (%) Uso de memória como porcentagem do limite por pod FUSE. Vazio se nenhum limite for definido.
FUSE CPU Throttled Percent Porcentagem de limitação de CPU por pod FUSE. Vazio se nenhum limite for definido.
Meta Ops Per Second Operações de metadados por segundo (GetAttr, ReadDir, Open) por pod FUSE.
Meta Ops P99 Latency Latência P99 das operações de metadados (GetAttr, ReadDir, Open) por pod FUSE.
Read/Write Ops Per Second Operações de leitura/gravação por segundo por pod FUSE.
Read/Write Ops P99 Latency Latência P99 das operações de leitura/gravação por pod FUSE.

FUSE metrics (via sidecar)

Monitora contêineres sidecar FUSE injetados em pods de aplicação. Equivalente às métricas CSI, mas com escopo restrito aos sidecars.

Painel

Descrição

FUSE Memory Usage/Limit (%)

Uso de memória como porcentagem do limite por sidecar FUSE. Vazio se nenhum limite for definido.

FUSE CPU Throttled Percent

Porcentagem de limitação de CPU por sidecar FUSE. Vazio se nenhum limite for definido.

Meta Ops Per Second

Operações de metadados por segundo (GetAttr, ReadDir, Open) por sidecar FUSE.

Meta Ops P99 Latency

Latência P99 das operações de metadados (GetAttr, ReadDir, Open) por sidecar FUSE.

Read/Write Ops Per Second

Operações de leitura/gravação por segundo por sidecar FUSE.

Read/Write Ops P99 Latency

Latência P99 das operações de leitura/gravação por sidecar FUSE.