Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Ative o monitoramento de componentes do Fluid

Última atualização: Jun 27, 2026

O Fluid é um mecanismo de orquestração e aceleração de conjuntos de dados distribuídos, open source e nativo do Kubernetes, projetado para aplicações com uso intensivo de dados em ambientes cloud native, como big data e IA. Ele oferece uma abstração unificada de conjuntos de dados, plugins extensíveis de mecanismos de dados, operações automatizadas, aceleração de dados de uso geral e independência de runtime. O Managed Service for Prometheus permite instalar componentes do Fluid com um clique e inclui painéis de monitoramento prontos para uso. Este tópico explica como usar o Managed Service for Prometheus para monitorar o Fluid.

Pré-requisitos

  • O Managed Service for Prometheus está ativado no seu cluster ACK ou cluster ACK Serverless. Para mais informações, consulte Managed Service for Prometheus.

  • O pacote de IA cloud native está implantado e a aceleração de dados do Fluid está ativada. Para mais informações, consulte Implantar o pacote de IA cloud native.

    • Para usar todos os recursos do painel do plano de controle do Fluid, verifique se a versão 0.9.7 ou posterior do ack-fluid está em execução no cluster.

    • Para usar todos os recursos do painel do sistema de cache JindoRuntime do Fluid, verifique se a versão 1.0.11 ou posterior do ack-fluid está em execução no cluster.

Limitações

O painel do sistema de cache monitora apenas componentes de runtime de cache JindoRuntime (que usam o mecanismo de cache JindoCache).

Etapa 1: Integrar o Fluid

  1. Faça login no console ARMS.

  2. No painel de navegação à esquerda, clique em integration center. Na seção artificial intelligence, clique no cartão Fluid.

  3. Na página Fluid, na seção select container service cluster, selecione o cluster desejado. Se o componente Fluid já estiver instalado, não será necessário reinstalá-lo.

  4. Na seção Configuration Information, defina os parâmetros e clique em OK.

    Parâmetro

    Descrição

    integration name (optional)

    Nome exclusivo para a instância de monitoramento do Fluid. Você pode deixar este campo em branco.

    metric collection interval (s)

    Intervalo para coleta de métricas.

  5. Visualize os componentes integrados na página integration management no console ARMS.

    1. Faça login no console ARMS.

    2. No painel de navegação à esquerda, clique em integration management. Na aba integrated components, clique no cartão Fluid.

    3. Na aba environment list, clique em View Details na coluna Actions do cluster desejado para visualizar detalhes, como o componente Fluid e as regras de alerta do painel.

Etapa 2: Visualizar painéis do Fluid

Console ACK

  1. Faça login no console ACK. No painel de navegação à esquerda, clique em Clusters.

  2. Na página Clusters, clique no cluster ACK ou cluster ACK Serverless que contém o componente Fluid. No painel de navegação à esquerda, escolha Operations > Prometheus Monitoring.

  3. Na página Prometheus Monitoring, escolha Others para visualizar o painel do plano de controle do Fluid.

    O painel exibe métricas do Prometheus Monitoring, incluindo status de execução dos componentes do Fluid, latência de processamento do controlador, QPS e latência das requisições webhook, além do uso de recursos de cada componente. Para mais informações, consulte Parâmetros do painel de monitoramento do Fluid.

    • A seção Component Running Status mostra a quantidade de pods prontos, o histórico de reinicializações e os horários de reinício dos componentes do plano de controle do Fluid.组件运行状态

    • A seção Fluid Controller Detailed Metrics apresenta o nível de carga de trabalho, falhas de processamento e requisições à API do Kubernetes do controlador do Fluid.控制器详细指标

    • A seção Fluid Webhook Detailed Metrics exibe o uso de recursos, a quantidade de requisições processadas e a latência de processamento do webhook do Fluid.webhook详细指标

    • A seção Resource Usage detalha o consumo de recursos e as taxas de tráfego de rede de todos os componentes do plano de controle do Fluid.资源使用

  4. Na página Prometheus Monitoring, escolha Others para acessar o painel do sistema de cache JindoRuntime do Fluid.

    O painel do sistema de cache JindoRuntime do Fluid exibe detalhes sobre esse sistema, incluindo visão geral do conjunto de dados, métricas do sistema de cache e métricas do cliente FUSE. Para mais informações, consulte Parâmetros do painel de monitoramento do Fluid.

    • A seção Dataset Overview fornece um resumo do conjunto de dados Fluid selecionado. Ela inclui a quantidade de pods dos componentes Master, Worker e FUSE em execução no sistema de cache, bem como a configuração de recursos de cada pod.

      image

    • A seção Cache System Metrics apresenta métricas do lado do servidor para o sistema de cache selecionado. Os dados abrangem capacidade de cache utilizada, taxa de acerto, largura de banda agregada e QPS para operações de metadados.

      image

    • A seção FUSE Metrics (via CSI) mostra métricas do lado do cliente para sistemas de arquivos FUSE montados com o plugin CSI do Fluid em pods FUSE. As métricas incluem I/O de rede, latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita para cada pod FUSE.

      image

    • A seção FUSE Metrics (via Sidecar) exibe métricas do lado do cliente para sistemas de arquivos FUSE montados em containers sidecar FUSE do Fluid. Isso inclui latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita.

      image

Console ARMS

  1. Faça login no console ARMS.

  2. No painel de navegação à esquerda, clique em Integration Center. Na seção Component Type, selecione Fluid, clique na aba Dashboard e, em seguida, clique em Fluid Control Plane na parte inferior da página para visualizar o painel do plano de controle do Fluid.

    O painel exibe métricas do Prometheus Monitoring, incluindo status de execução dos componentes do Fluid, latência de processamento do controlador, QPS e latência das requisições webhook, além do uso de recursos de cada componente. Para mais informações, consulte Parâmetros do painel de monitoramento do Fluid.

    • A seção Component Running Status mostra a quantidade de pods prontos, o histórico de reinicializações e os horários de reinício dos componentes do plano de controle do Fluid.

    • A seção Fluid Controller Detailed Metrics apresenta o nível de carga de trabalho, falhas de processamento e requisições à API do Kubernetes do controlador do Fluid.

    • A seção Fluid Webhook Detailed Metrics exibe o uso de recursos, a quantidade de requisições processadas e a latência de processamento do webhook do Fluid.

    • A seção Resource Usage detalha o consumo de recursos e as taxas de tráfego de rede de todos os componentes do plano de controle do Fluid.

  3. No painel de navegação à esquerda, clique em Integration Center. Na seção Component Type, selecione Fluid, clique na aba Dashboard e, em seguida, clique em Fluid JindoRuntime Dashboard na parte inferior da página para visualizar o painel do sistema de cache JindoRuntime do Fluid.

    • A seção Dataset Overview fornece um resumo do conjunto de dados Fluid selecionado. Ela inclui a quantidade de pods dos componentes Master, Worker e FUSE em execução no sistema de cache, bem como a configuração de recursos de cada pod.

    • A seção Cache System Metrics apresenta métricas do lado do servidor para o sistema de cache selecionado. Os dados abrangem capacidade de cache utilizada, taxa de acerto, largura de banda agregada e QPS para operações de metadados.

    • A seção FUSE Metrics (via CSI) mostra métricas do lado do cliente para sistemas de arquivos FUSE montados com o plugin CSI do Fluid em pods FUSE. As métricas incluem I/O de rede, latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita para cada pod FUSE.

    • A seção FUSE Metrics (via Sidecar) exibe métricas do lado do cliente para sistemas de arquivos FUSE montados em containers sidecar FUSE do Fluid. Isso inclui latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita.

Métricas

A tabela a seguir lista as métricas usadas pelos componentes do plano de controle do Fluid.

Métrica

Tipo

Descrição

dataset_ufs_total_size

Gauge

Tamanho total dos conjuntos de dados montados por recursos Dataset ativos no cluster.

dataset_ufs_file_num

Gauge

Quantidade de arquivos nos conjuntos de dados montados por recursos Dataset ativos no cluster.

runtime_setup_error_total

Counter

Total de falhas em operações de configuração de runtime durante a reconciliação do controlador.

runtime_sync_healthcheck_error_total

Counter

Total de falhas em operações de verificação de integridade do runtime durante a reconciliação do controlador.

controller_runtime_reconcile_time_seconds_bucket

Histogram

Duração do loop de reconciliação do controlador.

controller_runtime_reconcile_errors_total

Counter

Total de falhas na reconciliação do controlador.

controller_runtime_reconcile_total

Counter

Total de loops de reconciliação do controlador concluídos.

controller_runtime_max_concurrent_reconciles

Gauge

Número máximo de corrotinas de reconciliação disponíveis no controlador.

controller_runtime_active_workers

Gauge

Quantidade de corrotinas de reconciliação ativas no momento no controlador.

workqueue_adds_total

Counter

Total de eventos de adição processados pela fila de trabalho do controlador.

workqueue_depth

Gauge

Profundidade atual da fila de trabalho do controlador.

workqueue_queue_duration_seconds_bucket

Histogram

Tempo que um item permanece aguardando na fila de trabalho do controlador antes de ser processado.

workqueue_work_duration_seconds_bucket

Histogram

Distribuição do tempo gasto para processar itens da fila de trabalho.

workqueue_unfinished_work_seconds

Gauge

Duração total das tarefas inacabadas em processamento pela fila de trabalho.

workqueue_longest_running_processor_seconds

Gauge

Maior tempo de processamento registrado para uma única tarefa.

rest_client_requests_total

Counter

Quantidade de requisições HTTP, divididas por código de status, método e host.

rest_client_request_duration_seconds_bucket

Histogram

Latência das requisições HTTP, dividida por verbo e URL.

controller_runtime_webhook_requests_in_flight

Gauge

Quantidade de requisições webhook em processamento.

controller_runtime_webhook_requests_total

Counter

Total de requisições processadas pelo webhook.

controller_runtime_webhook_latency_seconds_bucket

Histogram

Latência das requisições processadas pelo webhook.

process_cpu_seconds_total

Counter

Tempo total de CPU consumido pelo processo, em segundos.

process_resident_memory_bytes

Gauge

Tamanho da memória residente do processo, em bytes.

A tabela abaixo lista as métricas expostas pelo servidor JindoCache para o painel de cache JindoRuntime do Fluid.

Métrica

Tipo

Descrição

jindocache_server_total_stsnodes_num

Gauge

Quantidade de réplicas ativas do componente worker no cache distribuído.

jindocache_server_total_disk_cap

Gauge

Capacidade máxima de cache para mídias baseadas em disco (incluindo discos RAM como tmpfs) no cache distribuído.

jindocache_server_total_used_disk_cap

Gauge

Espaço total de cache usado em mídias baseadas em disco (incluindo discos RAM como tmpfs) no cache distribuído.

jindocache_server_total_mem_cap

Gauge

Capacidade máxima de cache armazenada na memória do processo dentro do cache distribuído.

jindocache_server_total_used_mem_cap

Gauge

Espaço total de cache usado na memória do processo dentro do cache distribuído.

jindocache_server_total_used_rocksdb_cap

Gauge

Capacidade do RocksDB usada no cache distribuído.

jindocache_server_backend_read_bytes_total

Gauge

Volume total de dados lidos do armazenamento de backend durante buscas na source, em bytes.

Uma busca na source ocorre quando os dados solicitados não são encontrados no cache distribuído JindoCache e precisam ser recuperados do sistema de armazenamento de backend.

jindocache_server_backend_read_time_total

Gauge

Tempo total gasto lendo dados do armazenamento de backend durante buscas na source, em microssegundos.

jindocache_server_backend_readop_num_total

Gauge

Total de operações de leitura do armazenamento de backend durante buscas na source. Esta contagem corresponde ao número de blocos no JindoCache.

jindocache_server_backend_read_bytes_time_total_window

Gauge

Tempo gasto lendo dados do armazenamento de backend durante buscas na source dentro de uma janela de um minuto, em microssegundos.

jindocache_server_backend_read_bytes_total_window

Gauge

Volume total de dados lidos do armazenamento de backend durante buscas na source dentro de uma janela de um minuto, em bytes.

jindocache_server_remote_read_bytes_total

Gauge

Volume total de dados lidos a partir de acertos de cache remoto no mesmo cluster, em bytes.

Um acerto de cache remoto ocorre quando os dados solicitados estão no cache distribuído JindoCache, mas em um nó diferente da aplicação.

jindocache_server_remote_read_time_total

Gauge

Tempo total gasto em operações de leitura de acertos de cache remoto no mesmo cluster, em microssegundos.

jindocache_server_remote_readop_num_total

Gauge

Total de operações de leitura de acertos de cache remoto no mesmo cluster.

jindocache_server_remote_read_bytes_time_total_window

Gauge

Tempo gasto em operações de leitura de acertos de cache remoto dentro de uma janela de um minuto, em microssegundos.

jindocache_server_remote_read_bytes_total_window

Gauge

Volume total de dados lidos a partir de acertos de cache remoto dentro de uma janela de um minuto, em bytes.

jindocache_server_local_read_bytes_total

Gauge

Volume total de dados lidos a partir de acertos de cache local no mesmo cluster, em bytes.

Um acerto de cache local ocorre quando os dados solicitados estão no cache distribuído JindoCache no mesmo nó da aplicação.

jindocache_server_local_read_time_total

Gauge

Tempo total gasto em operações de leitura de acertos de cache local no mesmo cluster, em microssegundos.

jindocache_server_local_readop_num_total

Gauge

Total de operações de leitura de acertos de cache local no mesmo cluster.

jindocache_server_local_read_bytes_time_total_window

Gauge

Tempo gasto em operações de leitura de acertos de cache local dentro de uma janela de um minuto, em microssegundos.

jindocache_server_local_read_bytes_total_window

Gauge

Volume total de dados lidos a partir de acertos de cache local dentro de uma janela de um minuto, em bytes.

jindocache_server_ns_filelet_op_count_total

Gauge

Total de operações de metadados de arquivo (incluindo getAttr e listStatus) rastreadas pelo componente master do JindoCache.

jindocache_server_ns_filelet_op_time_total

Gauge

Tempo total gasto processando operações de metadados de arquivo (incluindo getAttr e listStatus) pelo componente master do JindoCache.

jindocache_server_ns_get_attr_op_total

Gauge

Total de operações getAttr rastreadas pelo componente master do JindoCache.

jindocache_server_ns_get_attr_time_total

Gauge

Tempo total gasto processando operações getAttr pelo componente master do JindoCache.

jindocache_server_ns_get_attr_fallback_op_total

Gauge

Total de vezes que o componente master do JindoCache realizou uma busca na source no armazenamento de backend para recuperar metadados de arquivo.

jindocache_server_ns_list_status_op_total

Gauge

Total de operações listStatus rastreadas pelo componente master do JindoCache.

jindocache_server_ns_list_status_time_total

Gauge

Tempo total gasto processando operações listStatus pelo componente master do JindoCache.

jindocache_server_ns_list_status_fallback_op_total

Gauge

Total de vezes que o componente master do JindoCache realizou uma busca na source no sistema de armazenamento de backend para recuperar uma lista de arquivos.

jindocache_server_dist_get_attr_op_num_total

Gauge

Total de operações getAttr rastreadas pelo cliente JindoCache.

jindocache_server_dist_get_attr_time_total

Gauge

Tempo total gasto processando operações getAttr pelo cliente JindoCache.

jindocache_server_dist_list_dir_op_num_total

Gauge

Total de operações de listagem de diretório rastreadas pelo cliente JindoCache.

jindocache_server_dist_list_dir_time_total

Gauge

Tempo total gasto processando operações de listagem de diretório pelo cliente JindoCache.

A tabela seguinte lista as métricas expostas pelo cliente FUSE do JindoCache para o painel de cache JindoRuntime do Fluid.

Métrica

Tipo

Descrição

jindo_fuse_open_count

Gauge

Quantidade de operações open realizadas pelo cliente Jindo FUSE.

jindo_fuse_open_latency

Gauge

Latência P50 (percentil 50) das operações open do cliente Jindo FUSE.

jindo_fuse_open_latency_80

Gauge

Latência P80 (percentil 80) das operações open do cliente Jindo FUSE.

jindo_fuse_open_latency_90

Gauge

Latência P90 (percentil 90) das operações open do cliente Jindo FUSE.

jindo_fuse_open_latency_99

Gauge

Latência P99 (percentil 99) das operações open do cliente Jindo FUSE.

jindo_fuse_open_latency_999

Gauge

Latência P99,9 (percentil 99,9) das operações open do cliente Jindo FUSE.

jindo_fuse_open_latency_9999

Gauge

Latência P99,99 (percentil 99,99) das operações open do cliente Jindo FUSE.

jindo_fuse_getattr_count

Gauge

Quantidade de operações getAttr realizadas pelo cliente Jindo FUSE.

jindo_fuse_getattr_latency

Gauge

Latência P50 (percentil 50) das operações getAttr do cliente Jindo FUSE.

jindo_fuse_getattr_latency_80

Gauge

Latência P80 (percentil 80) das operações getAttr do cliente Jindo FUSE.

jindo_fuse_getattr_latency_90

Gauge

Latência P90 (percentil 90) das operações getAttr do cliente Jindo FUSE.

jindo_fuse_getattr_latency_99

Gauge

Latência P99 (percentil 99) das operações getAttr do cliente Jindo FUSE.

jindo_fuse_getattr_latency_999

Gauge

Latência P99,9 (percentil 99,9) das operações getAttr do cliente Jindo FUSE.

jindo_fuse_getattr_latency_9999

Gauge

Latência P99,99 (percentil 99,99) das operações getAttr do cliente Jindo FUSE.

jindo_fuse_readdir_count

Gauge

Quantidade de operações readdir realizadas pelo cliente Jindo FUSE.

jindo_fuse_readdir_latency

Gauge

Latência P50 (percentil 50) das operações readdir do cliente Jindo FUSE.

jindo_fuse_readdir_latency_80

Gauge

Latência P80 (percentil 80) das operações readdir do cliente Jindo FUSE.

jindo_fuse_readdir_latency_90

Gauge

Latência P90 (percentil 90) das operações readdir do cliente Jindo FUSE.

jindo_fuse_readdir_latency_99

Gauge

Latência P99 (percentil 99) das operações readdir do cliente Jindo FUSE.

jindo_fuse_readdir_latency_999

Gauge

Latência P99,9 (percentil 99,9) das operações readdir do cliente Jindo FUSE.

jindo_fuse_readdir_latency_9999

Gauge

Latência P99,99 (percentil 99,99) das operações readdir do cliente Jindo FUSE.

jindo_fuse_read_count

Gauge

Quantidade de operações read realizadas pelo cliente Jindo FUSE.

jindo_fuse_read_latency

Gauge

Latência P50 (percentil 50) das operações read do cliente Jindo FUSE.

jindo_fuse_read_latency_80

Gauge

Latência P80 (percentil 80) das operações read do cliente Jindo FUSE.

jindo_fuse_read_latency_90

Gauge

Latência P90 (percentil 90) das operações read do cliente Jindo FUSE.

jindo_fuse_read_latency_99

Gauge

Latência P99 (percentil 99) das operações read do cliente Jindo FUSE.

jindo_fuse_read_latency_999

Gauge

Latência P99,9 (percentil 99,9) das operações read do cliente Jindo FUSE.

jindo_fuse_read_latency_9999

Gauge

Latência P99,99 (percentil 99,99) das operações read do cliente Jindo FUSE.

jindo_fuse_write_count

Gauge

Quantidade de operações write realizadas pelo cliente Jindo FUSE.

jindo_fuse_write_latency

Gauge

Latência P50 (percentil 50) das operações write do cliente Jindo FUSE.

jindo_fuse_write_latency_80

Gauge

Latência P80 (percentil 80) das operações write do cliente Jindo FUSE.

jindo_fuse_write_latency_90

Gauge

Latência P90 (percentil 90) das operações write do cliente Jindo FUSE.

jindo_fuse_write_latency_99

Gauge

Latência P99 (percentil 99) das operações write do cliente Jindo FUSE.

jindo_fuse_write_latency_999

Gauge

Latência P99,9 (percentil 99,9) das operações write do cliente Jindo FUSE.

jindo_fuse_write_latency_9999

Gauge

Latência P99,99 (percentil 99,99) das operações write do cliente Jindo FUSE.

Referências