O Fluid é um mecanismo de orquestração e aceleração de conjuntos de dados distribuídos, open source e nativo do Kubernetes, projetado para aplicações com uso intensivo de dados em ambientes cloud native, como big data e IA. Ele oferece uma abstração unificada de conjuntos de dados, plugins extensíveis de mecanismos de dados, operações automatizadas, aceleração de dados de uso geral e independência de runtime. O Managed Service for Prometheus permite instalar componentes do Fluid com um clique e inclui painéis de monitoramento prontos para uso. Este tópico explica como usar o Managed Service for Prometheus para monitorar o Fluid.
Pré-requisitos
O Managed Service for Prometheus está ativado no seu cluster ACK ou cluster ACK Serverless. Para mais informações, consulte Managed Service for Prometheus.
-
O pacote de IA cloud native está implantado e a aceleração de dados do Fluid está ativada. Para mais informações, consulte Implantar o pacote de IA cloud native.
Para usar todos os recursos do painel do plano de controle do Fluid, verifique se a versão 0.9.7 ou posterior do ack-fluid está em execução no cluster.
Para usar todos os recursos do painel do sistema de cache JindoRuntime do Fluid, verifique se a versão 1.0.11 ou posterior do ack-fluid está em execução no cluster.
Limitações
O painel do sistema de cache monitora apenas componentes de runtime de cache JindoRuntime (que usam o mecanismo de cache JindoCache).
Etapa 1: Integrar o Fluid
Faça login no console ARMS.
No painel de navegação à esquerda, clique em integration center. Na seção artificial intelligence, clique no cartão Fluid.
Na página Fluid, na seção select container service cluster, selecione o cluster desejado. Se o componente Fluid já estiver instalado, não será necessário reinstalá-lo.
-
Na seção Configuration Information, defina os parâmetros e clique em OK.
Parâmetro
Descrição
integration name (optional)
Nome exclusivo para a instância de monitoramento do Fluid. Você pode deixar este campo em branco.
metric collection interval (s)
Intervalo para coleta de métricas.
-
Visualize os componentes integrados na página integration management no console ARMS.
Faça login no console ARMS.
No painel de navegação à esquerda, clique em integration management. Na aba integrated components, clique no cartão Fluid.
Na aba environment list, clique em View Details na coluna Actions do cluster desejado para visualizar detalhes, como o componente Fluid e as regras de alerta do painel.
Etapa 2: Visualizar painéis do Fluid
Console ACK
Faça login no console ACK. No painel de navegação à esquerda, clique em Clusters.
Na página Clusters, clique no cluster ACK ou cluster ACK Serverless que contém o componente Fluid. No painel de navegação à esquerda, escolha .
-
Na página Prometheus Monitoring, escolha para visualizar o painel do plano de controle do Fluid.
O painel exibe métricas do Prometheus Monitoring, incluindo status de execução dos componentes do Fluid, latência de processamento do controlador, QPS e latência das requisições webhook, além do uso de recursos de cada componente. Para mais informações, consulte Parâmetros do painel de monitoramento do Fluid.
A seção Component Running Status mostra a quantidade de pods prontos, o histórico de reinicializações e os horários de reinício dos componentes do plano de controle do Fluid.

A seção Fluid Controller Detailed Metrics apresenta o nível de carga de trabalho, falhas de processamento e requisições à API do Kubernetes do controlador do Fluid.

A seção Fluid Webhook Detailed Metrics exibe o uso de recursos, a quantidade de requisições processadas e a latência de processamento do webhook do Fluid.

A seção Resource Usage detalha o consumo de recursos e as taxas de tráfego de rede de todos os componentes do plano de controle do Fluid.

-
Na página Prometheus Monitoring, escolha para acessar o painel do sistema de cache JindoRuntime do Fluid.
O painel do sistema de cache JindoRuntime do Fluid exibe detalhes sobre esse sistema, incluindo visão geral do conjunto de dados, métricas do sistema de cache e métricas do cliente FUSE. Para mais informações, consulte Parâmetros do painel de monitoramento do Fluid.
-
A seção Dataset Overview fornece um resumo do conjunto de dados Fluid selecionado. Ela inclui a quantidade de pods dos componentes Master, Worker e FUSE em execução no sistema de cache, bem como a configuração de recursos de cada pod.

-
A seção Cache System Metrics apresenta métricas do lado do servidor para o sistema de cache selecionado. Os dados abrangem capacidade de cache utilizada, taxa de acerto, largura de banda agregada e QPS para operações de metadados.

-
A seção FUSE Metrics (via CSI) mostra métricas do lado do cliente para sistemas de arquivos FUSE montados com o plugin CSI do Fluid em pods FUSE. As métricas incluem I/O de rede, latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita para cada pod FUSE.

-
A seção FUSE Metrics (via Sidecar) exibe métricas do lado do cliente para sistemas de arquivos FUSE montados em containers sidecar FUSE do Fluid. Isso inclui latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita.

-
Console ARMS
Faça login no console ARMS.
-
No painel de navegação à esquerda, clique em Integration Center. Na seção Component Type, selecione Fluid, clique na aba Dashboard e, em seguida, clique em Fluid Control Plane na parte inferior da página para visualizar o painel do plano de controle do Fluid.
O painel exibe métricas do Prometheus Monitoring, incluindo status de execução dos componentes do Fluid, latência de processamento do controlador, QPS e latência das requisições webhook, além do uso de recursos de cada componente. Para mais informações, consulte Parâmetros do painel de monitoramento do Fluid.
A seção Component Running Status mostra a quantidade de pods prontos, o histórico de reinicializações e os horários de reinício dos componentes do plano de controle do Fluid.
A seção Fluid Controller Detailed Metrics apresenta o nível de carga de trabalho, falhas de processamento e requisições à API do Kubernetes do controlador do Fluid.
A seção Fluid Webhook Detailed Metrics exibe o uso de recursos, a quantidade de requisições processadas e a latência de processamento do webhook do Fluid.
A seção Resource Usage detalha o consumo de recursos e as taxas de tráfego de rede de todos os componentes do plano de controle do Fluid.
-
No painel de navegação à esquerda, clique em Integration Center. Na seção Component Type, selecione Fluid, clique na aba Dashboard e, em seguida, clique em Fluid JindoRuntime Dashboard na parte inferior da página para visualizar o painel do sistema de cache JindoRuntime do Fluid.
A seção Dataset Overview fornece um resumo do conjunto de dados Fluid selecionado. Ela inclui a quantidade de pods dos componentes Master, Worker e FUSE em execução no sistema de cache, bem como a configuração de recursos de cada pod.
A seção Cache System Metrics apresenta métricas do lado do servidor para o sistema de cache selecionado. Os dados abrangem capacidade de cache utilizada, taxa de acerto, largura de banda agregada e QPS para operações de metadados.
A seção FUSE Metrics (via CSI) mostra métricas do lado do cliente para sistemas de arquivos FUSE montados com o plugin CSI do Fluid em pods FUSE. As métricas incluem I/O de rede, latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita para cada pod FUSE.
A seção FUSE Metrics (via Sidecar) exibe métricas do lado do cliente para sistemas de arquivos FUSE montados em containers sidecar FUSE do Fluid. Isso inclui latência e QPS de operações de metadados, além de latência e QPS de operações de leitura e escrita.
Métricas
A tabela a seguir lista as métricas usadas pelos componentes do plano de controle do Fluid.
|
Métrica |
Tipo |
Descrição |
|
dataset_ufs_total_size |
Gauge |
Tamanho total dos conjuntos de dados montados por recursos Dataset ativos no cluster. |
|
dataset_ufs_file_num |
Gauge |
Quantidade de arquivos nos conjuntos de dados montados por recursos Dataset ativos no cluster. |
|
runtime_setup_error_total |
Counter |
Total de falhas em operações de configuração de runtime durante a reconciliação do controlador. |
|
runtime_sync_healthcheck_error_total |
Counter |
Total de falhas em operações de verificação de integridade do runtime durante a reconciliação do controlador. |
|
controller_runtime_reconcile_time_seconds_bucket |
Histogram |
Duração do loop de reconciliação do controlador. |
|
controller_runtime_reconcile_errors_total |
Counter |
Total de falhas na reconciliação do controlador. |
|
controller_runtime_reconcile_total |
Counter |
Total de loops de reconciliação do controlador concluídos. |
|
controller_runtime_max_concurrent_reconciles |
Gauge |
Número máximo de corrotinas de reconciliação disponíveis no controlador. |
|
controller_runtime_active_workers |
Gauge |
Quantidade de corrotinas de reconciliação ativas no momento no controlador. |
|
workqueue_adds_total |
Counter |
Total de eventos de adição processados pela fila de trabalho do controlador. |
|
workqueue_depth |
Gauge |
Profundidade atual da fila de trabalho do controlador. |
|
workqueue_queue_duration_seconds_bucket |
Histogram |
Tempo que um item permanece aguardando na fila de trabalho do controlador antes de ser processado. |
|
workqueue_work_duration_seconds_bucket |
Histogram |
Distribuição do tempo gasto para processar itens da fila de trabalho. |
|
workqueue_unfinished_work_seconds |
Gauge |
Duração total das tarefas inacabadas em processamento pela fila de trabalho. |
|
workqueue_longest_running_processor_seconds |
Gauge |
Maior tempo de processamento registrado para uma única tarefa. |
|
rest_client_requests_total |
Counter |
Quantidade de requisições HTTP, divididas por código de status, método e host. |
|
rest_client_request_duration_seconds_bucket |
Histogram |
Latência das requisições HTTP, dividida por verbo e URL. |
|
controller_runtime_webhook_requests_in_flight |
Gauge |
Quantidade de requisições webhook em processamento. |
|
controller_runtime_webhook_requests_total |
Counter |
Total de requisições processadas pelo webhook. |
|
controller_runtime_webhook_latency_seconds_bucket |
Histogram |
Latência das requisições processadas pelo webhook. |
|
process_cpu_seconds_total |
Counter |
Tempo total de CPU consumido pelo processo, em segundos. |
|
process_resident_memory_bytes |
Gauge |
Tamanho da memória residente do processo, em bytes. |
A tabela abaixo lista as métricas expostas pelo servidor JindoCache para o painel de cache JindoRuntime do Fluid.
|
Métrica |
Tipo |
Descrição |
|
jindocache_server_total_stsnodes_num |
Gauge |
Quantidade de réplicas ativas do componente worker no cache distribuído. |
|
jindocache_server_total_disk_cap |
Gauge |
Capacidade máxima de cache para mídias baseadas em disco (incluindo discos RAM como tmpfs) no cache distribuído. |
|
jindocache_server_total_used_disk_cap |
Gauge |
Espaço total de cache usado em mídias baseadas em disco (incluindo discos RAM como tmpfs) no cache distribuído. |
|
jindocache_server_total_mem_cap |
Gauge |
Capacidade máxima de cache armazenada na memória do processo dentro do cache distribuído. |
|
jindocache_server_total_used_mem_cap |
Gauge |
Espaço total de cache usado na memória do processo dentro do cache distribuído. |
|
jindocache_server_total_used_rocksdb_cap |
Gauge |
Capacidade do RocksDB usada no cache distribuído. |
|
jindocache_server_backend_read_bytes_total |
Gauge |
Volume total de dados lidos do armazenamento de backend durante buscas na source, em bytes. Uma busca na source ocorre quando os dados solicitados não são encontrados no cache distribuído JindoCache e precisam ser recuperados do sistema de armazenamento de backend. |
|
jindocache_server_backend_read_time_total |
Gauge |
Tempo total gasto lendo dados do armazenamento de backend durante buscas na source, em microssegundos. |
|
jindocache_server_backend_readop_num_total |
Gauge |
Total de operações de leitura do armazenamento de backend durante buscas na source. Esta contagem corresponde ao número de blocos no JindoCache. |
|
jindocache_server_backend_read_bytes_time_total_window |
Gauge |
Tempo gasto lendo dados do armazenamento de backend durante buscas na source dentro de uma janela de um minuto, em microssegundos. |
|
jindocache_server_backend_read_bytes_total_window |
Gauge |
Volume total de dados lidos do armazenamento de backend durante buscas na source dentro de uma janela de um minuto, em bytes. |
|
jindocache_server_remote_read_bytes_total |
Gauge |
Volume total de dados lidos a partir de acertos de cache remoto no mesmo cluster, em bytes. Um acerto de cache remoto ocorre quando os dados solicitados estão no cache distribuído JindoCache, mas em um nó diferente da aplicação. |
|
jindocache_server_remote_read_time_total |
Gauge |
Tempo total gasto em operações de leitura de acertos de cache remoto no mesmo cluster, em microssegundos. |
|
jindocache_server_remote_readop_num_total |
Gauge |
Total de operações de leitura de acertos de cache remoto no mesmo cluster. |
|
jindocache_server_remote_read_bytes_time_total_window |
Gauge |
Tempo gasto em operações de leitura de acertos de cache remoto dentro de uma janela de um minuto, em microssegundos. |
|
jindocache_server_remote_read_bytes_total_window |
Gauge |
Volume total de dados lidos a partir de acertos de cache remoto dentro de uma janela de um minuto, em bytes. |
|
jindocache_server_local_read_bytes_total |
Gauge |
Volume total de dados lidos a partir de acertos de cache local no mesmo cluster, em bytes. Um acerto de cache local ocorre quando os dados solicitados estão no cache distribuído JindoCache no mesmo nó da aplicação. |
|
jindocache_server_local_read_time_total |
Gauge |
Tempo total gasto em operações de leitura de acertos de cache local no mesmo cluster, em microssegundos. |
|
jindocache_server_local_readop_num_total |
Gauge |
Total de operações de leitura de acertos de cache local no mesmo cluster. |
|
jindocache_server_local_read_bytes_time_total_window |
Gauge |
Tempo gasto em operações de leitura de acertos de cache local dentro de uma janela de um minuto, em microssegundos. |
|
jindocache_server_local_read_bytes_total_window |
Gauge |
Volume total de dados lidos a partir de acertos de cache local dentro de uma janela de um minuto, em bytes. |
|
jindocache_server_ns_filelet_op_count_total |
Gauge |
Total de operações de metadados de arquivo (incluindo getAttr e listStatus) rastreadas pelo componente master do JindoCache. |
|
jindocache_server_ns_filelet_op_time_total |
Gauge |
Tempo total gasto processando operações de metadados de arquivo (incluindo getAttr e listStatus) pelo componente master do JindoCache. |
|
jindocache_server_ns_get_attr_op_total |
Gauge |
Total de operações getAttr rastreadas pelo componente master do JindoCache. |
|
jindocache_server_ns_get_attr_time_total |
Gauge |
Tempo total gasto processando operações getAttr pelo componente master do JindoCache. |
|
jindocache_server_ns_get_attr_fallback_op_total |
Gauge |
Total de vezes que o componente master do JindoCache realizou uma busca na source no armazenamento de backend para recuperar metadados de arquivo. |
|
jindocache_server_ns_list_status_op_total |
Gauge |
Total de operações listStatus rastreadas pelo componente master do JindoCache. |
|
jindocache_server_ns_list_status_time_total |
Gauge |
Tempo total gasto processando operações listStatus pelo componente master do JindoCache. |
|
jindocache_server_ns_list_status_fallback_op_total |
Gauge |
Total de vezes que o componente master do JindoCache realizou uma busca na source no sistema de armazenamento de backend para recuperar uma lista de arquivos. |
|
jindocache_server_dist_get_attr_op_num_total |
Gauge |
Total de operações getAttr rastreadas pelo cliente JindoCache. |
|
jindocache_server_dist_get_attr_time_total |
Gauge |
Tempo total gasto processando operações getAttr pelo cliente JindoCache. |
|
jindocache_server_dist_list_dir_op_num_total |
Gauge |
Total de operações de listagem de diretório rastreadas pelo cliente JindoCache. |
|
jindocache_server_dist_list_dir_time_total |
Gauge |
Tempo total gasto processando operações de listagem de diretório pelo cliente JindoCache. |
A tabela seguinte lista as métricas expostas pelo cliente FUSE do JindoCache para o painel de cache JindoRuntime do Fluid.
|
Métrica |
Tipo |
Descrição |
|
jindo_fuse_open_count |
Gauge |
Quantidade de operações open realizadas pelo cliente Jindo FUSE. |
|
jindo_fuse_open_latency |
Gauge |
Latência P50 (percentil 50) das operações open do cliente Jindo FUSE. |
|
jindo_fuse_open_latency_80 |
Gauge |
Latência P80 (percentil 80) das operações open do cliente Jindo FUSE. |
|
jindo_fuse_open_latency_90 |
Gauge |
Latência P90 (percentil 90) das operações open do cliente Jindo FUSE. |
|
jindo_fuse_open_latency_99 |
Gauge |
Latência P99 (percentil 99) das operações open do cliente Jindo FUSE. |
|
jindo_fuse_open_latency_999 |
Gauge |
Latência P99,9 (percentil 99,9) das operações open do cliente Jindo FUSE. |
|
jindo_fuse_open_latency_9999 |
Gauge |
Latência P99,99 (percentil 99,99) das operações open do cliente Jindo FUSE. |
|
jindo_fuse_getattr_count |
Gauge |
Quantidade de operações getAttr realizadas pelo cliente Jindo FUSE. |
|
jindo_fuse_getattr_latency |
Gauge |
Latência P50 (percentil 50) das operações getAttr do cliente Jindo FUSE. |
|
jindo_fuse_getattr_latency_80 |
Gauge |
Latência P80 (percentil 80) das operações getAttr do cliente Jindo FUSE. |
|
jindo_fuse_getattr_latency_90 |
Gauge |
Latência P90 (percentil 90) das operações getAttr do cliente Jindo FUSE. |
|
jindo_fuse_getattr_latency_99 |
Gauge |
Latência P99 (percentil 99) das operações getAttr do cliente Jindo FUSE. |
|
jindo_fuse_getattr_latency_999 |
Gauge |
Latência P99,9 (percentil 99,9) das operações getAttr do cliente Jindo FUSE. |
|
jindo_fuse_getattr_latency_9999 |
Gauge |
Latência P99,99 (percentil 99,99) das operações getAttr do cliente Jindo FUSE. |
|
jindo_fuse_readdir_count |
Gauge |
Quantidade de operações readdir realizadas pelo cliente Jindo FUSE. |
|
jindo_fuse_readdir_latency |
Gauge |
Latência P50 (percentil 50) das operações readdir do cliente Jindo FUSE. |
|
jindo_fuse_readdir_latency_80 |
Gauge |
Latência P80 (percentil 80) das operações readdir do cliente Jindo FUSE. |
|
jindo_fuse_readdir_latency_90 |
Gauge |
Latência P90 (percentil 90) das operações readdir do cliente Jindo FUSE. |
|
jindo_fuse_readdir_latency_99 |
Gauge |
Latência P99 (percentil 99) das operações readdir do cliente Jindo FUSE. |
|
jindo_fuse_readdir_latency_999 |
Gauge |
Latência P99,9 (percentil 99,9) das operações readdir do cliente Jindo FUSE. |
|
jindo_fuse_readdir_latency_9999 |
Gauge |
Latência P99,99 (percentil 99,99) das operações readdir do cliente Jindo FUSE. |
|
jindo_fuse_read_count |
Gauge |
Quantidade de operações read realizadas pelo cliente Jindo FUSE. |
|
jindo_fuse_read_latency |
Gauge |
Latência P50 (percentil 50) das operações read do cliente Jindo FUSE. |
|
jindo_fuse_read_latency_80 |
Gauge |
Latência P80 (percentil 80) das operações read do cliente Jindo FUSE. |
|
jindo_fuse_read_latency_90 |
Gauge |
Latência P90 (percentil 90) das operações read do cliente Jindo FUSE. |
|
jindo_fuse_read_latency_99 |
Gauge |
Latência P99 (percentil 99) das operações read do cliente Jindo FUSE. |
|
jindo_fuse_read_latency_999 |
Gauge |
Latência P99,9 (percentil 99,9) das operações read do cliente Jindo FUSE. |
|
jindo_fuse_read_latency_9999 |
Gauge |
Latência P99,99 (percentil 99,99) das operações read do cliente Jindo FUSE. |
|
jindo_fuse_write_count |
Gauge |
Quantidade de operações write realizadas pelo cliente Jindo FUSE. |
|
jindo_fuse_write_latency |
Gauge |
Latência P50 (percentil 50) das operações write do cliente Jindo FUSE. |
|
jindo_fuse_write_latency_80 |
Gauge |
Latência P80 (percentil 80) das operações write do cliente Jindo FUSE. |
|
jindo_fuse_write_latency_90 |
Gauge |
Latência P90 (percentil 90) das operações write do cliente Jindo FUSE. |
|
jindo_fuse_write_latency_99 |
Gauge |
Latência P99 (percentil 99) das operações write do cliente Jindo FUSE. |
|
jindo_fuse_write_latency_999 |
Gauge |
Latência P99,9 (percentil 99,9) das operações write do cliente Jindo FUSE. |
|
jindo_fuse_write_latency_9999 |
Gauge |
Latência P99,99 (percentil 99,99) das operações write do cliente Jindo FUSE. |
Referências
Para mais informações sobre o Fluid, consulte Conjunto de dados.
Para obter descrições dos parâmetros do painel do Fluid, consulte Referência de parâmetros do painel do Fluid.