Todos os produtos
Search
Central de documentação

Simple Log Service:Monitoramento de tarefas de transformação de dados

Última atualização: Jul 03, 2026

As tarefas de transformação de dados oferecem métricas operacionais, um painel integrado e alertas de monitoramento configuráveis para acompanhar a integridade e o desempenho das tarefas.

Dados de métricas

A coleta de métricas para tarefas de Data Transformation (New Version) exige a ativação dos Job Operational Logs do SLS. Para mais informações, consulte Gerenciar logs de serviço.

Painel

O Simple Log Service cria automaticamente um painel na página de detalhes de cada tarefa de transformação de dados para exibir as métricas operacionais.

Procedimento

  1. Faça login no console do Simple Log Service.

  2. Na seção Projects, clique em no projeto desejado.

    image

  3. No painel de navegação à esquerda, escolha Job Management > Data Transformation.

  4. Clique em na tarefa de transformação de dados desejada e visualize o painel na seção Execution Status.

Métricas gerais

O painel inclui as seguintes métricas principais:

image.png

  • Processing Rate: taxa de processamento de dados, medida em eventos por segundo. Por padrão, o sistema calcula essa métrica em uma janela de 1 minuto dentro de um período de 1 hora.

    • ingest: quantidade de eventos lidos de todos os shards no logstore de origem.

    • deliver: quantidade de eventos gravados com sucesso no logstore de destino.

    • failed: quantidade de eventos lidos do logstore de origem que falharam durante a transformação.

  • Total Events Read: total de eventos lidos de todos os shards no logstore de origem. O período estatístico padrão é de um dia.

  • Total Events Delivered: total de eventos gravados com sucesso em todos os logstores de destino. O período estatístico padrão é de um dia.

  • Total Events Failed: total de eventos lidos do logstore de origem que falharam durante a transformação. O período estatístico padrão é de um dia.

  • Event Delivery Ratio: proporção de eventos entregues com sucesso ao logstore de destino em relação ao total de eventos lidos do logstore de origem. O período estatístico padrão é de um dia.

Detalhes dos shards

O sistema coleta métricas no nível de shard em intervalos de um minuto enquanto a tarefa lê dados do Logstore de origem.

image.png

  • Shard Consumption Latency (s): para cada shard, representa a diferença de tempo (em segundos) entre o horário de ingestão do evento mais recente e o horário de ingestão do evento em processamento. Esse valor indica o atraso no processamento.

  • Active Shard Statistics: o período estatístico padrão é de uma hora.

    • shard: ID do shard.

    • ingest: quantidade de eventos brutos lidos do shard.

    • failed: quantidade de eventos brutos lidos do shard que falharam durante a transformação.

Exceções de execução

Os detalhes de erro estão disponíveis no campo message.

Por exemplo, a tabela de logs na página de detalhes de erro contém quatro colunas: time, level, action e message. Quando o level é ERROR e a action é deliver, o campo message pode exibir um erro como {"Code":"InvalidArgs","Message":"failed to get sts token: ...The role not exists: acs:ram::*:role/test-role."}. Essa mensagem indica que o sistema não conseguiu obter um token STS porque a função RAM especificada não existe.

Regras de alerta

Crie regras de alerta com base nas métricas operacionais em Dados de métricas para monitorar latência de processamento, exceções e alterações de tráfego. Para mais informações sobre alertas, consulte Alertas. Para criar uma regra de alerta, consulte Criar uma regra de alerta baseada em logs.

Importante

Ao criar uma regra de alerta para uma tarefa de transformação de dados, certifique-se de que a consulta tenha como alvo o mesmo projeto e logstore onde os logs operacionais da tarefa estão armazenados. Para mais informações, consulte Gerenciar logs de serviço.

Na caixa de diálogo Query and Analyze, clique em na aba Advanced Settings. Defina Type como Logstore e Authorization Method como Default. Selecione a Region desejada e insira os nomes do project e do logstore. Conforme necessário, configure o dedicated SQL (selecione Auto, Enable ou Disable) e o time range. Em seguida, clique em Confirm.

Monitoramento de latência de processamento

Item

Descrição

Finalidade

Monitora a latência de consumo de shards em uma tarefa de transformação de dados. O sistema aciona um alerta se a latência de processamento ultrapassar o limiar especificado.

Métrica associada no painel

Consulte Shard Consumption Latency (s).

Consulta de análise de exemplo

Substitua {job_name} na consulta abaixo pelo nome da sua tarefa de transformação de dados.

__topic__: etl_metrics and 
    job_name: {job_name} and
    "_etl_:connector_meta.action": ingest
    | select
      split_part(
        "_etl_:connector_meta.task_name",
        '#',
        2
      ) as shard,
      max_by("_etl_:connector_metrics.lags", __time__) as lags
    group by
      shard
    having
      shard is not null
    limit
      all

Configurações da regra de alerta

  • Defina Trigger Condition como Data Matches Expression. Configure a expressão de avaliação como lags > 120. Isso define o limiar de latência em 120 segundos.

  • Defina o time range como 5 minutos.

  • Defina a Check Frequency como 5 minutos.

Nota

Para evitar falsos alarmes causados por atualizações periódicas de métricas (a cada 1 minuto) ou latência decorrente de picos repentinos de dados, recomendamos o uso dessas configurações.

Como resolver alertas

Para resolver esses alertas:

  1. Se a tarefa foi criada recentemente e está processando dados históricos, o processamento do backlog pode levar algum tempo. Monitore a latência por uma hora. Caso ela não caia abaixo do limiar de alerta, prossiga para a próxima etapa.

  2. Se o volume de dados no logstore de origem aumentar significativamente:

    • Caso a Processing Rate (events/s) aumente enquanto a Shard Consumption Latency (s) diminua, isso indica que a tarefa de transformação de dados está dimensionando seus recursos automaticamente devido ao aumento de dados no Logstore de origem. Monitore a latência por 5 minutos para verificar se ela retorna a uma faixa normal. Se não retornar, prossiga para a próxima etapa.

    • Se a Processing rate (events/s) não aumentar ou a Shard consumption latency (s) continuar em tendência de alta, o número de shards no Logstore de origem pode ser insuficiente, limitando o dimensionamento dos recursos de transformação de dados. Nesse caso, divida manualmente os shards do Logstore de origem. Para etapas específicas, consulte Gerenciar Shards. Após concluir a divisão, observe por 5 minutos para verificar se a latência caiu para dentro da faixa de alerta. Caso contrário, prossiga para a próxima etapa.

  3. Se houver um alerta ativo para exceções de processamento, resolva-o primeiro. Depois de solucionar o problema, observe por 5 minutos para verificar se a latência caiu abaixo do limiar de alerta.

Monitoramento de exceções de processamento

Item

Descrição

Finalidade

Aciona um alerta quando ocorre uma exceção durante uma tarefa de transformação de dados.

Métrica associada no painel

Consulte Exceções de execução.

Consulta de análise de exemplo

Substitua {job_name} na consulta abaixo pelo nome da sua tarefa de transformação de dados.

__topic__: etl_metrics and 
    job_name: {job_name} and 
    "_etl_:connector_metrics.error": *
    | select
      distinct "_etl_:connector_metrics.error" as errors

Configurações da regra de alerta

  • Defina Trigger Condition como Data Is Returned.

  • Defina o time range como 10 minutos.

  • Defina a Check Frequency como 10 minutos.

Como resolver alertas

Solucione o problema com base na mensagem de erro:

  • Se a mensagem de erro contiver Invalid SPL query, a consulta SPL da tarefa possui um erro de sintaxe. Corrija a consulta com base nos detalhes da mensagem de erro. Para mais informações, consulte Sintaxe SPL.

  • Se a mensagem de erro contiver Unauthorized, InvalidAccessKeyId ou SignatureNotMatch, a tarefa não tem as permissões necessárias para ler dados do logstore de origem ou gravar dados no logstore de destino. Para mais informações, consulte Autorização.

  • Se a mensagem de erro contiver ProjectNotExist ou LogStoreNotExist, o projeto ou logstore especificado não existe. Faça login no console do Simple Log Service para verificar e resolver o problema.

Monitoramento da proporção de volume de dados gravados (comparação entre períodos)

Item

Descrição

Finalidade

Aciona um alerta com base nas alterações entre períodos na proporção de entrega de dados (volume gravado versus volume lido). A regra compara a proporção atual com o mesmo período do dia e da semana anteriores e aciona um alerta se a alteração exceder os limiares de crescimento ou declínio configurados.

Métrica associada no painel

Event Delivery Ratio: proporção de eventos entregues com sucesso ao logstore de destino em relação ao total de eventos lidos do logstore de origem. O período estatístico padrão é de um dia.

Consulta de análise de exemplo

Insira a seguinte consulta na caixa de diálogo Query and Analyze ao criar a regra de alerta.

Substitua {job_name} na consulta abaixo pelo nome da sua tarefa de transformação de dados.

__topic__: etl_metrics and 
    job_name: {job_name}
    | select
      round(diff [1], 1) as percent,
      round(coalesce(diff [4], 0), 1) as ratio_1d,
      round(coalesce(diff [5], 0), 1) as ratio_1w
    from(
        select
          compare(percent, 86400, 604800) as diff
        FROM      (
            select
              deliver /(ingest + 0,0001) as percent
            from(
                select
                  sum(
                    if(
                      "_etl_:connector_meta.action" = 'ingest',
                      "_etl_:connector_metrics.native_bytes",
                      0
                    )
                  ) as ingest,
                  sum(
                    if(
                      "_etl_:connector_meta.action" = 'deliver',
                      "_etl_:connector_metrics.native_bytes",
                      0
                    )
                  ) as deliver
                FROM              log
              )
          )
      )

Configurações da regra de alerta

  • Defina Trigger Condition como Data Matches Expression. Configure a expressão de avaliação como (ratio_1d > 1,2 || ratio_1d < 0,8) && (ratio_1w > 1,2 || ratio_1w < 0,8). Isso define o limiar de crescimento e declínio diário/semanal em 20%.

  • Defina o time range como 1 hora.

  • Defina a Check Frequency como 1 hora.

Nota

Para evitar falsos alarmes decorrentes de flutuações periódicas no tráfego de dados brutos, recomendamos definir os limiares de crescimento e declínio diário/semanal em pelo menos 20%, ou ajustar o período de comparação para corresponder ao ciclo do seu tráfego de dados brutos.

Como resolver alertas

Para resolver esses alertas:

  1. Se o volume de dados no logstore de origem mudou, verifique se há novos padrões de dados sendo ingeridos ou interrupções nos fluxos de dados existentes. Se for o caso e a alteração resultante nos dados estiver alinhada com a métrica, o alerta foi causado pela mudança no padrão de dados de origem. Caso contrário, prossiga para a próxima etapa.

  2. Se houver alertas ativos para latência de processamento ou exceções, resolva-os primeiro.

Monitoramento da contagem de eventos de origem (comparação entre períodos)

Item

Descrição

Finalidade

Aciona um alerta se o número de eventos lidos pela tarefa de transformação de dados mudar significativamente em relação ao dia e à semana anteriores. A regra dispara se a contagem de eventos exceder um limiar de crescimento ou cair abaixo de um limiar de declínio.

Métrica associada no painel

Total Events Read: total de eventos lidos de todos os shards no logstore de origem. O período estatístico padrão é de um dia.

Consulta de análise de exemplo

Insira a seguinte consulta na caixa de diálogo Query and Analyze ao criar a regra de alerta.

Substitua {job_name} na consulta abaixo pelo nome da sua tarefa de transformação de dados.

__topic__: etl_metrics and 
    job_name: {job_name} and
    "_etl_:connector_meta.action": ingest
    | select
      diff [1] as events,
      round(coalesce(diff [4], 0),  1) as ratio_1d,
      round(coalesce(diff [5], 0),  1) as ratio_1w
    from(
        select
          compare(events, 86400, 604800) as diff
        FROM      (
            select
              sum("_etl_:connector_metrics.events") as events
            FROM          log
          )
      )

Configurações da regra de alerta

  • Defina Trigger Condition como Data Matches Expression. Configure a expressão de avaliação como (ratio_1d > 1,2 || ratio_1d < 0,8) && (ratio_1w > 1,2 || ratio_1w < 0,8). Isso define o limiar de crescimento e declínio diário/semanal em 20%.

  • Defina o time range como 1 hora.

  • Defina a Check Frequency como 1 hora.

Nota

Para evitar falsos alarmes decorrentes de flutuações periódicas no tráfego de dados brutos, recomendamos definir os limiares de crescimento e declínio diário/semanal em pelo menos 20%, ou ajustar o período de comparação para corresponder ao ciclo do seu tráfego de dados brutos.

Como resolver alertas

Para resolver esses alertas:

  1. Se a tendência dessa métrica corresponder ao crescimento ou declínio na contagem de eventos do logstore de origem, a alteração é causada pelo volume de dados de origem. Caso contrário, prossiga para a próxima etapa.

  2. Se houver alertas ativos para latência de processamento ou exceções, resolva-os primeiro.

Monitoramento da contagem de eventos entregues (comparação entre períodos)

Item

Descrição

Finalidade

Aciona um alerta se o número de eventos gravados pela tarefa de transformação de dados mudar significativamente em relação ao dia e à semana anteriores. A regra dispara se a contagem de eventos exceder um limiar de crescimento ou cair abaixo de um limiar de declínio.

Métrica associada no painel

Total Events Delivered

Consulta de análise de exemplo

Insira a seguinte consulta na caixa de diálogo Query and Analyze ao criar a regra de alerta.

Substitua {job_name} na consulta abaixo pelo nome da sua tarefa de transformação de dados.

__topic__: etl_metrics and 
    job_name: {job_name} and
    "_etl_:connector_meta.action": deliver
    | select
      diff [1] as events,
      round(coalesce(diff [4], 0),  1) as ratio_1d,
      round(coalesce(diff [5], 0),  1) as ratio_1w
    from(
        select
          compare(events, 86400, 604800) as diff
        FROM      (
            select
              sum("_etl_:connector_metrics.events") as events
            FROM          log
          )
      )

Configurações da regra de alerta

  • Defina Trigger Condition como Data Matches Expression. Configure a expressão de avaliação como (ratio_1d > 1,2 || ratio_1d < 0,8) && (ratio_1w > 1,2 || ratio_1w < 0,8). Isso define o limiar de crescimento e declínio diário/semanal em 20%.

  • Defina o time range como 1 hora.

  • Defina a Check Frequency como 1 hora.

Nota

Para evitar falsos alarmes decorrentes de flutuações periódicas no tráfego de dados brutos, recomendamos definir os limiares de crescimento e declínio diário/semanal em pelo menos 20%, ou ajustar o período de comparação para corresponder ao ciclo do seu tráfego de dados brutos.

Como resolver alertas

Para resolver esses alertas:

  1. Se a tendência dessa métrica corresponder ao crescimento ou declínio no volume de dados do logstore de origem, a alteração é causada pelo volume de dados de origem. Caso contrário, prossiga para a próxima etapa.

  2. Se houver alertas ativos para latência de processamento ou exceções, resolva-os primeiro.