Todos os produtos
Search
Central de documentação

DataWorks:Nó Check

Última atualização: Jun 27, 2026

Fluxos de trabalho ETL que dependem de dados externos enfrentam um desafio central: os dados chegam em horários variáveis. O nó Check resolve esse problema ao monitorar periodicamente um objeto externo (arquivo, partição de tabela ou tarefa de sincronização em tempo real) e bloquear os nós downstream até que a condição seja atendida. Quando a condição é satisfeita, o nó Check é concluído com sucesso e libera os nós subsequentes. Se a condição não for atendida antes do horário de parada, o nó falha e mantém os nós downstream bloqueados, impedindo a leitura de dados incompletos ou ausentes.

Caso de uso típico: Um banco de dados externo exporta diariamente um arquivo de dados para o OSS por volta das 02:00. Seu fluxo de trabalho ETL no DataWorks precisa processar esse arquivo assim que ele for gerado. Como o horário de exportação varia, configure um nó Check para monitorar o caminho no OSS. O nó ETL inicia somente após o nó Check confirmar a existência do arquivo.

Objetos suportados

Tipo de objeto

Restrição

Tabelas particionadas do MaxCompute

Apenas tabelas particionadas

Arquivos no OSS

Uso obrigatório de AccessKey ID e segredo; modo de função RAM não suportado

Arquivos FTP

Arquivos no Hadoop Distributed File System (HDFS)

Arquivos no OSS-HDFS

Tabelas DLF (Paimon)

Apenas tabelas particionadas

Tarefas de sincronização em tempo real

Apenas tarefas Kafka-to-MaxCompute

Limites

  • Edição: DataWorks Professional Edition ou superior.

  • Tempo máximo de espera: 24 horas. Se a condição não for atendida nesse período, o nó falhará.

Pré-requisitos

Antes de começar, verifique se você tem:

  • Permissões: O usuário RAM que desenvolve o nó deve ter a função Development ou Workspace Administrator no workspace.

  • Grupo de recursos: Um grupo de recursos serverless associado ao workspace.

  • Data sources: A fonte de dados do objeto a ser verificado, configurada da seguinte forma:

    • MaxCompute: Associado ao Data Studio.

    • OSS: Criado com AccessKey ID e segredo (modo de função RAM não suportado).

    • FTP, HDFS, OSS-HDFS e DLF: Crie as fontes de dados correspondentes no DataWorks. Para FTP, consulte Fonte de dados FTP.

  • Tarefas em tempo real (se aplicável): Uma tarefa de sincronização Kafka-to-MaxCompute.

Etapa 1: Configurar o nó Check

Clique duas vezes no nó Check para abrir a interface de configuração e escolha o cenário correspondente ao que deseja monitorar.

Verificar uma fonte de dados

Use esta opção para aguardar a geração de um arquivo ou a criação de uma partição de tabela.

Campo

Descrição

Check Object

Selecione Data Source.

Data Source Type/Name

Escolha o tipo de fonte de dados (por exemplo, OSS ou MaxCompute) e o nome específico da fonte.

Table Name/File Path

Para MaxCompute e DLF: selecione a tabela de destino. Somente tabelas particionadas são suportadas. Para OSS, FTP, HDFS e OSS-HDFS: insira o caminho absoluto do arquivo ou diretório.

Condition for Check Passing

Para tabelas: existência da partição ou permanência inalterada do horário da última modificação por um período específico. Para arquivos: existência do arquivo.

Policy for Stopping Check

Consulte Escolher uma política de parada.

Escolher uma política de parada

O campo Policy for Stopping Check determina quando o nó Check interrompe a verificação caso a condição nunca seja atendida.

Opção

Quando usar

Time for Stopping Check (horário absoluto)

Use quando os nós downstream precisarem iniciar até um prazo fixo (por exemplo, antes do encerramento da janela ETL matinal).

Checks Allowed Before Check Node Stops (intervalo x quantidade)

Use para controlar o tempo total de espera sem vinculá-lo a um horário específico. Tempo máximo de espera = Interval x Total Checks.

Importante

Se o nó Check iniciar tardiamente devido a um atraso upstream e o horário atual já tiver ultrapassado o tempo de parada configurado, o nó será executado apenas uma vez. Ele terá sucesso se a condição for atendida; caso contrário, falhará imediatamente.

Verificar uma tarefa de sincronização em tempo real

Use esta opção para confirmar que um fluxo em tempo real Kafka-to-MaxCompute não apresenta atrasos significativos antes de acionar um nó em lote.

Campo

Descrição

Check Object

Selecione Real-time Synchronization Task.

Real-time Synchronization Task

Escolha uma tarefa Kafka-to-MaxCompute existente na lista suspensa.

Policy for Stopping Check

Consulte Escolher uma política de parada.

Etapa 2: Agendar e implantar

  1. Configure as dependências:

    • Defina o nó upstream do nó Check como o nó raiz ou um nó de início lógico.

    • Defina o nó downstream do nó Check como o nó que necessita dos dados.

    • Para mais detalhes, consulte Configurar agendamento de nós.

  2. Salve e implante o nó no ambiente de produção. Após a implantação, a tarefa será executada conforme o agendamento definido. Monitore o status no Operation Center.