Fluxos de trabalho ETL que dependem de dados externos enfrentam um desafio central: os dados chegam em horários variáveis. O nó Check resolve esse problema ao monitorar periodicamente um objeto externo (arquivo, partição de tabela ou tarefa de sincronização em tempo real) e bloquear os nós downstream até que a condição seja atendida. Quando a condição é satisfeita, o nó Check é concluído com sucesso e libera os nós subsequentes. Se a condição não for atendida antes do horário de parada, o nó falha e mantém os nós downstream bloqueados, impedindo a leitura de dados incompletos ou ausentes.
Caso de uso típico: Um banco de dados externo exporta diariamente um arquivo de dados para o OSS por volta das 02:00. Seu fluxo de trabalho ETL no DataWorks precisa processar esse arquivo assim que ele for gerado. Como o horário de exportação varia, configure um nó Check para monitorar o caminho no OSS. O nó ETL inicia somente após o nó Check confirmar a existência do arquivo.
Objetos suportados
|
Tipo de objeto |
Restrição |
|
Tabelas particionadas do MaxCompute |
Apenas tabelas particionadas |
|
Arquivos no OSS |
Uso obrigatório de AccessKey ID e segredo; modo de função RAM não suportado |
|
Arquivos FTP |
— |
|
Arquivos no Hadoop Distributed File System (HDFS) |
— |
|
Arquivos no OSS-HDFS |
— |
|
Tabelas DLF (Paimon) |
Apenas tabelas particionadas |
|
Tarefas de sincronização em tempo real |
Apenas tarefas Kafka-to-MaxCompute |
Limites
Edição: DataWorks Professional Edition ou superior.
Tempo máximo de espera: 24 horas. Se a condição não for atendida nesse período, o nó falhará.
Pré-requisitos
Antes de começar, verifique se você tem:
Permissões: O usuário RAM que desenvolve o nó deve ter a função Development ou Workspace Administrator no workspace.
Grupo de recursos: Um grupo de recursos serverless associado ao workspace.
-
Data sources: A fonte de dados do objeto a ser verificado, configurada da seguinte forma:
MaxCompute: Associado ao Data Studio.
OSS: Criado com AccessKey ID e segredo (modo de função RAM não suportado).
FTP, HDFS, OSS-HDFS e DLF: Crie as fontes de dados correspondentes no DataWorks. Para FTP, consulte Fonte de dados FTP.
Tarefas em tempo real (se aplicável): Uma tarefa de sincronização Kafka-to-MaxCompute.
Etapa 1: Configurar o nó Check
Clique duas vezes no nó Check para abrir a interface de configuração e escolha o cenário correspondente ao que deseja monitorar.
Verificar uma fonte de dados
Use esta opção para aguardar a geração de um arquivo ou a criação de uma partição de tabela.
|
Campo |
Descrição |
|
Check Object |
Selecione Data Source. |
|
Data Source Type/Name |
Escolha o tipo de fonte de dados (por exemplo, OSS ou MaxCompute) e o nome específico da fonte. |
|
Table Name/File Path |
Para MaxCompute e DLF: selecione a tabela de destino. Somente tabelas particionadas são suportadas. Para OSS, FTP, HDFS e OSS-HDFS: insira o caminho absoluto do arquivo ou diretório. |
|
Condition for Check Passing |
Para tabelas: existência da partição ou permanência inalterada do horário da última modificação por um período específico. Para arquivos: existência do arquivo. |
|
Policy for Stopping Check |
Consulte Escolher uma política de parada. |
Escolher uma política de parada
O campo Policy for Stopping Check determina quando o nó Check interrompe a verificação caso a condição nunca seja atendida.
|
Opção |
Quando usar |
|
Time for Stopping Check (horário absoluto) |
Use quando os nós downstream precisarem iniciar até um prazo fixo (por exemplo, antes do encerramento da janela ETL matinal). |
|
Checks Allowed Before Check Node Stops (intervalo x quantidade) |
Use para controlar o tempo total de espera sem vinculá-lo a um horário específico. Tempo máximo de espera = |
Se o nó Check iniciar tardiamente devido a um atraso upstream e o horário atual já tiver ultrapassado o tempo de parada configurado, o nó será executado apenas uma vez. Ele terá sucesso se a condição for atendida; caso contrário, falhará imediatamente.
Verificar uma tarefa de sincronização em tempo real
Use esta opção para confirmar que um fluxo em tempo real Kafka-to-MaxCompute não apresenta atrasos significativos antes de acionar um nó em lote.
|
Campo |
Descrição |
|
Check Object |
Selecione Real-time Synchronization Task. |
|
Real-time Synchronization Task |
Escolha uma tarefa Kafka-to-MaxCompute existente na lista suspensa. |
|
Policy for Stopping Check |
Consulte Escolher uma política de parada. |
Etapa 2: Agendar e implantar
-
Configure as dependências:
Defina o nó upstream do nó Check como o nó raiz ou um nó de início lógico.
Defina o nó downstream do nó Check como o nó que necessita dos dados.
Para mais detalhes, consulte Configurar agendamento de nós.
Salve e implante o nó no ambiente de produção. Após a implantação, a tarefa será executada conforme o agendamento definido. Monitore o status no Operation Center.