As operações e manutenção (O&M) automatizadas permitem codificar seu plano de resposta a incidentes como regras de execução automática. Quando uma condição configurada é atendida — como um grupo de recursos atingir seu limiar de utilização ou uma instância de nó falhar — o DataWorks age em seu nome sem exigir intervenção manual. Isso reduz os acionamentos fora do horário comercial e melhora a confiabilidade dos pipelines.
Como funciona
O O&M automatizado do DataWorks abrange dois cenários:
Interrupção de instâncias em execução: quando uma regra de alerta personalizada é acionada em um grupo de recursos exclusivo para agendamento, o DataWorks encerra as instâncias de nó correspondentes. Por exemplo, se a utilização de recursos atingir 80% e permanecer nesse nível por 10 minutos, o sistema interrompe automaticamente as instâncias não acionadas automaticamente com prioridade 1 ou 3 nesse grupo de recursos.
Automated rerun: quando uma instância de nó falha sem ter a propriedade de nova execução automática configurada ou atinge o tempo limite, o DataWorks a executa novamente com base na regra de nova execução automatizada. Essa regra se aplica apenas a nós em execução em um grupo de recursos serverless.
Esses dois tipos de regra são independentes: as regras de interrupção respondem à pressão sobre os recursos, enquanto as regras de nova execução respondem a falhas individuais de instâncias. Para obter ambos os comportamentos, configure cada tipo de regra separadamente.
Limitações
Permissões: somente contas Alibaba Cloud, usuários RAM com a política AliyunDataWorksFullAccess anexada e administradores de workspace podem gerenciar regras de O&M automatizado.
Restrições de grupos de recursos:
As regras de interrupção aplicam-se apenas a nós em execução em um grupo de recursos exclusivo para agendamento que possua uma regra de alerta de utilização de recursos configurada.
As regras de nova execução automatizada aplicam-se somente a nós em execução em um grupo de recursos serverless.
Restrições de recursos:
Várias regras de interrupção podem ser associadas à mesma regra de alerta.
Apenas uma regra de nova execução automatizada pode ser criada por workspace.
Os registros de execução ficam disponíveis pelos últimos 30 dias.
Acesse a página Automatic
Faça login no console do DataWorks. Na barra de navegação superior, selecione a região de destino. No painel de navegação à esquerda, escolha Data Development and O&M > Operation Center. Selecione seu workspace na lista suspensa e clique em Go to Operation Center.
No painel de navegação à esquerda, escolha O&M Assistant > Automatic.
Crie uma regra
Na página Automatic O&M > Rules Management, crie dois tipos de regras de O&M automatizado:
|
Tipo de regra |
Gatilho |
Aplica-se a |
|
Interrupção de instâncias em execução |
Regra de alerta acionada pelo uso do grupo de recursos |
Nós em um grupo de recursos exclusivo para agendamento |
|
Automatic rerun |
Falha ou tempo limite da instância de nó |
Nós em um grupo de recursos serverless |
Cada regra possui uma condição de gatilho que determina quando ela é acionada, condições de filtro que definem o escopo das instâncias afetadas e restrições que limitam a frequência de execução. Os nós na lista de bloqueios são excluídos mesmo que correspondam a todas as outras condições.
Crie uma regra de interrupção
As regras de interrupção param as instâncias que correspondem às regras de alerta personalizadas quando estas são acionadas. Tipos de instância suportados: recurring instances, data backfill instances, test instances, one-time task instances e manually triggered workflow instances.
|
Seção |
Parâmetro |
Descrição |
|
Trigger condition |
Associated monitoring rule |
A regra de alerta que aciona esta regra de O&M. Somente regras de alerta com Object Type definido como Schedule Resource e Trigger Condition definido como Resource Group Usage podem ser associadas. Consulte como criar uma regra de monitoramento. |
|
Filter conditions |
Workspace |
O workspace onde esta regra se aplica. |
|
Instance type |
O tipo de instância alvo da ação. |
|
|
Scheduling cycle |
A frequência de agendamento a ser correspondida. Obrigatório quando Instance Type for Recurring Instance ou Data Backfill Instance. |
|
|
Priority |
A prioridade das instâncias alvo da ação. Valores maiores indicam maior prioridade. |
|
|
Status |
O status das instâncias alvo da ação. |
|
|
Blacklist |
Blacklist |
Nós que atendem a todas as condições, mas devem ser excluídos. Insira o nome ou ID do nó para adicioná-lo. |
|
Constraints on rule |
Effective period |
A janela de tempo durante a qual a regra pode ser executada. Instâncias fora dessa janela não são afetadas, mesmo que todas as condições sejam atendidas. |
|
Maximum effective times |
O número máximo de vezes que a regra pode ser executada. Cada execução é verificada em relação à condição de gatilho antes de executar. |
|
|
Minimum effective interval |
O tempo mínimo entre execuções consecutivas. |
Crie uma regra de nova execução automatizada
As regras de nova execução automatizada tentam executar novamente as instâncias com falha de forma automática. A regra é acionada quando:
Uma instância de nó falha e a propriedade de nova execução automática não está configurada na aba Properties do nó.
Uma instância de nó atinge o tempo limite.
Tipos de instância suportados: recurring instances, data backfill instances, test instances, one-time task instances e manually triggered workflow instances.
Escopo das instâncias verificadas:
Recurring instances: apenas instâncias com data timestamp de ontem são verificadas. Por exemplo, se hoje for 5 de junho de 2025, a regra verifica instâncias com data timestamp de 4 de junho de 2025.
Outros tipos de instância (data backfill, teste, tarefa única, fluxo de trabalho acionado manualmente): instâncias criadas hoje, ontem e anteontem são verificadas. Por exemplo, se hoje for 5 de junho de 2025, as instâncias criadas nos dias 3, 4 e 5 de junho são elegíveis.
|
Seção |
Parâmetro |
Descrição |
|
Trigger condition |
Running status |
Aciona quando uma instância de nó falha sem a propriedade de nova execução automática configurada ou quando a instância atinge o tempo limite. |
|
Filter conditions |
Workspace |
O workspace onde esta regra se aplica. |
|
Instance type |
O tipo de instância alvo da ação. |
|
|
Scheduling cycle |
A frequência de agendamento a ser correspondida. Disponível quando Instance Type for Recurring Instance ou Data Backfill Instance. |
|
|
Priority |
A prioridade das instâncias alvo da ação. Valores maiores indicam maior prioridade. |
|
|
Logs contain keywords |
Aciona a nova execução quando os logs de operação contêm uma palavra-chave específica. Valores válidos: |
|
|
Blacklist |
Blacklist |
Nós que atendem a todas as condições, mas devem ser excluídos. Insira o nome ou ID do nó para adicioná-lo. |
|
Rerun |
Preparation |
Se o nó for um nó de computação em um grupo de recursos serverless, selecione Add CUs For Computing Tasks para alocar capacidade extra de computação para a nova execução. |
|
CUs to add |
O número de Unidades de Computação (CUs) a serem adicionadas além da alocação da instância original. As CUs adicionadas são usadas apenas para a instância de nova execução. Defina este valor para evitar que as novas execuções compitam por recursos com outros nós em execução. |
|
|
Rerun times |
O número máximo de tentativas. Valores válidos: 1–10. |
|
|
Rerun interval |
O tempo de espera entre as tentativas. Valores válidos: 3–30 minutos. |
|
|
Constraints on rule |
Effective period |
A janela de tempo durante a qual a regra pode ser executada. Instâncias fora dessa janela não sofrem nova tentativa, mesmo que todas as condições sejam atendidas. |
Ative ou desative uma regra
As regras entram em vigor imediatamente após a criação. Para desativar uma regra, clique em
na coluna Actions.
Mais operações
Gerencie regras
Para visualizar uma regra, localize-a na aba Rules Management e clique em View na coluna Actions.
Para editar uma regra, abra-a com View e depois clique em Modify na parte inferior da caixa de diálogo View Rule.
Para excluir uma regra, clique em Delete na coluna Actions e confirme a exclusão.
Para pesquisar uma regra pelo nome, utilize a caixa de pesquisa no canto superior esquerdo da página Rules Management.
Visualize registros de execução
A aba Execution Records mostra quando cada regra foi executada, o proprietário da regra e quantas instâncias de nó foram afetadas. Clique em View Details na coluna Actions para ver o log completo de execução.
As operações de O&M são executadas sob a identidade do proprietário da regra. É possível rastrear cada ação automatizada nos logs de operação da instância de nó que acionou a regra.
Registros de execução de regras de interrupção incluem:
Instâncias aguardando recursos/uso de recursos: um gráfico mostrando o número de instâncias aguardando recursos juntamente com a utilização do grupo de recursos ao longo do tempo. Passe o mouse sobre qualquer ponto para ver os valores naquele momento.
Terminated node instances: a lista completa de instâncias cuja execução foi interrompida.
Registros de execução de nova execução automatizada incluem:
Instances that are automatically rerun: uma lista com Node name, Data timestamp, Instance type, Node type, Owner e outros detalhes para cada instância reexecutada.
Monitore grupos de recursos
Após criar uma regra de O&M automatizado, o DataWorks monitora automaticamente o uso de recursos do grupo de recursos associado. Para mais detalhes, consulte O&M de recursos.