Todos os produtos
Search
Central de documentação

DataWorks:O&M com IA

Última atualização: Jun 27, 2026

O O&M com IA do DataWorks é uma capacidade operacional impulsionada pelo DataWorks Copilot, projetada para oferecer avaliações abrangentes de integridade e diagnóstico de problemas para instâncias de tarefa e todo o workspace. Ao analisar múltiplas dimensões — incluindo cadeias de dependência, níveis de recursos, tendências históricas de execução, impactos de alterações, anomalias em logs e qualidade dos dados —, a ferramenta gera automaticamente relatórios de diagnóstico estruturados. Esses relatórios não apenas revelam a causa raiz de um problema, mas também fornecem soluções específicas e ações operacionais com um clique. O objetivo é ajudar você a migrar da solução reativa de problemas para a detecção e prevenção proativas, melhorando significativamente a eficiência de O&M.

Recursos

O O&M com IA é uma ferramenta inteligente e unificada para operações de tarefas no DataWorks, representando uma evolução do recurso original de O&M inteligente. Quando você enfrenta problemas como falhas em tarefas, execução lenta ou contenção de recursos, o O&M com IA do DataWorks analisa automaticamente todo o ciclo de vida da tarefa, identifica rapidamente a causa raiz e oferece soluções com ações operacionais de um clique.

Capacidades principais:

  • Diagnóstico abrangente: Cobre todos os estados da tarefa, desde não iniciada e aguardando até em execução e concluída, seja com sucesso ou falha. O escopo do diagnóstico se estende de uma única instância ou fluxo de trabalho a um workspace inteiro. A ferramenta fornece um diagnóstico completo ao analisar dependências, uso de recursos, desempenho histórico e conteúdo de logs, além de permitir perguntas de acompanhamento contextuais.

  • Análise de causa raiz: Vai além da simples exibição de logs de erro e correlaciona informações multidimensionais para identificar a causa fundamental de um problema.

  • Operações interativas: Permite emitir comandos de O&M — como reexecutar uma instância, defini-la como bem-sucedida ou modificar um grupo de recursos — diretamente na caixa de diálogo de chat. Isso simplifica operações complexas em botões de um clique e aumenta consideravelmente a eficiência de O&M.

Guia de início rápido

Esta seção orienta você por um processo completo de diagnóstico em um cenário típico: solução de problemas de uma instância de tarefa com falha.

  1. Inicie um diagnóstico

    1. Acesse Operation Center > Scheduled Instance e localize a instância alvo que falhou.

    2. Clique em no nome da instância para expandir seu DAG. Passe o mouse sobre a instância e, no menu de atalho exibido, clique em no botão AI Diagnostics.

      No DAG, nós com falha, como ods_user_info_d, são marcados com um ícone × vermelho e uma borda vermelha, enquanto seus nós downstream aparecem no estado 'não executado'. O botão AI diagnosis está localizado próximo à linha que conecta o nó com falha ao seu nó upstream.

  2. Aguarde a análise da IA

    Após o clique, o assistente DataWorks Copilot abre automaticamente no lado direito da página e exibe "DataWorks Copilot is processing...". Enquanto você aguarda, o Copilot mostra as etapas de análise em andamento, o que ajuda a entender o processo de "raciocínio" da IA. Abaixo está um fluxo típico de diagnóstico; expanda qualquer etapa para visualizar detalhes.

    O processo de análise executa sequencialmente etapas como Query task instance status and information, Query internal nodes of the workflow, Analyze failed instance logs, Analyze and diagnose, Query task instance logs, Query task publishing changes, Query instance operation records e Query instance code. Após a conclusão, ele exibe DataWorks Copilot has completed execution!.

    Ao expandir a etapa Analyze and diagnose, o Copilot apresenta um diagnóstico detalhado com três seções: Problem Analysis, Possible Causes e Solution Suggestions. Por exemplo, se uma tarefa falhar porque um grupo de recursos exclusivo expirou, a Problem Analysis indica que a mensagem de erro é com.alibaba.phoenix.error.BillException, mostrando que uma verificação de faturamento falhou. A seção Possible Causes lista motivos como o fim do período de assinatura do grupo de recursos sem renovação, erros de configuração ou exclusão acidental, saldo devedor na conta ou alterações de permissão. Já a seção Solution Suggestions orienta você a acessar a página Resource Group Management para verificar o status do grupo de recursos e renová-lo, ou a alternar temporariamente para outro grupo de recursos disponível na scheduling configuration da tarefa.

  3. Interprete o relatório de diagnóstico

    Após cerca de 10 segundos, o Copilot retorna um relatório de diagnóstico estruturado. Concentre-se nas seguintes seções:

    • Anomaly Detection: Esta é a principal conclusão a ser revisada. Ela identifica anomalias na instância por meio de uma análise abrangente e deduz a causa raiz com base no contexto.

    • Analysis Process: Esta seção lista a cadeia de evidências que a IA usou para chegar às conclusões, aumentando a credibilidade dos resultados.

    • Solution and prevention suggestions: Fornece etapas específicas e acionáveis para corrigir o problema, além de recomendações de longo prazo para evitar recorrência.

    Anomaly Detection
    • Root Cause: The task failed because the exclusive resource group (ID: 70b78c03-d6b9-4234-bde9-e0da1e6e8c33) has expired. The system detected that the resource group was unavailable when trying to start the task, which threw a BillException and terminated the task execution.
    Analysis Process
    1. Initial Status Check:
       • Called get_task_instance and found the instance status was "Failed".
    2. Log Analysis:
       • Used analyze_task_instance_log and get_task_instance_log to view detailed error logs, confirming the failure reason as "exclusive resource group has expired".
    3. Change and Operation Record Check:
       • Used list_task_changes and found the last change was on 2026-02-01, which was an update to the task itself.
       • list_task_operations shows that the resource group for this task was changed on 2026-02-01 (from yunshi_dataxcdc_pre_resource to dgc_checker_test_rescource_dlf), but this did not resolve the issue.
    4. Code Review:
       • Reviewed the task code (get_task_instance_code) and found it to be a standard PyODPS data writing script with no apparent logical errors or improper resource requests.
  4. Implemente a solução

    Siga as recomendações fornecidas no relatório.

    • Medidas imediatas: O relatório geralmente fornece ações de atalho diretamente relacionadas ao problema. Por exemplo, para um problema de grupo de recursos, pode oferecer um atalho para modificar o grupo de recursos da tarefa. Basta responder com Yes, e a IA ajudará você a modificar o grupo de recursos.

      A seção Solution and prevention suggestions do Copilot inclui tanto Immediate measures (acesse a página Exclusive Resource Group Management para verificar o status do grupo de recursos, renovar o serviço ou reatribuir a tarefa a um grupo de recursos válido) quanto Long-term optimization (estabeleça um mecanismo de monitoramento para expiração de grupos de recursos e revise periodicamente as dependências de grupos de recursos das tarefas).

      O Copilot exibe um formulário de confirmação Modify Instance Resource Group e preenche automaticamente parâmetros como Environment, Task Instance ID List, Workspace, Resource Group e Is Business Process Instance. Após confirmar que as informações estão corretas, clique em Confirm and Execute para concluir a modificação.

    • Operações interativas: Se o relatório não fornecer uma ação específica, continue inserindo comandos na caixa de diálogo para resolver o problema. Por exemplo, digite "modify the resource group for task xxx", e o Copilot orientará você durante o processo. Por meio da interação em linguagem natural, a IA compreende dinamicamente requisitos contextuais complexos, simplificando as operações e tornando-as adequadas para cenários de O&M não estruturados.

      O Copilot consulta automaticamente o status da instância da tarefa e exibe um formulário de confirmação com campos como Environment, Task Instance ID List, Workspace, Resource Group e Is Business Process Instance. Após confirmar que as informações estão corretas, clique em Confirm and Execute para concluir a operação.

Nota

O relatório de diagnóstico e as soluções sugeridas variam dependendo da causa da falha. Os resultados podem diferir com base na sua situação específica. Para obter uma lista de operações compatíveis, consulte Operações de O&M Compatíveis.

Observações de uso

  • Para diagnósticos no nível do workspace ou quando muitas instâncias estão envolvidas, a resposta pode levar de 1 a 5 minutos.

  • A análise de dependências entre workspaces é compatível, mas você deve ser membro do workspace alvo para visualizar os detalhes da análise.

Ative o diagnóstico por IA

Você pode acessar o O&M com IA a partir de vários pontos de entrada no DataWorks.

Ponto de entrada global (Copilot)

Em qualquer página do DataWorks, abra a caixa de diálogo do Copilot no canto superior direito, alterne o Copilot para o modo Agent e selecione /Data O&M.

Insira Diagnose instance: <Instance ID>, use @<Instance ID> para fornecer contexto, para iniciar um diagnóstico.

Nota

No ponto de entrada global, é obrigatório usar /Data O&M para especificar o agente. Nos pontos de entrada contextuais, isso não é necessário, pois o agente de O&M é usado por padrão.

Pontos de entrada contextuais

Localização

Ações

Operation Center > AI operations and maintenance

No Operation Center, clique em AI-powered O&M no painel de navegação à esquerda.

Operation Center > Instance List

Na coluna Actions, clique em More > AI Diagnostics. Isso permite diagnosticar instâncias de ciclo, teste e backfill.

Operation Center > DAG

Passe o mouse sobre uma instância de nó e clique em no botão AI Diagnostics.

Aba Instance Run Log

Na página de diagnóstico de log, clique em no botão AI Diagnostics na parte superior para abrir automaticamente o Copilot e enviar o comando de diagnóstico.

Página Log Diagnosis

Na caixa de diálogo no centro da página, ative AI Diagnostics, insira um ID de instância ou workspace e inicie o diagnóstico.

Nota: O botão original "Intelligent Diagnosis" foi renomeado para Log Diagnosis e agora analisa o conteúdo atual do log.

Cenários de diagnóstico compatíveis

Problemas no nível da instância

Tipo de problema

Exemplo de comando

Falha na tarefa

Diagnose instance: <Instance ID> ou use @<Instance ID> para fornecer contexto.

Execução lenta

Why is instance <Instance ID> running slower today?

Tempo de espera prolongado

Check why instance <Instance ID> is still waiting.

Bloqueio de dependência

Which parent nodes of instance <Instance ID> have failed?

Problemas no nível do workspace

Tipo de problema

Exemplo de comando

Triagem de tarefas anormais

Analyze workspace <ID> to find abnormal tasks and their causes

Identificação de risco de baseline

Check the stability of baseline tasks in workspace <ID>

Operações de O&M compatíveis

No relatório de diagnóstico ou na caixa de diálogo do Copilot, você pode executar as seguintes operações em tarefas ou instâncias dentro de um workspace, individualmente ou em lote:

Importante

Revise e autorize qualquer operação na caixa de diálogo da IA antes da execução.

Ações

Descrição

Rerun instance

Reexecuta a instância atual.

Set as successful

Marca forçosamente a instância como bem-sucedida.

Suspend/Resume instance

Controla o estado de agendamento.

Modify resource group

Alterna o grupo de recursos.

Modify priority

Ajusta a prioridade de agendamento, o que afeta o agendamento da baseline.

Refresh instance

Atualiza a configuração da instância para seu estado mais recente.

Você deve ter a função Project Owner ou O&M no workspace alvo.