Tous les produits
Search
Centre de documentation

DataWorks:Maintenance et exploitation (O&M) assistée par l'IA

Dernière mise à jour :Aug 10, 2026

La maintenance et exploitation (O&M) assistée par l'IA de DataWorks est une capacité opérationnelle pilotée par DataWorks Copilot, conçue pour fournir des évaluations complètes de l'état de santé et un diagnostic des problèmes pour les instances de tâche et un espace de travail entier. En analysant plusieurs dimensions, notamment les chaînes de dépendance, les niveaux de ressources, les tendances d'exécution historiques, les impacts des modifications, les anomalies des journaux et la qualité des données, elle génère automatiquement des rapports de diagnostic structurés. Ces rapports révèlent non seulement la cause racine d'un problème, mais fournissent également des solutions spécifiques et des actions opérationnelles en un clic. L'objectif est de vous aider à passer du dépannage réactif à la détection et à la prévention proactives des problèmes, améliorant ainsi considérablement l'efficacité de l'O&M.

Fonctionnalités

L'O&M assistée par l'IA est un outil intelligent tout-en-un pour les opérations de tâches dans DataWorks. Il s'agit d'une amélioration de la fonctionnalité d'O&M intelligente originale. Lorsque vous rencontrez des problèmes tels que des échecs de tâche, une exécution lente ou une contention de ressources, l'O&M assistée par l'IA de DataWorks analyse automatiquement l'ensemble du cycle de vie de la tâche, identifie rapidement la cause racine et propose des solutions avec des actions opérationnelles en un clic.

Capacités principales :

  • Diagnostic complet : Couvre tous les états de tâche, de « non exécuté » et « en attente » à « en cours d'exécution » et « terminé », qu'ils soient réussis ou échoués. La portée du diagnostic s'étend d'une instance ou d'un workflow unique à un espace de travail entier. Elle fournit un diagnostic complet en analysant les dépendances, l'utilisation des ressources, les performances historiques et le contenu des journaux, et prend en charge les questions de suivi contextuelles.

  • Analyse des causes racines : Va au-delà de la simple présentation des journaux d'erreurs en corrélant des informations multidimensionnelles pour identifier la cause fondamentale d'un problème.

  • Opérations interactives : Vous permet d'émettre des commandes O&M, telles que le relancement d'une instance, son marquage comme réussie ou la modification d'un groupe de ressources, directement dans une boîte de dialogue de chat. Elle simplifie les opérations complexes en boutons en un clic, améliorant considérablement l'efficacité de l'O&M.

Démarrage rapide

Cette section vous guide à travers un processus de diagnostic complet pour un scénario typique : le dépannage d'une instance de tâche ayant échoué.

  1. Démarrer un diagnostic

    1. Accédez à Operation Center > Scheduled Instance et localisez l'instance cible ayant échoué.

    2. Cliquez sur le nom de l'instance pour développer son DAG. Survolez l'instance et, dans le menu contextuel qui s'affiche, cliquez sur le bouton AI Diagnostics.

      Dans le DAG, les nœuds ayant échoué, tels que ods_user_info_d, sont marqués par une icône rouge en forme de croix et une bordure rouge, tandis que leurs nœuds en aval sont affichés dans un état « non exécuté ». Le bouton AI diagnosis se trouve près de la ligne reliant le nœud ayant échoué à son nœud en amont.

  2. Attendre l'analyse de l'IA

    Après avoir cliqué, l'assistant DataWorks Copilot s'ouvre automatiquement sur le côté droit de la page et affiche « DataWorks Copilot is processing... ». Pendant l'attente, Copilot affiche les étapes d'analyse qu'il effectue, ce qui vous aide à comprendre le processus de « réflexion » de l'IA. Voici un flux de diagnostic typique ; vous pouvez développer n'importe quelle étape pour afficher les détails.

    Le processus d'analyse exécute séquentiellement des étapes telles que Query task instance status and information, Query internal nodes of the workflow, Analyze failed instance logs, Analyze and diagnose, Query task instance logs, Query task publishing changes, Query instance operation records et Query instance code. Une fois terminé, il affiche DataWorks Copilot has completed execution!.

    Lorsque vous développez l'étape Analyze and diagnose, Copilot présente un diagnostic détaillé, comprenant trois sections : Problem Analysis, Possible Causes et Solution Suggestions. Par exemple, si une tâche échoue parce qu'un groupe de ressources exclusif a expiré, Problem Analysis indique que le message d'erreur est com.alibaba.phoenix.error.BillException, montrant qu'une vérification de facturation a échoué. Possible Causes énumère des raisons telles que la fin de la période d'abonnement du groupe de ressources sans renouvellement, des erreurs de configuration ou une suppression accidentelle, des impayés sur le compte ou des modifications d'autorisations. Solution Suggestions vous guide vers la page Resource Group Management pour vérifier l'état du groupe de ressources et le renouveler, ou pour basculer temporairement vers un autre groupe de ressources disponible dans la scheduling configuration de la tâche.

  3. Interpréter le rapport de diagnostic

    Après environ 10 secondes, Copilot renvoie un rapport de diagnostic structuré. Vous devez vous concentrer sur les sections suivantes :

    • Anomaly Detection : Il s'agit de la conclusion principale à examiner. Elle identifie les anomalies d'instance grâce à une analyse complète et déduit la cause racine en fonction du contexte.

    • Analysis Process : Cette section liste la chaîne de preuves que l'IA a utilisée pour parvenir à ses conclusions, augmentant ainsi la crédibilité des résultats.

    • Solution and prevention suggestions : Fournit des étapes concrètes et actionnables pour résoudre le problème, ainsi que des recommandations à long terme pour éviter qu'il ne se reproduise.

    Anomaly Detection
    • Root Cause: The task failed because the exclusive resource group (ID: 70b78c03-d6b9-4234-bde9-e0da1e6e8c33) has expired. The system detected that the resource group was unavailable when trying to start the task, which threw a BillException and terminated the task execution.
    Analysis Process
    1. Initial Status Check:
       • Called get_task_instance and found the instance status was "Failed".
    2. Log Analysis:
       • Used analyze_task_instance_log and get_task_instance_log to view detailed error logs, confirming the failure reason as "exclusive resource group has expired".
    3. Change and Operation Record Check:
       • Used list_task_changes and found the last change was on 2026-02-01, which was an update to the task itself.
       • list_task_operations shows that the resource group for this task was changed on 2026-02-01 (from yunshi_dataxcdc_pre_resource to dgc_checker_test_rescource_dlf), but this did not resolve the issue.
    4. Code Review:
       • Reviewed the task code (get_task_instance_code) and found it to be a standard PyODPS data writing script with no apparent logical errors or improper resource requests.
  4. Mettre en œuvre la solution

    Suivez les recommandations fournies dans le rapport.

    • Mesures immédiates : Le rapport fournit généralement des actions rapides directement liées au problème. Par exemple, pour un problème de groupe de ressources, il peut proposer un raccourci pour modifier le groupe de ressources de la tâche. Il vous suffit de répondre par Yes, et l'IA vous assistera dans la modification du groupe de ressources.

      La section Solution and prevention suggestions de Copilot inclut à la fois des Immediate measures (accéder à la page Exclusive Resource Group Management pour vérifier l'état du groupe de ressources, renouveler le service ou réattribuer la tâche à un groupe de ressources valide) et des optimisations à Long-term optimization (établir un mécanisme de surveillance pour l'expiration des groupes de ressources et examiner périodiquement les dépendances des groupes de ressources des tâches).

      Copilot affiche un formulaire de confirmation Modify Instance Resource Group, en remplissant automatiquement les paramètres tels que Environment, Task Instance ID List, Workspace, Resource Group et Is Business Process Instance. Après avoir confirmé que les informations sont correctes, cliquez sur Confirm and Execute pour terminer la modification.

    • Opérations interactives : Si le rapport ne fournit pas d'action spécifique, vous pouvez continuer à saisir des commandes dans la zone de dialogue pour résoudre le problème. Par exemple, vous pouvez taper « modify the resource group for task xxx », et Copilot vous guidera tout au long du processus. Grâce à l'interaction en langage naturel, l'IA peut comprendre dynamiquement des exigences contextuelles complexes, simplifiant les opérations et les rendant adaptées aux scénarios d'O&M non structurés.

      Copilot interroge automatiquement l'état de l'instance de tâche et affiche un formulaire de confirmation avec des champs tels que Environment, Task Instance ID List, Workspace, Resource Group et Is Business Process Instance. Après avoir confirmé que les informations sont correctes, cliquez sur Confirm and Execute pour terminer l'opération.

Remarque

Le rapport de diagnostic et les solutions suggérées varient en fonction de la cause de l'échec. Les résultats peuvent différer selon votre situation spécifique. Pour obtenir la liste des opérations prises en charge, consultez Opérations O&M prises en charge.

Remarques d'utilisation

  • Pour les diagnostics au niveau de l'espace de travail ou lorsque de nombreuses instances sont impliquées, la réponse peut être retardée de 1 à 5 minutes.

  • L'analyse des dépendances inter-espaces de travail est prise en charge, mais vous devez être membre de l'espace de travail cible pour afficher les détails de l'analyse.

Activer le diagnostic IA

L'O&M assistée par l'IA est accessible depuis plusieurs points d'entrée dans DataWorks.

Point d'entrée global (Copilot)

Sur n'importe quelle page DataWorks, ouvrez la boîte de dialogue Copilot dans le coin supérieur droit, basculez Copilot en mode Agent et sélectionnez /Data O&M.

Vous pouvez saisir Diagnose instance: <Instance ID>, utiliser @<Instance ID> pour fournir un contexte, pour démarrer un diagnostic.

Remarque

Au point d'entrée global, vous devez utiliser /Data O&M pour spécifier l'agent. Dans les points d'entrée contextuels, cela n'est pas nécessaire car l'agent O&M est utilisé par défaut.

Points d'entrée contextuels

Emplacement

Actions

Operation Center > AI operations and maintenance

Dans Operation Center, cliquez sur AI-powered O&M dans le volet de navigation de gauche.

Operation Center > Liste des instances

Dans la colonne Actions, cliquez sur More > AI Diagnostics. Cela vous permet de diagnostiquer les instances cycliques, de test et de backfill.

Operation Center > DAG

Survolez une instance de nœud et cliquez sur le bouton AI Diagnostics.

Onglet Journal d'exécution de l'instance

Sur la page de diagnostic des journaux, cliquez sur le bouton AI Diagnostics en haut pour ouvrir automatiquement Copilot et soumettre la commande de diagnostic.

Page Diagnostic des journaux

Dans la boîte de dialogue au milieu de la page, activez AI Diagnostics, saisissez un ID d'instance ou d'espace de travail et démarrez le diagnostic.

Remarque : Le bouton « Intelligent Diagnosis » original a été renommé en Log Diagnosis et analyse désormais le contenu actuel du journal.

Scénarios de diagnostic pris en charge

Problèmes au niveau de l'instance

Type de problème

Exemple de commande

Échec de tâche

Diagnose instance: <Instance ID> ou utilisez @<Instance ID> pour fournir un contexte.

Exécution lente

Why is instance <Instance ID> running slower today?

Temps d'attente long

Check why instance <Instance ID> is still waiting.

Blocage de dépendance

Which parent nodes of instance <Instance ID> have failed?

Opérations O&M prises en charge

Dans le rapport de diagnostic ou la boîte de dialogue Copilot, vous pouvez effectuer les opérations suivantes sur des tâches ou des instances au sein d'un espace de travail, individuellement ou par lots :

Important

Vous devez examiner et autoriser toute opération dans la boîte de dialogue IA avant qu'elle ne soit exécutée.

Actions

Description

Rerun instance

Relance l'instance actuelle.

Set as successful

Marque de force l'instance comme réussie.

Suspend/Resume instance

Contrôle l'état de planification.

Modify resource group

Change le groupe de ressources.

Modify priority

Ajuste la priorité de planification, ce qui affecte la planification de la ligne de base.

Refresh instance

Actualise la configuration de l'instance à son dernier état.

Vous devez disposer du rôle Project Owner ou O&M pour l'espace de travail cible.