Tous les produits
Search
Centre de documentation

DataWorks:DataStudio (hérité)

Dernière mise à jour :Aug 10, 2026

DataStudio est le module de DataWorks dédié au développement et à la planification des tâches périodiques. Il s'intègre à Operation Center et offre une interface de développement visuelle pour les moteurs de calcul tels que MaxCompute, Hologres et E-MapReduce. Avec ses fonctionnalités de développement de code intelligent, ses workflows hybrides multi-moteurs et sa publication standardisée des tâches, DataStudio vous aide à construire des entrepôts de données hors ligne, des entrepôts de données en temps réel et des systèmes de requêtes ad hoc.

Accédez à DataStudio

Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur Data Development and O&M > Data Development dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante, puis cliquez sur Go to Data Development.

Remarque

DataStudio est pris en charge uniquement sur Google Chrome 69 ou version ultérieure sur PC.

Présentation

Fonctionnalités

Le tableau suivant décrit les principales fonctionnalités de DataStudio. Les termes clés sont définis dans la section Annexe : Concepts.

image

Type

Description

Organisation et gestion des objets

DataStudio organise et gère les objets selon les méthodes suivantes :

  • Organisation des objets : Gestion à deux niveaux avec Solution > workflow. Les objets sont organisés par workflow dans une arborescence de répertoires et un panneau visuel. Créez des objets dans l'arborescence ou faites glisser et déposez des composants sur le panneau pour construire des flux de données. Les solutions regroupent les workflows connexes.

  • Gestion des objets : Créez et gérez les nœuds, les tables, les ressources et les fonctions via une interface visuelle.

Créer un workflow. Modes de gestion.

Remarque

Dans DataStudio, les limites suivantes s'appliquent au nombre de workflows et d'objets que vous pouvez créer dans un espace de travail :

  • Workflows : Vous pouvez créer un maximum de 10 000 workflows.

  • Objets (nœuds, fichiers, tables, ressources et fonctions) : Si vous disposez de l'édition Enterprise de DataWorks, vous pouvez créer un maximum de 200 000 objets. Si vous disposez des éditions Professional, Standard ou Basic de DataWorks, vous pouvez créer un maximum de 100 000 objets.

Si le nombre de workflows ou d'objets dans l'espace de travail actuel atteint la limite supérieure, vous ne pouvez pas en créer de nouveaux.

Développement de tâches

  • Fonctionnalités étendues :

    • Prend en charge une large gamme de nœuds de moteur de calcul.

    • Fournit des nœuds polyvalents pour une logique complexe : déclencheurs externes, vérifications de fichiers, branches conditionnelles, boucles et transmission de sortie.

  • Opérations simplifiées :

    • Éditeur de workflow visuel permettant l'orchestration par glisser-déposer des tâches multi-moteurs.

    • Éditeur SQL intelligent avec suggestions intelligentes, structures d'opérateurs visuelles et vérifications des autorisations.

Tous les types de nœuds disponibles sont répertoriés dans la section Types de nœuds pris en charge.

Planification des tâches

  • Méthodes de déclenchement : Prend en charge les déclencheurs externes, les déclencheurs basés sur des événements et les déclencheurs basés sur les dépendances analysés à partir de la lignée de données.

  • Types de dépendance : Prend en charge les dépendances intra-cycle et inter-cycle pour différents types de tâches et cycles de planification.

  • Contrôle d'exécution : Configurez les politiques de réexécution, le contrôle de la planification en aval, les dates d'effet et les types de planification tels que le test à blanc (ignore l'exécution, ne bloque pas l'aval) ou le gel (ignore l'exécution, bloque l'aval).

  • Idempotence : Prend en charge les conditions de réexécution personnalisées et les nombres de réexécution.

Configurer les propriétés temporelles. Guide de configuration des dépendances de planification.

Débogage des tâches

DataStudio prend en charge le débogage des tâches individuelles et des workflows entiers. Processus de débogage des tâches.

Contrôle des processus

Fournit une publication standardisée des tâches et un contrôle des processus :

Autres fonctionnalités

Présentation de l'interface utilisateur

Suivez le guide des fonctionnalités de DataStudio pour découvrir l'interface de développement de données et savoir comment utiliser les fonctionnalités de chaque module.

Processus de développement

DataStudio prend en charge les tâches de synchronisation en temps réel, les tâches planifiées hors ligne (y compris la synchronisation et le traitement) et les tâches déclenchées manuellement pour divers moteurs de calcul. Pour les capacités de synchronisation des données, consultez la section Intégration des données. Avant de commencer, comprenez les exigences de développement pour chaque moteur de calcul et choisissez le type de tâche approprié.

  • Guides de développement des moteurs de calcul : DataWorks prend en charge diverses sources de données et moteurs de calcul. Les exigences de configuration varient selon le moteur. Principaux guides pour les moteurs de calcul :

  • Processus de développement général : Les espaces de travail DataWorks fonctionnent en mode standard et mode basic. Le processus de développement diffère légèrement selon les modes.

    Processus de développement dans un espace de travail en mode standard.Development process in standard mode

    Processus de développement dans un espace de travail en mode basic.Development process in basic mode

    • Processus de base : En mode standard, le cycle de vie des tâches planifiées comprend le développement, le débogage, la configuration de la planification, la validation, la publication et les opérations et maintenance (O&M). Guide du processus de développement de données.

    • Contrôle des processus : Utilisez la revue de code et les tests de fumée intégrés, les vérifications prédéfinies dans le Data Governance Center, ainsi que la validation personnalisée via les extensions de la plateforme ouverte pour garantir la conformité aux normes.

      Remarque

      Les options de contrôle des processus varient selon le mode de l'espace de travail. Les fonctionnalités disponibles dans la console font foi.

Organisation

Dans DataStudio, un workflow constitue l'unité de base pour le développement de code et l'organisation des ressources. Les workflows et les nœuds de tâches sont développés indépendamment dans chaque espace de travail et ne s'influencent pas mutuellement. Créer un workflow.

Les workflows sont présentés sous forme d'arborescence de répertoires et de panneau d'opérations, ce qui vous aide à organiser le code d'un point de vue métier.

  • Structure de l'arborescence de répertoires : Offre un moyen d'organiser le code en fonction des types de tâches.

  • Panneau de workflow : Fournit un affichage orienté processus de la logique métier.

Development organization structure

Premiers pas

Prérequis

Pour développer des tâches, modéliser des données ou planifier des tâches périodiques dans DataWorks, vous devez associer vos sources de données ou clusters en tant que ressources de calcul dans DataStudio. Sans cette association, vous ne pouvez pas créer de nœuds de développement de données.

  1. Créez les sources de données ou les clusters requis pour les types de tâches prévus.

    Source de données ou cluster

    Description

    Associer une ressource de calcul MaxCompute

    DataWorks associe automatiquement la première source de données MaxCompute. Associez manuellement les suivantes.

    Associer une ressource de calcul Hologres

    Associez manuellement ces sources de données après leur création.

    Associer une ressource de calcul AnalyticDB for PostgreSQL

    Associer une ressource de calcul AnalyticDB for MySQL 3.0

    Associer une ressource de calcul ClickHouse

    Enregistrer un cluster E-MapReduce dans DataWorks

    DataWorks associe automatiquement les clusters enregistrés. Aucune association manuelle n'est nécessaire.

    Enregistrer un cluster CDH ou CDP dans DataWorks

  2. Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur Data Development and O&M > Data Development dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante, puis cliquez sur Go to Data Development.

  3. Dans le volet de navigation de gauche, cliquez sur Computing Resources.

    Si le module Computing Resource ne figure pas dans le volet de navigation de gauche, ajoutez-le depuis les Paramètres personnels . Gestion des modules .
  4. Associez une ressource de calcul.

    Sur la page Computing Resource, recherchez la source de données ou le cluster cible par Computing Resource Name ou Computing Resource Type et cliquez sur Associate. Après l'association, vous pouvez utiliser la source de données pour le développement.

    Remarque

    Si les informations de la source de données changent, actualisez la page pour voir les mises à jour.

    image

    • Dans certains cas, l'association d'une source de données ou d'un cluster à DataStudio peut échouer :

      • L'association dépend de la configuration. Par exemple, les sources de données utilisant une paire AccessKey ne peuvent pas être associées. Consultez la page d'association pour connaître les limitations.

      • Il manque un environnement de développement ou de production à la source de données.

      • Une ressource de calcul MaxCompute ne peut pas être associée simultanément à plusieurs espaces de travail DataWorks.

      Remarque

      La plateforme affiche la raison de tout échec d'association.

    • Seuls MaxCompute, E-MapReduce, Hologres, AnalyticDB for MySQL, ClickHouse, CDH/CDP et AnalyticDB for PostgreSQL peuvent être associés à DataStudio.

    • Les types de sources de données associables et les limites varient selon l'édition de DataWorks. Fonctionnalités des différentes éditions de DataWorks.

Tutoriel

Démarrer avec le développement de données couvre les opérations de base et le processus de développement.

Types de nœuds pris en charge

DataStudio propose divers types de nœuds, dont beaucoup prennent en charge la planification périodique. Sélectionnez les nœuds en fonction de vos besoins métier. Types de nœuds pris en charge.

Annexe : Concepts

  • Développement de tâches

    |
    **Terme**
    |
    **Description**
    | | --- | --- | |
    **Solution**
    |
    Un ensemble de workflows gérés collectivement. Les workflows peuvent être réutilisés dans plusieurs Solutions pour la collaboration.
    | |
    **Workflow**
    |
    Un ensemble de tâches, de tables, de ressources et de fonctions répondant à une exigence métier. Les tâches s'exécutent selon un planning.
    | |
    **Workflow déclenché manuellement**
    |
    Un ensemble de tâches, de tables, de ressources et de fonctions répondant à une exigence métier spécifique.


    Contrairement aux workflows réguliers, les tâches d'un workflow déclenché manuellement doivent être lancées manuellement plutôt que de s'exécuter selon un planning.
    | |
    **DAG**
    |
    Abréviation de `directed acyclic graph` (graphe orienté acyclique). Affiche les nœuds et leurs dépendances. Dans DataStudio, toutes les tâches d'un workflow partagent un seul DAG.
    | |
    **Tâche**
    |
    L'unité d'exécution de base dans DataWorks. Les tâches s'exécutent séquentiellement en fonction des dépendances.
    | |
    **Nœud**
    |
    Représente une tâche dans un DAG. Les nœuds s'exécutent séquentiellement en fonction des dépendances.
    |






























  • Planification des tâches

    Terme

    Description

    Dépendance

    Définit l'ordre d'exécution entre les tâches. Si la tâche B s'exécute uniquement après l'achèvement de la tâche A, alors A est une dépendance amont de B. Cela se présente sous forme de flèches dans un DAG.

    Nom de sortie

    Identifiant globalement unique pour un nœud. Un nœud peut avoir plusieurs noms de sortie. DataWorks utilise les noms de sortie pour définir les dépendances de planification.

    Nom de table de sortie

    Nom de la table de sortie de la tâche, aidant les tâches en aval à confirmer la source de données correcte. Ne modifiez pas les noms de table de sortie générés automatiquement. Cet identifiant n'affecte pas le nom réel de la table, qui est déterminé par la logique SQL.

    Remarque

    Le Output Name d'un nœud doit être globalement unique, tandis qu'un Output Table Name n'est pas soumis à cette restriction.

    Groupe de ressources de planification

    Groupe de ressources utilisé pour la planification des tâches. Présentation des groupes de ressources DataWorks.

    Paramètre de planification

    Variables dans le code qui récupèrent dynamiquement les valeurs d'exécution telles que la date et l'heure. Définissez les paramètres de planification dans DataWorks pour attribuer des valeurs aux variables de code lors de l'exécution.

    Date métier

    Date à laquelle une transaction métier s'est produite. Dans le calcul hors ligne, il s'agit généralement de la veille du jour d'exécution de la tâche. Par défaut, DataWorks définit cette date à la veille de l'exécution de la tâche, avec une précision au jour. Par exemple, lors de la génération de statistiques sur les ventes d'hier, hier est la date métier.

    Heure de planification

    Heure prévue pour l'exécution planifiée d'une tâche, avec une précision à la seconde. L'heure de début réelle peut différer en raison de divers facteurs.