Tous les produits
Search
Centre de documentation

DataWorks:Data Studio (nouvelle version)

Dernière mise à jour :Aug 10, 2026

Plateforme intelligente de développement de data lakehouse qui s'intègre à plusieurs services de calcul Alibaba Cloud pour fournir des fonctionnalités ETL, la gestion de catalogue de données et l'orchestration de workflows multi-moteurs. Data Studio prend en charge le développement Python, l'analyse via Notebook, l'intégration Git et un écosystème de plugins qui unifie le traitement en temps réel et par lots, l'architecture lakehouse ainsi que le Big Data et l'IA pour une gestion complète du cycle de vie Data+AI.

Qu'est-ce que Data Studio ?

Data Studio s'intègre à des dizaines de services de calcul Big Data et IA d'Alibaba Cloud, notamment MaxCompute, E-MapReduce, Hologres, Flink et PAI, afin de proposer un développement ETL intelligent pour les entrepôts de données, les lacs de données et les architectures OpenLake lakehouse. Ses principales fonctionnalités incluent :

  • Catalogue de données : Gestion des métadonnées conçue spécifiquement pour les environnements lakehouse.

  • Workflow : Orchestre les nœuds de traitement de données en temps réel et par lots, ainsi que les nœuds IA, sur des dizaines de types de moteurs.

  • Environnement de développement personnel : Développement et débogage de nœuds Python, analyse interactive via Notebook et gestion du code basée sur Git, intégrée au stockage NAS/OSS.

  • Notebook : Outil interactif pour le développement et l'analyse de données. Exécutez ou déboguez du code SQL ou Python sur plusieurs moteurs de données et visualisez instantanément les résultats.

Activer le nouveau Data Studio

Pour activer le nouveau Data Studio :

  • Lors de la création d'un espace de travail, sélectionnez Use Data Studio (New Version). Pour plus de détails, consultez la rubrique Créer un espace de travail.

  • Dans l'ancien DataStudio, cliquez sur le bouton DataStudio en haut de la page, puis cliquez sur Upgrade to New Version et suivez les instructions pour migrer vos données vers le nouveau Data Studio.

    image

  • Le nouveau Data Studio est disponible dans les régions suivantes : Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Malaisie (Kuala Lumpur), Indonésie (Jakarta), Thaïlande (Bangkok), Allemagne (Francfort), Royaume-Uni (Londres), États-Unis (Silicon Valley), États-Unis (Virginie).

Important
  • Si vous rencontrez des problèmes lors de l'utilisation du nouveau Data Studio, rejoignez le groupe de support DingTalk dédié à la mise à niveau vers le nouveau Data Studio.

  • Les données du nouveau Data Studio et de l'ancien DataStudio sont totalement séparées et ne peuvent pas être partagées.

  • La mise à niveau de l'ancien DataStudio vers la nouvelle version est irréversible. Une fois la mise à niveau effectuée avec succès, vous ne pouvez pas revenir à l'ancienne version. Avant de basculer, créez un espace de travail de test avec le nouveau Data Studio activé pour vérifier qu'il répond à vos besoins métier.

  • À partir du 19 février 2025, lorsqu'un compte racine crée un espace de travail DataWorks pour la première fois dans une région prise en charge, le nouveau Data Studio sera activé par défaut. L'ancien DataStudio ne sera plus disponible.

Accéder à Data Studio

Accédez à la page Workspaces dans la console DataWorks. Dans la barre de navigation supérieure, sélectionnez la région souhaitée. Repérez l'espace de travail concerné et choisissez Shortcuts > Data Studio dans la colonne Actions.

Remarque
  • Cette entrée n'est visible que pour les espaces de travail où l'option Use Data Studio (New Version) est activée. Pour plus de détails, consultez la section Activer le nouveau Data Studio.

  • Data Studio fonctionne uniquement sur la version 69 ou ultérieure du navigateur Chrome sur ordinateur.

Principales fonctionnalités de Data Studio

Data Studio offre les fonctionnalités clés suivantes. Pour plus d'informations, consultez l'Annexe : Concepts liés au développement de données.

Type

Description

Gestion des flux

DataWorks propose un modèle de développement basé sur les Workflow. Les workflows utilisent une interface visuelle basée sur un DAG pour simplifier la gestion de pipelines de tâches complexes d'un point de vue métier.

Pour plus d'informations, consultez les rubriques Orchestration de workflows récurrents, Workflows déclenchés par des événements et Workflows déclenchés manuellement.

Remarque

Dans Data Studio, chaque espace de travail présente les limites suivantes concernant les nœuds et objets de workflow internes :

  • Nœuds internes : Chaque workflow prend en charge jusqu'à 400 nœuds.

  • Objets (workflows, nœuds, fichiers, tables, ressources et fonctions) : Les utilisateurs disposant de l'édition Enterprise de DataWorks peuvent créer jusqu'à 200 000 objets. Les utilisateurs disposant des éditions Professional, Standard ou Basic de DataWorks peuvent créer jusqu'à 100 000 objets.

Si votre espace de travail atteint ces limites, vous ne pourrez pas créer de nouveaux workflows ou objets.

Développement de tâches

  • Fonctionnalités enrichies :

    • Diversité de nœuds moteur avec une encapsulation complète des fonctionnalités du moteur.

    • Nœuds polyvalents pour une logique complexe lorsqu'ils sont combinés aux nœuds moteur, par exemple pour les déclencheurs de systèmes externes, les vérifications d'objets fichier, les branches conditionnelles, l'exécution en boucle et le passage de résultats.

    • Prend en charge les tâches de traitement de flux Flink utilisant Realtime Compute for Apache Flink, et permet le développement collaboratif entre Flink et des moteurs tels que MaxCompute et Hologres.

  • Opérations simplifiées :

    • Générateur de workflow visuel : faites glisser et déposez des composants pour orchestrer rapidement des tâches multi-moteurs.

    • Éditeur SQL intelligent avec suggestion de code, affichage visuel de la structure des opérateurs et vérification des autorisations.

Pour connaître les types de nœuds pris en charge, consultez la rubrique Développement de nœuds.

Planification des tâches

  • Méthodes de déclenchement : Prend en charge les déclencheurs de systèmes externes, les déclencheurs d'événements et la planification déclenchée en amont via l'analyse automatique de la lignée.

  • Types de dépendance : Prend en charge les dépendances intra-cycle et inter-cycles, ainsi que les dépendances mutuelles entre différents cycles de planification et types de tâches.

  • Contrôle d'exécution : Vous permet de configurer si une tâche peut être réexécutée, de contrôler le timing de la planification en aval en fonction des tâches en amont, de définir les dates d'effet pour les tâches planifiées et de définir les comportements de planification, par exemple le mode dry-run (ignorer l'exécution sans bloquer les tâches en aval) ou le gel (ignorer l'exécution et bloquer les tâches en aval).

  • Garantie d'idempotence : Propose un mécanisme de réexécution avec des conditions personnalisables et un nombre de tentatives configurable.

Pour plus de détails sur la planification, consultez la rubrique Configuration de la planification des nœuds.

Contrôle qualité

Publication standardisée des tâches avec plusieurs mécanismes de contrôle qualité :

  • Revue de code : Nécessite une revue de code manuelle avant la publication pour bloquer les plannings de production problématiques.

  • Vérifications de validation : Intègre les vérifications des éléments de gouvernance issues de la gouvernance des données et la logique de validation personnalisée des extensions pour automatiser et personnaliser les contrôles de soumission et de publication.

  • Data Quality : Lie la surveillance de la qualité aux nœuds de planification, déclenchant la validation des règles après l'achèvement de la tâche pour aider à détecter immédiatement les problèmes de données.

Autres

Interface de Data Studio

Consultez le Guide des fonctionnalités de Data Studio pour découvrir la disposition de l'interface et savoir comment utiliser chaque module.

Flux de travail de développement de tâches

DataWorks prend en charge les tâches de synchronisation en temps réel, les tâches planifiées hors ligne (y compris la synchronisation hors ligne et les jobs de transformation) et les tâches déclenchées manuellement. Pour les capacités de synchronisation des données, consultez le module Data Integration.

Les espaces de travail DataWorks fonctionnent soit en mode standard, soit en mode basic. Les flux de travail de développement de tâches diffèrent selon le mode, comme illustré ci-dessous.

Flux de travail de développement d'un espace de travail en mode standard

Flux de travail en mode basic

  • Flux de travail de base : En mode standard, le développement de tâches planifiées comprend des étapes telles que le développement, le débogage, la configuration de la planification, la publication et l'O&M. Pour le processus de développement général, consultez la rubrique Présentation du nouveau Data Studio.

  • Contrôle du flux de travail : Pendant le développement, combinez la revue de code intégrée, les vérifications prédéfinies de gouvernance des données et la logique de validation personnalisée des extensions de la plateforme ouverte pour garantir la conformité des tâches aux normes.

Approches de développement de données

Data Studio vous permet de personnaliser votre processus de développement. Créez des pipelines de données à l'aide de workflows, ou créez manuellement des nœuds de tâches et configurez les dépendances.

Pour plus de détails, consultez la rubrique Workflows.

Types de nœuds pris en charge dans Data Studio

Data Studio prend en charge des dizaines de types de nœuds, notamment l'intégration de données, MaxCompute, Hologres, EMR, Flink, Python, Notebook et ADB, dont beaucoup prennent en charge la planification récurrente. Choisissez le type de nœud approprié en fonction de vos besoins métier. Pour la liste complète, consultez la rubrique Types de nœuds pris en charge.

Annexe : Concepts clés du développement de données

Développement de tâches

Concept

Description

Workflow

Approche de développement visuelle basée sur un DAG qui simplifie les pipelines de tâches complexes d'un point de vue métier. Les workflows prennent en charge l'orchestration de dizaines de types de nœuds, notamment l'intégration de données, MaxCompute, Hologres, EMR, Flink, Python, Notebook et ADB, et offrent une planification au niveau du workflow. Ils prennent en charge les workflows récurrents et déclenchés par des événements.

Workflow déclenché manuellement

Ensemble de tâches, tables, ressources et fonctions répondant à un besoin métier spécifique.

Contrairement aux workflows récurrents, les tâches des workflows déclenchés manuellement doivent être lancées manuellement plutôt que selon un planning.

Nœud de tâche

Unité d'exécution de base dans DataWorks. Data Studio propose plusieurs types de nœuds : des nœuds d'intégration de données pour la synchronisation, des nœuds de calcul moteur pour le nettoyage des données (tels que ODPS SQL, Hologres SQL, EMR Hive) et des nœuds polyvalents pour une logique complexe (tels que les nœuds zero load pour gérer plusieurs nœuds ou les nœuds do-while pour les boucles). La combinaison de ces nœuds répond à divers besoins de traitement de données.

Planification des tâches

Concept

Description

Dépendance

Les dépendances définissent l'ordre d'exécution entre les tâches. Si le nœud B s'exécute uniquement après l'achèvement du nœud A, alors A est la dépendance en amont de B (ou B dépend de A). Dans un DAG, les dépendances apparaissent sous forme de flèches entre les nœuds.

Nom de sortie

Nom du point de sortie d'une tâche. Au sein d'un même locataire (compte Alibaba Cloud), cette entité virtuelle connecte les tâches en amont et en aval lorsque vous définissez des dépendances.

Lors de la définition des dépendances entre les tâches, utilisez le nom de sortie, et non le nom ou l'ID du nœud. Une fois configuré, ce nom de sortie devient le nom d'entrée pour le nœud en aval.

Nom de la table de sortie

Définissez le nom de la table de sortie pour qu'il corresponde à la table de sortie réelle de la tâche actuelle. Cela aide les tâches en aval à confirmer qu'elles utilisent les données en amont attendues. Ne modifiez pas manuellement les noms de tables de sortie générés automatiquement ; ils servent uniquement d'identifiants et n'affectent pas la table réelle produite par votre script SQL, qui est déterminée par la logique SQL elle-même.

Remarque

Le Output Name d'un nœud doit être globalement unique, mais son Output table name n'est pas soumis à cette restriction.

Groupe de ressources de planification

Groupe de ressources utilisé pour la planification des tâches.

Paramètres de planification

Les paramètres de planification sont des variables dans votre code qui reçoivent des valeurs dynamiques au moment de l'exécution. Pour accéder aux informations contextuelles telles que la date ou l'heure lors d'exécutions répétées, définissez des variables à l'aide de la syntaxe des paramètres de planification DataWorks.

Horodatage des données

Date associée à une activité métier, indiquant quand les données métier correspondantes ont été générées. Ce concept est particulièrement important dans les scénarios de calcul hors ligne. Par exemple, dans le secteur de la vente au détail, le chiffre d'affaires pour le 20241010 est souvent calculé tôt le matin du 20241011. Le résultat correspond au chiffre d'affaires réel du 20241010. Dans ce cas, 20241010 est l'horodatage des données.

Heure planifiée

Heure exacte, à la minute près, que vous définissez pour l'exécution d'une tâche récurrente.

Important

L'arrivée à l'heure planifiée ne garantit pas une exécution immédiate. DataWorks vérifie que les tâches en amont ont réussi, que l'heure planifiée est passée et que suffisamment de ressources de planification sont disponibles. La tâche n'est déclenchée que lorsque toutes ces conditions sont remplies.