Plateforme intelligente de développement de data lakehouse qui s'intègre à plusieurs services de calcul Alibaba Cloud pour fournir des fonctionnalités ETL, la gestion de catalogue de données et l'orchestration de workflows multi-moteurs. Data Studio prend en charge le développement Python, l'analyse via Notebook, l'intégration Git et un écosystème de plugins qui unifie le traitement en temps réel et par lots, l'architecture lakehouse ainsi que le Big Data et l'IA pour une gestion complète du cycle de vie Data+AI.
Qu'est-ce que Data Studio ?
Data Studio s'intègre à des dizaines de services de calcul Big Data et IA d'Alibaba Cloud, notamment MaxCompute, E-MapReduce, Hologres, Flink et PAI, afin de proposer un développement ETL intelligent pour les entrepôts de données, les lacs de données et les architectures OpenLake lakehouse. Ses principales fonctionnalités incluent :
Catalogue de données : Gestion des métadonnées conçue spécifiquement pour les environnements lakehouse.
Workflow : Orchestre les nœuds de traitement de données en temps réel et par lots, ainsi que les nœuds IA, sur des dizaines de types de moteurs.
Environnement de développement personnel : Développement et débogage de nœuds Python, analyse interactive via Notebook et gestion du code basée sur Git, intégrée au stockage NAS/OSS.
Notebook : Outil interactif pour le développement et l'analyse de données. Exécutez ou déboguez du code SQL ou Python sur plusieurs moteurs de données et visualisez instantanément les résultats.
Activer le nouveau Data Studio
Pour activer le nouveau Data Studio :
Lors de la création d'un espace de travail, sélectionnez Use Data Studio (New Version). Pour plus de détails, consultez la rubrique Créer un espace de travail.
-
Dans l'ancien DataStudio, cliquez sur le bouton DataStudio en haut de la page, puis cliquez sur Upgrade to New Version et suivez les instructions pour migrer vos données vers le nouveau Data Studio.

Le nouveau Data Studio est disponible dans les régions suivantes : Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Zhangjiakou), Chine (Ulanqab), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Malaisie (Kuala Lumpur), Indonésie (Jakarta), Thaïlande (Bangkok), Allemagne (Francfort), Royaume-Uni (Londres), États-Unis (Silicon Valley), États-Unis (Virginie).
Si vous rencontrez des problèmes lors de l'utilisation du nouveau Data Studio, rejoignez le groupe de support DingTalk dédié à la mise à niveau vers le nouveau Data Studio.
Les données du nouveau Data Studio et de l'ancien DataStudio sont totalement séparées et ne peuvent pas être partagées.
La mise à niveau de l'ancien DataStudio vers la nouvelle version est irréversible. Une fois la mise à niveau effectuée avec succès, vous ne pouvez pas revenir à l'ancienne version. Avant de basculer, créez un espace de travail de test avec le nouveau Data Studio activé pour vérifier qu'il répond à vos besoins métier.
À partir du 19 février 2025, lorsqu'un compte racine crée un espace de travail DataWorks pour la première fois dans une région prise en charge, le nouveau Data Studio sera activé par défaut. L'ancien DataStudio ne sera plus disponible.
Accéder à Data Studio
Accédez à la page Workspaces dans la console DataWorks. Dans la barre de navigation supérieure, sélectionnez la région souhaitée. Repérez l'espace de travail concerné et choisissez dans la colonne Actions.
Cette entrée n'est visible que pour les espaces de travail où l'option Use Data Studio (New Version) est activée. Pour plus de détails, consultez la section Activer le nouveau Data Studio.
Data Studio fonctionne uniquement sur la version 69 ou ultérieure du navigateur Chrome sur ordinateur.
Principales fonctionnalités de Data Studio
Data Studio offre les fonctionnalités clés suivantes. Pour plus d'informations, consultez l'Annexe : Concepts liés au développement de données.
|
Type |
Description |
|
Gestion des flux |
DataWorks propose un modèle de développement basé sur les Workflow. Les workflows utilisent une interface visuelle basée sur un DAG pour simplifier la gestion de pipelines de tâches complexes d'un point de vue métier. Pour plus d'informations, consultez les rubriques Orchestration de workflows récurrents, Workflows déclenchés par des événements et Workflows déclenchés manuellement. Remarque
Dans Data Studio, chaque espace de travail présente les limites suivantes concernant les nœuds et objets de workflow internes :
Si votre espace de travail atteint ces limites, vous ne pourrez pas créer de nouveaux workflows ou objets. |
|
Développement de tâches |
Pour connaître les types de nœuds pris en charge, consultez la rubrique Développement de nœuds. |
|
Planification des tâches |
Pour plus de détails sur la planification, consultez la rubrique Configuration de la planification des nœuds. |
|
Contrôle qualité |
Publication standardisée des tâches avec plusieurs mécanismes de contrôle qualité :
|
|
Autres |
|
Interface de Data Studio
Consultez le Guide des fonctionnalités de Data Studio pour découvrir la disposition de l'interface et savoir comment utiliser chaque module.
Flux de travail de développement de tâches
DataWorks prend en charge les tâches de synchronisation en temps réel, les tâches planifiées hors ligne (y compris la synchronisation hors ligne et les jobs de transformation) et les tâches déclenchées manuellement. Pour les capacités de synchronisation des données, consultez le module Data Integration.
Les espaces de travail DataWorks fonctionnent soit en mode standard, soit en mode basic. Les flux de travail de développement de tâches diffèrent selon le mode, comme illustré ci-dessous.
Flux de travail de développement d'un espace de travail en mode standard
Flux de travail en mode basic
Flux de travail de base : En mode standard, le développement de tâches planifiées comprend des étapes telles que le développement, le débogage, la configuration de la planification, la publication et l'O&M. Pour le processus de développement général, consultez la rubrique Présentation du nouveau Data Studio.
Contrôle du flux de travail : Pendant le développement, combinez la revue de code intégrée, les vérifications prédéfinies de gouvernance des données et la logique de validation personnalisée des extensions de la plateforme ouverte pour garantir la conformité des tâches aux normes.
Approches de développement de données
Data Studio vous permet de personnaliser votre processus de développement. Créez des pipelines de données à l'aide de workflows, ou créez manuellement des nœuds de tâches et configurez les dépendances.
Pour plus de détails, consultez la rubrique Workflows.
Types de nœuds pris en charge dans Data Studio
Data Studio prend en charge des dizaines de types de nœuds, notamment l'intégration de données, MaxCompute, Hologres, EMR, Flink, Python, Notebook et ADB, dont beaucoup prennent en charge la planification récurrente. Choisissez le type de nœud approprié en fonction de vos besoins métier. Pour la liste complète, consultez la rubrique Types de nœuds pris en charge.
Annexe : Concepts clés du développement de données
Développement de tâches
|
Concept |
Description |
|
Workflow |
Approche de développement visuelle basée sur un DAG qui simplifie les pipelines de tâches complexes d'un point de vue métier. Les workflows prennent en charge l'orchestration de dizaines de types de nœuds, notamment l'intégration de données, MaxCompute, Hologres, EMR, Flink, Python, Notebook et ADB, et offrent une planification au niveau du workflow. Ils prennent en charge les workflows récurrents et déclenchés par des événements. |
|
Workflow déclenché manuellement |
Ensemble de tâches, tables, ressources et fonctions répondant à un besoin métier spécifique. Contrairement aux workflows récurrents, les tâches des workflows déclenchés manuellement doivent être lancées manuellement plutôt que selon un planning. |
|
Nœud de tâche |
Unité d'exécution de base dans DataWorks. Data Studio propose plusieurs types de nœuds : des nœuds d'intégration de données pour la synchronisation, des nœuds de calcul moteur pour le nettoyage des données (tels que ODPS SQL, Hologres SQL, EMR Hive) et des nœuds polyvalents pour une logique complexe (tels que les nœuds zero load pour gérer plusieurs nœuds ou les nœuds do-while pour les boucles). La combinaison de ces nœuds répond à divers besoins de traitement de données. |
Planification des tâches
|
Concept |
Description |
|
Dépendance |
Les dépendances définissent l'ordre d'exécution entre les tâches. Si le nœud B s'exécute uniquement après l'achèvement du nœud A, alors A est la dépendance en amont de B (ou B dépend de A). Dans un DAG, les dépendances apparaissent sous forme de flèches entre les nœuds. |
|
Nom de sortie |
Nom du point de sortie d'une tâche. Au sein d'un même locataire (compte Alibaba Cloud), cette entité virtuelle connecte les tâches en amont et en aval lorsque vous définissez des dépendances. Lors de la définition des dépendances entre les tâches, utilisez le nom de sortie, et non le nom ou l'ID du nœud. Une fois configuré, ce nom de sortie devient le nom d'entrée pour le nœud en aval. |
|
Nom de la table de sortie |
Définissez le nom de la table de sortie pour qu'il corresponde à la table de sortie réelle de la tâche actuelle. Cela aide les tâches en aval à confirmer qu'elles utilisent les données en amont attendues. Ne modifiez pas manuellement les noms de tables de sortie générés automatiquement ; ils servent uniquement d'identifiants et n'affectent pas la table réelle produite par votre script SQL, qui est déterminée par la logique SQL elle-même. Remarque
Le Output Name d'un nœud doit être globalement unique, mais son Output table name n'est pas soumis à cette restriction. |
|
Groupe de ressources de planification |
Groupe de ressources utilisé pour la planification des tâches. |
|
Paramètres de planification |
Les paramètres de planification sont des variables dans votre code qui reçoivent des valeurs dynamiques au moment de l'exécution. Pour accéder aux informations contextuelles telles que la date ou l'heure lors d'exécutions répétées, définissez des variables à l'aide de la syntaxe des paramètres de planification DataWorks. |
|
Horodatage des données |
Date associée à une activité métier, indiquant quand les données métier correspondantes ont été générées. Ce concept est particulièrement important dans les scénarios de calcul hors ligne. Par exemple, dans le secteur de la vente au détail, le chiffre d'affaires pour le 20241010 est souvent calculé tôt le matin du 20241011. Le résultat correspond au chiffre d'affaires réel du 20241010. Dans ce cas, 20241010 est l'horodatage des données. |
|
Heure planifiée |
Heure exacte, à la minute près, que vous définissez pour l'exécution d'une tâche récurrente. Important
L'arrivée à l'heure planifiée ne garantit pas une exécution immédiate. DataWorks vérifie que les tâches en amont ont réussi, que l'heure planifiée est passée et que suffisamment de ressources de planification sont disponibles. La tâche n'est déclenchée que lorsque toutes ces conditions sont remplies. |