Tous les produits
Search
Centre de documentation

DataWorks:Présentation de Data Studio

Dernière mise à jour :Aug 10, 2026

Data Studio est une plateforme intelligente de développement de data lakehouse qui s'intègre aux services de calcul d'Alibaba Cloud pour les opérations ETL, la gestion du catalogue de données et l'orchestration de workflows multi-moteurs. Grâce à des environnements de développement personnels, à l'analyse via Notebook, au support Python, à l'intégration Git et à un écosystème riche de plugins, elle unifie le traitement en temps réel et hors ligne avec l'IA tout au long du cycle de vie complet Data+AI.

Data Studio

Data Studio est une plateforme intelligente de développement de data lakehouse fondée sur les meilleures pratiques d'Alibaba en matière de big data. Elle s'intègre aux services big data et IA d'Alibaba Cloud tels que MaxCompute, E-MapReduce, Hologres, Flink et PAI, et offre un développement ETL intelligent pour les entrepôts de données, les lacs de données et les architectures OpenLake. Ses principales fonctionnalités incluent :

  • Prise en charge des data lakehouses et multi-moteurs Accédez de manière transparente aux données des lacs de données (tels qu'OSS) et des entrepôts de données (tels que MaxCompute) via un catalogue de données unifié et un ensemble complet de nœuds moteur pour permettre un développement hybride multi-moteur.

  • Workflows flexibles et planification Utilisez un large éventail de nœuds de contrôle de flux pour orchestrer visuellement les tâches cross-engine dans un workflow. La plateforme prend en charge à la fois la planification périodique pilotée par le temps et la planification basée sur des déclencheurs pilotée par les événements.

  • Environnement de développement Data+AI ouvert Créez un poste de travail flexible pour la recherche et le développement en IA grâce à un environnement de développement personnel permettant des dépendances personnalisées, un Notebook prenant en charge le codage mixte SQL et Python, ainsi que des fonctionnalités telles que la gestion des datasets et l'intégration Git.

  • Assistance intelligente et ingénierie IA Le puissant Copilot intégré vous assiste tout au long du processus de développement du code. Des nœuds d'algorithme PAI professionnels et des nœuds de grands modèles offrent une prise en charge native pour l'ingénierie IA de bout en bout.

Concepts clés

Concept

Définition

Valeur principale

Mots-clés

Workflow

Une unité d'organisation et d'orchestration des tâches

Permet la gestion des dépendances et la planification automatisée pour les tâches complexes. Un workflow sert de conteneur pour le développement et la planification.

Visuel, DAG, périodique/basé sur des déclencheurs, orchestration

Nœud

La plus petite unité d'exécution dans un workflow

L'endroit où vous écrivez le code et implémentez une logique métier spécifique. Un nœud constitue l'opération atomique pour le traitement des données.

SQL, Python, Shell, intégration de données

Image personnalisée

Un snapshot standardisé d'un environnement

Garantit l'extensibilité, la cohérence et la reproductibilité de l'environnement.

Congélation de l'environnement, normalisation, réplication, cohérence

Planification

Règles de déclenchement automatique des tâches

Automatise la production de données en convertissant les tâches manuelles en charges de travail automatisées et prêtes pour la production.

Planification périodique, planification basée sur des déclencheurs, dépendance, automatisation

Catalogue de données

Un espace de travail unifié pour les métadonnées

Organise et gère les actifs de données (tels que les tables) et les ressources de calcul (telles que les fonctions et les ressources) de manière structurée.

Métadonnées, gestion des tables, profilage des données

Dataset

Un mappage logique vers un stockage externe

Connecte les données non structurées externes (images, documents) à l'environnement de développement, servant de pont de données clé pour le développement IA.

Intégration OSS/NAS, montage de données, données non structurées

Notebook

Une toile interactive de développement Data+AI

Combine le code SQL et Python pour accélérer l'exploration des données et la validation des algorithmes.

Interactif, multilingue, visuel, analyse exploratoire

Guide des processus Data Studio

Data Studio prend en charge le développement d’entrepôts de données ainsi que le développement lié à l’IA. La section suivante présente deux parcours courants. Adaptez-les selon vos besoins.

Parcours standard : Processus de développement d'entrepôt de données (tâches ETL périodiques)

Ce processus convient à la mise en place d'entrepôts de données de niveau entreprise, nécessitant un traitement par lots automatisé et stable.

  • Public cible : Ingénieurs données et développeurs ETL.

  • Objectif principal : Construire un entrepôt de données d'entreprise stable, normalisé et planifié automatiquement pour le traitement des données par lots et la génération de rapports.

  • Technologies clés : Data Catalog, workflows planifiés, nœuds SQL et paramètres de planification.

image

Étape

Phase

Opérations principales et objectifs

Chemin d'accès clé et références

1

Associer un moteur de calcul

Associez un ou plusieurs moteurs de calcul principaux (tels que MaxCompute) à l'espace de travail afin qu'ils servent d'environnement d'exécution pour toutes les tâches SQL.

Console > Workspace Settings

Pour plus d'informations, consultez la rubrique Associer des moteurs de calcul.

2

Gestion du Data Catalog

Créez ou explorez les structures de table requises pour chaque couche de l'entrepôt de données (ODS, DWD, ADS, etc.) dans le Data Catalog afin de définir les entrées et sorties du traitement des données.

Nous vous recommandons d'utiliser le module Data Modeling pour construire votre système d'entrepôt de données.

Data Studio > Data Catalog

Pour plus d'informations, consultez la rubrique Data Catalog.

3

Créer un workflow planifié

Créez un workflow planifié dans le répertoire du projet ; il servira de conteneur pour organiser et gérer les tâches ETL connexes.

Data Studio > Project Directory > Scheduled Workflow

Pour plus d'informations, consultez la rubrique Workflows planifiés.

4

Développement et débogage des nœuds

Créez des nœuds ODPS SQL ou d'autres types de nœuds, rédigez la logique ETL principale (nettoyage, transformation et agrégation des données) dans l'éditeur, puis déboguez les nœuds.

  • Data Studio > Node Development > Node Editor

  • Data Studio > Node Development > Run Configuration

Pour plus d'informations, consultez la rubrique Développement des nœuds.

5

Développement assisté par Copilot

Exploitez les fonctionnalités de DataWorks Copilot pour générer, corriger, réécrire et convertir du code SQL et Python.

  • Data Studio > Node Development > Copilot

  • Data Studio > Copilot > Agent

    Pour plus d'informations, consultez la rubrique Copilot.

6

Orchestration et planification des nœuds

Dans le canevas DAG du workflow, définissez les dépendances amont et aval entre les nœuds en les faisant glisser et en les connectant. Divers nœuds de contrôle de flux sont disponibles pour une orchestration complexe.

Configurez les paramètres de planification pour l'environnement de production au niveau du workflow ou du nœud, y compris la fréquence, l'horaire et les dépendances. La plateforme prend en charge une planification à très grande échelle, avec des dizaines de millions d'instances par jour.

  • Data Studio > Workflow > Workflow Canvas

  • Data Studio > Node Development > Schedule Settings

Pour plus d'informations, consultez les rubriques Nœuds de contrôle de flux généraux et Paramètres de planification.

7

Déploiement et O&M des workflows/nœuds

  • Déploiement : Déployez les nœuds ou workflows débogués dans l'environnement de production via le processus de déploiement.

  • O&M : Dans Operation Center, surveillez les tâches de production, configurez des alertes, effectuez des backfills de données et réalisez une validation périodique. Utilisez des lignes de base intelligentes pour garantir le respect des délais d'exécution des tâches et traitez rapidement les anomalies grâce aux alertes de surveillance.

Remarque

Pour un tutoriel de prise en main associé, consultez la rubrique Tutoriel de prise en main.

Parcours avancé : processus de développement Big Data pour l'IA

Ce processus convient au développement de modèles d'IA, à l'exploration en science des données et aux applications d'IA en temps réel, en mettant l'accent sur la flexibilité de l'environnement et l'interactivité.

  • Public cible : ingénieurs IA, data scientists et ingénieurs algorithmes.

  • Objectif principal : réaliser l'exploration des données, l'entraînement des modèles et la validation des algorithmes, ou concevoir des applications d'IA en temps réel (telles que RAG et les services d'inférence en temps réel).

  • Technologies clés : environnement de développement personnel, Notebook, workflows basés sur des déclencheurs, jeux de données et images personnalisées.

image

Étape

Phase

Opérations principales et objectifs

Chemin d'accès clé et références

1

Créez un environnement de développement personnel

Créez une instance de conteneur cloud isolée et personnalisable pour installer les dépendances Python et effectuer le développement IA.

Data Studio > Environnement de développement personnel

Pour plus d'informations, consultez Environnement de développement personnel.

2

Créez un workflow basé sur des déclencheurs

Créez un workflow piloté par les événements dans le répertoire du projet, servant de conteneur d'orchestration pour les applications d'IA en temps réel.

Data Studio > Répertoire du projet > Workflow basé sur des déclencheurs

Pour plus d'informations, consultez Workflows basés sur des déclencheurs.

3

Créez et configurez un déclencheur

Configurez un déclencheur dans Operation Center pour définir quels événements externes (tels que les événements OSS ou les événements de message Kafka) lancent le workflow.

  • Création : Operation Center > Gestion des déclencheurs

  • Utilisation : Data Studio > Workflow basé sur des déclencheurs > Paramètres de planification

Pour plus d'informations, consultez Gestion des déclencheurs et Paramètres de planification des workflows basés sur des déclencheurs.

4

Créez un nœud Notebook

Créez l'unité de développement principale pour écrire du code IA/Python. Nous vous recommandons de commencer par explorer dans un Notebook du répertoire personnel.

Répertoire du projet > Workflow basé sur des déclencheurs > Nœud Notebook

Pour plus d'informations, consultez Développement de nœuds Notebook.

5

Créez et utilisez des jeux de données

Enregistrez les données non structurées (images, documents, etc.) stockées sur OSS ou NAS en tant que jeux de données, et montez-les sur l'environnement de développement ou les tâches pour y accéder via le code.

  • Création : Data Map > Catalogue de données > Jeu de données

  • Utilisation : Data Studio > Environnement de développement personnel > Configuration du jeu de données

Pour plus d'informations, consultez Créer un jeu de données et Utiliser des jeux de données.

6

Développez et déboguez les Notebooks/nœuds

Écrivez la logique algorithmique dans l'environnement de développement personnel. Effectuez l'exploration des données, la validation des modèles et des itérations rapides.

Data Studio > Éditeur Notebook

Pour plus d'informations, consultez Notebook.

7

Installez des packages de dépendances personnalisés

Dans le terminal de l'environnement de développement personnel ou dans une cellule Notebook, utilisez des outils tels que pip pour installer toutes les bibliothèques Python tierces requises par le modèle.

Data Studio > Environnement de développement personnel > Terminal

Pour plus d'informations, consultez Installer des packages de dépendances personnalisés.

8

Construisez une image personnalisée

Figez l'environnement de développement personnel avec toutes les dépendances configurées dans une image standardisée, garantissant une cohérence totale entre le développement et la production.

Si vous n'avez pas installé de packages de dépendances personnalisés, ignorez cette étape.
  • Data Studio > Environnement de développement personnel > Gérer l'environnement

  • Console > Image personnalisée

Pour plus d'informations, consultez Images personnalisées.

9

Paramètres de planification des nœuds

Dans les paramètres de planification du nœud de production, vous devez spécifier l'image personnalisée créée à l'étape précédente comme environnement d'exécution et monter les jeux de données requis.

Data Studio > Nœud Notebook > Paramètres de planification

Pour plus d'informations, consultez Paramètres de planification.

10

Déploiement et O&M des nœuds/workflows

  • Déploiement : déployez le workflow basé sur des déclencheurs configuré dans l'environnement de production.

  • O&M : déclenchez un événement réel (tel que le téléchargement d'un fichier) pour vérifier que le processus de bout en bout fonctionne correctement et effectuez la validation du déclencheur.

Modules principaux de Data Studio

image

Module principal

Fonctionnalités principales

Orchestration des workflows

Propose un canevas DAG visuel permettant de concevoir et gérer des pipelines de tâches complexes par glisser-déposer et connexion des nœuds. Prend en charge les workflows planifiés, les workflows déclenchés par événement et les workflows manuels afin de répondre aux besoins d’automatisation dans différents scénarios.

Environnements et modes d’exécution

Met à disposition des environnements de développement flexibles et ouverts pour améliorer l’efficacité du développement et la collaboration.

  • Environnements d’exécution : prend en charge l’environnement de développement par défaut, les environnements de développement personnels et les images personnalisées afin de satisfaire les besoins de développement individualisés. Permet également l’intégration Git pour la gestion des versions du code , vous offrant la possibilité d’utiliser vos outils habituels.

  • Modes de développement : propose un répertoire de projet (collaboration en équipe), un répertoire personnel (développement et tests individuels) ainsi qu’un répertoire manuel (tâches ponctuelles) afin d’isoler et gérer efficacement les actifs de développement.

Développement de nœuds

Prend en charge une large gamme de types de nœuds et de moteurs de calcul pour un traitement et une analyse flexibles des données.

  • Moteurs de calcul : s’intègre de manière transparente aux moteurs de calcul Big Data tels que MaxCompute, EMR, Hologres et Flink, ainsi qu’aux services de calcul IA comme PAI.

  • Types de nœuds : met à disposition des nœuds Data Integration, SQL, Python, Shell, Notebook, des nœuds dédiés aux grands modèles de langage et divers nœuds interactifs IA afin de couvrir des besoins variés tels que la synchronisation, le nettoyage, le traitement des données et l’entraînement IA.

Pour plus d’informations, consultez les rubriques Moteurs de calcul et Développement de nœuds.

Planification des nœuds

Offre une planification automatisée flexible garantissant l’exécution des tâches dans les délais et selon l’ordre correct.

  • Mécanisme de planification : prend en charge la planification périodique basée sur le temps (annuelle, mensuelle, quotidienne, horaire, par minute ou par seconde) ainsi que la planification déclenchée par événement ou via OpenAPI.

  • Dépendances de planification : gère des dépendances complexes au sein d’un même cycle, entre cycles, entre workflows, entre espaces de travail, ainsi que les dépendances entre tâches ayant des planifications et des types différents.

  • Stratégies de planification : permet d’appliquer des stratégies avancées telles que les plages de temps effectives, les réexécutions en cas d’échec, les simulations (dry runs) et le gel des tâches.

  • Paramètres de planification : prend en charge les paramètres de workflow, les paramètres d’espace de travail, les paramètres de contexte et les paramètres de nœud.

    Pour plus d’informations, consultez la rubrique Paramètres de planification.

Gestion des ressources de développement

Assure une gestion centralisée des actifs utilisés lors du développement de données.

  • Catalogue de données : offre des fonctionnalités de gestion des métadonnées de type lakehouse, permettant la création, la consultation et la gestion des tables de données.

  • Fonctions et ressources : permet de gérer et référencer des UDF ainsi que divers fichiers de ressources (tels que les fichiers JAR et Python).

  • Jeux de données : permet de monter et gérer des jeux de données provenant de stockages externes tels qu’OSS et NAS.

    Pour plus d’informations, consultez les rubriques Catalogue de données, Fonctions et ressources et Jeux de données.

Contrôle qualité

Intègre des mécanismes de contrôle visant à standardiser les processus de production de données et garantir l’exactitude des données en sortie.

  • Revue de code : permet une revue manuelle du code avant le déploiement des tâches afin d’assurer la qualité du code.

  • Contrôle des processus : combine des tests de fumée, des vérifications d’éléments de gouvernance et des extensions pour effectuer une validation automatisée lors de la soumission et du déploiement des tâches.

  • Data Quality : associe des règles de surveillance de la qualité des données qui sont automatiquement déclenchées après l’exécution des tâches afin de détecter les problèmes de données au plus tôt.

    Pour plus d’informations, consultez les rubriques Revue de code, Contrôle des processus, Extensions et Configuration des règles de qualité des données.

Ouverture et extensibilité

Met à disposition des interfaces ouvertes et des points d’extension permettant l’intégration avec des systèmes externes et le développement personnalisé.

  • OpenAPI : fournit des interfaces API complètes pour gérer et exploiter programmatiquement les tâches de développement.

  • Messages d’événement : permet de s’abonner aux messages d’événement liés au développement de données afin de faciliter l’intégration avec des systèmes externes.

    Pour plus d’informations, consultez les rubriques Open API, Open Event et Extensions.

Facturation de Data Studio

  • Coûts facturés par DataWorks (apparaissent dans votre facture DataWorks)

    • Frais de groupe de ressources : Le développement des nœuds et les environnements de développement individuels utilisent un groupe de ressources. Selon le type de groupe de ressources, vous êtes facturé pour un groupe de ressources serverless ou un groupe de ressources exclusif pour la planification.

      Si vous utilisez les services de grands modèles , vous êtes également facturé pour un groupe de ressources serverless.
    • Frais de planification des tâches : Si une tâche est déployée dans l'environnement de production pour des exécutions planifiées, des frais de planification des tâches vous seront facturés (lors de l'utilisation d'un groupe de ressources serverless) ou des frais liés à un groupe de ressources exclusif pour la planification (lors de l'utilisation d'un groupe de ressources exclusif).

    • Frais Data Quality : Si vous configurez la surveillance de la qualité pour une tâche périodique et qu'une instance est déclenchée avec succès, des frais d'instance Data Quality vous seront facturés.

    • Frais de ligne de base intelligente : Si vous configurez une ligne de base intelligente pour une tâche périodique, des frais d'instance de ligne de base intelligente vous seront facturés pour chaque ligne de base intelligente activée.

    • Frais d'alertes par SMS et appels téléphoniques : Si vous configurez des alertes de surveillance pour une tâche périodique et qu'une alerte par SMS ou par téléphone est déclenchée, des frais d'alertes par SMS et appels téléphoniques vous seront facturés.

      Remarque

      Modules concernés : Data Studio, Data Quality et Operation Center.

  • Coûts connexes non facturés par DataWorks (n'apparaissent pas dans votre facture DataWorks)

    Lorsque vous exécutez des tâches de nœuds de développement de données, les frais de moteur de calcul et de stockage connexes, tels que les frais de stockage OSS, ne sont pas facturés par DataWorks.

Prise en main de Data Studio

Créer ou activer le nouveau Data Studio

  • Lors de la création d'un espace de travail, sélectionnez Use Data Studio (New Version). Pour plus d'informations, consultez la rubrique Créer un espace de travail.

  • Dans l'ancien Data Studio, cliquez sur le bouton Upgrade to New Version en haut de la page DataStudio et suivez les instructions à l'écran pour migrer vos données vers le nouveau Data Studio. Pour plus d'informations, consultez la rubrique Migrer vers le nouveau Data Studio.

Ouvrir le nouveau Data Studio

Accédez à la page Workspaces dans la console DataWorks. Dans la barre de navigation supérieure, sélectionnez la région souhaitée. Localisez l'espace de travail concerné et choisissez Shortcuts > Data Studio dans la colonne Actions.

FAQ

  • Q : Comment distinguer le nouveau Data Studio de l'ancien Data Studio ?

    R : Les deux versions présentent des styles de page totalement différents. Le nouveau Data Studio arbore une barre supérieure à thème sombre et une arborescence de répertoires sur le côté gauche, tandis que l'ancien Data Studio utilise un arrière-plan clair et une disposition traditionnelle en panneaux.

  • Q : Après la migration vers le nouveau Data Studio, puis-je revenir à l'ancien Data Studio ?

    R : La migration de l'ancien Data Studio vers la nouvelle version est une opération irréversible. Une fois la migration terminée, il est impossible de revenir à l'ancien Data Studio. Avant de procéder à la migration, nous vous recommandons de créer d'abord un espace de travail avec le nouveau Data Studio activé à des fins de test, afin de vérifier qu'il répond à vos besoins métier. Par ailleurs, les données du nouveau Data Studio et de l'ancien Data Studio sont indépendantes les unes des autres.

  • **Q : Pourquoi l'option Use Data Studio (New Version) n'est-elle pas visible lors de la création d'un espace de travail ?**

    R : Si cette option n'est pas disponible sur la page, cela signifie que le nouveau Data Studio est déjà activé par défaut pour votre espace de travail.

    Important

    Si vous rencontrez des problèmes lors de l'utilisation du nouveau Data Studio, vous pouvez rejoindre le groupe de support pour la mise à niveau de Data Studio DataWorks sur DingTalk pour obtenir de l'aide.