Présentation des concepts clés liés au développement avec les modules DataWorks, notamment Data Integration, Data Modeling, DataStudio, DataAnalysis et DataService Studio.
Concepts généraux
Espace de travail
Un espace de travail constitue l'unité fondamentale de gestion des tâches et des membres dans DataWorks, ainsi que d'attribution des rôles et des autorisations. L'administrateur de l'espace de travail peut ajouter des membres et leur attribuer des rôles tels qu'Administrateur, Développeur, Exploitation et maintenance, Déploiement, Administrateur de sécurité ou Visiteur, afin de faciliter la collaboration entre les différents acteurs.
Nous vous recommandons d'organiser vos espaces de travail par département ou unité commerciale.
Groupe de ressources
Un groupe de ressources DataWorks fournit les ressources de calcul nécessaires à tous les modules fonctionnels de DataWorks. Son état influence la stabilité des fonctionnalités, tandis que son quota a un impact sur les performances des tâches et des services.
Les groupes de ressources DataWorks se distinguent des groupes de ressources de votre compte Alibaba Cloud. Un groupe de ressources Alibaba Cloud vous aide à gérer et à autoriser les ressources au sein de votre compte. En revanche, un groupe de ressources DataWorks est spécifiquement dédié à l'exécution des tâches.
Dans DataWorks, sauf indication contraire précisant un groupe de ressources hérité, le terme « groupe de ressources » fait référence à un groupe de ressources serverless, dont le type d'utilisation est General-purpose.
Un groupe de ressources serverless peut être utilisé pour Data Integration, la planification des données et DataService Studio.
Mode basique et mode standard
DataWorks propose deux modes d'espace de travail pour répondre à différentes exigences de sécurité : le mode basique et le mode standard. En mode standard, un espace de travail DataWorks correspond à deux sources de données, ce qui permet d'isoler les données entre les environnements de développement et de production.
Ressource de calcul
Une ressource de calcul désigne une instance de ressource utilisée par un moteur de calcul pour exécuter des tâches de traitement et d'analyse des données, telles qu'un projet MaxCompute (groupe de quotas) ou une instance Hologres.
Vous pouvez ajouter plusieurs types de ressources de calcul à un espace de travail. Après avoir lié une ressource de calcul, vous pouvez développer et planifier des tâches qui l'utilisent au sein de cet espace de travail.
Data Integration
-
Source de données
Une source de données DataWorks établit une connexion vers un service de stockage de données. Avant de configurer une tâche de synchronisation, ajoutez les sources de données source et de destination. Vous pourrez ensuite les sélectionner pour spécifier les bases de données à lire et à écrire. Plusieurs instances de source de données peuvent être ajoutées à un même espace de travail.
-
Synchronisation des données
La fonctionnalité de synchronisation des données dans Data Integration synchronise les données structurées (par exemple, RDS et DRDS), semi-structurées et non structurées (par exemple, OSS et TXT), à condition que les données puissent être abstraites sous forme de table logique bidimensionnelle. Les données entièrement non structurées, telles que les fichiers MP3 stockés dans OSS, ne sont pas prises en charge. Les méthodes de synchronisation incluent la synchronisation hors ligne, en temps réel, ainsi que la synchronisation complète ou incrémentielle pour des tables uniques ou des bases de données entières. Les tâches de synchronisation serverless sont également prises en charge, éliminant ainsi le besoin d'un groupe de ressources.
Data Modeling
-
Modélisation des données
Avec la croissance des entreprises, le volume de données augmente de manière exponentielle, générant souvent des ensembles de données volumineux et complexes aux normes incohérentes. Le service DataWorks Data Modeling offre une approche structurée pour gérer ces ensembles de données et aide les entreprises à extraire davantage de valeur de leurs données.
-
Modélisation inversée
La modélisation inversée génère des modèles logiques à partir de tables physiques existantes, vous permettant de créer rapidement des modèles sans effort manuel.
-
Espace de modélisation
Un espace de modélisation vous permet de partager des outils de modélisation des données entre plusieurs espaces de travail DataWorks. Cette fonction s'avère utile lorsque vous devez réutiliser un seul plan d'entrepôt de données dans un système de données complexe, permettant une planification unifiée de l'entrepôt de données, une modélisation dimensionnelle et une définition des métriques sur l'ensemble de votre architecture de données.
-
Table de dimension
Sur la base du plan de domaine de données de votre entreprise, vous pouvez extraire des dimensions potentielles pour l'analyse des données et stocker ces dimensions ainsi que leurs attributs dans une table de dimension. Par exemple, dans l'analyse commerciale du e-commerce, les dimensions disponibles et leurs attributs peuvent inclure la dimension commande (avec des attributs tels que l'ID de commande, l'heure de création, l'ID acheteur et l'ID vendeur), la dimension utilisateur (genre, date de naissance) et la dimension produit (ID produit, nom, date de lancement). Vous pouvez créer des tables de dimension pour les commandes, les utilisateurs et les produits, où les attributs de dimension sont enregistrés en tant que champs dans la table.
-
Table de faits
Conformément à la planification des processus métier, vous pouvez analyser les données réelles générées lors de chaque processus métier et stocker ces champs de données dans une table de faits. Par exemple, pour le processus de passation de commande, vous pouvez créer une table de faits de passation de commande pour enregistrer des champs de données tels que l'ID de commande, l'heure de création, l'ID produit, la quantité et le montant. Vous pouvez ensuite déployer ces tables de faits dans un entrepôt de données et utiliser ETL pour agréger et stocker les données réelles selon la définition de la table de faits, les rendant accessibles pour l'analyse commerciale.
-
Table d'agrégation
Une table d'agrégation organise les données statistiques pour plusieurs métriques dérivées au sein d'un domaine de données qui partagent la même période et les mêmes dimensions. Elle représente un résumé hautement abstrait des opérations commerciales et sert de fondation pour les requêtes commerciales ultérieures, l'analyse OLAP et la distribution des données.
-
Table d'application
Une table d'application est conçue pour des scénarios commerciaux spécifiques et organise les données statistiques pour plusieurs métriques atomiques, métriques dérivées ou granularités statistiques qui partagent la même période et les mêmes dimensions. Elle fournit une base pour les requêtes commerciales ultérieures, l'analyse OLAP et la distribution des données.
-
Data mart
Un data mart est une méthode d'organisation des données basée sur des catégories commerciales et adaptée à des scénarios d'application ou des produits spécifiques. Il se situe généralement dans la couche application de l'entrepôt de données et s'appuie sur les données intégrées de la couche commune.
-
Planification de l'entrepôt de données
Lors de l'utilisation de DataWorks pour la modélisation des données, les architectes d'entrepôt de données ou les membres de l'équipe de modélisation peuvent utiliser la page de planification de l'entrepôt de données pour concevoir les couches de données, les catégories commerciales, les domaines de données, les processus métier, les data marts et les sujets d'analyse. Une fois la conception terminée, les concepteurs de modèles peuvent utiliser ces éléments planifiés pour gérer les couches et les domaines des modèles qu'ils construisent.
Data Import Layer : Cette couche est utilisée pour ingérer les données brutes provenant de sources telles que les bases de données, les journaux et les messages. Les données source sont chargées dans la couche ODS après une série d'opérations ETL. Cette couche ne peut stocker que des tables ODS.
Common Layer : Cette couche est utilisée pour traiter et intégrer les données communes de la couche source, établir des métriques et des dimensions unifiées, et construire des données de faits détaillées réutilisables et des données résumées pour l'analyse et les statistiques. Cette couche peut contenir des tables de faits, des tables de dimension et des tables récapitulatives.
Application Layer : Obtient les données traitées et intégrées de la couche publique pour effectuer des statistiques de données personnalisées pour des scénarios d'application spécifiques ou des produits désignés, en fonction des besoins d'application réels. Cette couche peut contenir des tables d'application et des tables de dimension.
-
Couche de données
La fonctionnalité de couche de données dans DataWorks crée cinq couches par défaut pour vous : la couche Operational Data Store (ODS), la couche Dimension (DIM), la couche Data Warehouse Detail (DWD), la couche Data Warehouse Summary (DWS) et la couche Application Data Service (ADS). La fonction de chaque couche est décrite ci-dessous :
-
ODS (Operational Data Store)
La couche ODS reçoit et traite les données brutes qui doivent être stockées dans le système d'entrepôt de données. Sa structure de table est cohérente avec la structure de table du système de données source et sert de zone de préparation des données pour l'entrepôt de données.
-
DWD (Data Warehouse Detail)
La couche DWD construit des modèles de données basés sur les événements d'activité commerciale. Elle est utilisée pour construire les tables de faits les plus granulaires. Selon vos modèles d'utilisation des données, vous pouvez dénormaliser en ajoutant judicieusement des champs d'attributs de dimension clés redondants aux tables de faits, créant ainsi des tables larges. Cela réduit les jointures entre les tables de faits et les tables de dimension, améliorant ainsi la facilité d'utilisation.
-
DWS (Data Warehouse Summary)
La couche DWS construit des modèles de données en analysant les objets sujets. Elle construit des tables de faits récapitulatives à granularité publique en fonction des exigences métriques des applications et produits en amont.
-
ADS (Application Data Service)
La couche ADS est utilisée pour stocker les données de métriques statistiques personnalisées pour les produits de données et pour générer divers rapports.
-
DIM (Dimension)
La couche DIM utilise les dimensions pour construire des modèles de données. Elle peut stocker des tables de dimension pour des modèles logiques en fonction des besoins commerciaux, ou elle peut stocker des définitions de dimension pour des modèles conceptuels. En définissant des dimensions, en déterminant les clés primaires, en ajoutant des attributs de dimension et en associant différentes dimensions, vous pouvez construire des tables de dimension d'analyse cohérentes pour toute l'entreprise, ce qui contribue à réduire les incohérences dans les normes de calcul des données et les algorithmes.
-
-
Sujet d'analyse
Un sujet d'analyse est utilisé pour partitionner un data mart d'un point de vue analytique et constitue généralement une collection de sujets de données étroitement liés. Vous pouvez regrouper ces sujets de données dans différents sujets d'analyse en fonction de l'orientation commerciale. Par exemple, l'industrie du e-commerce est généralement divisée en sujets d'analyse transaction, membre et produit.
-
Domaine de données
Un domaine de données est une collection de sujets de données étroitement liés. Il s'agit d'un regroupement logique des données commerciales basé sur des dimensions telles que la catégorie commerciale, la source de données ou l'objectif des données, qui place les données similaires ensemble pour faciliter une récupération rapide. Les critères de classification varient en fonction de l'utilisation prévue des données. Par exemple, l'industrie du e-commerce est généralement divisée en domaines de données transaction, membre et produit.
-
Processus métier
Un processus métier est une activité commerciale réalisée par une entreprise au sein d'un domaine de données spécifié et constitue le sujet logique à analyser dans la modélisation des données. Par exemple, le domaine transactionnel peut inclure des processus métier tels que l'ajout au panier, la passation de commande et le paiement.
-
Métrique composite
Une métrique dérivée fournit des statistiques sur le volume d'une activité commerciale sur une certaine période, mais elle ne prend pas en charge l'analyse comparative, telle que le calcul des taux de croissance ou des différences commerciales. Par exemple, vous ne pouvez pas l'utiliser pour calculer le taux de croissance hebdomadaire d'une activité commerciale. Pour résoudre ce problème, DataWorks propose la métrique composite, qui est calculée à partir de métriques dérivées à l'aide de règles opérationnelles. Cela vous aide à définir des métriques commerciales avec une plus grande flexibilité et granularité.
-
Métrique de données
DataWorks Data Modeling fournit la fonctionnalité de métrique de données pour établir un système de métriques unifié.
Un système de métriques se compose d'une métrique atomique, d'un modificateur, d'une période et d'une métrique dérivée.
Métrique atomique : Une mesure basée sur un processus métier spécifique, telle que le « montant du paiement » dans le processus métier « paiement de commande ».
Modificateur : Une contrainte qui limite la portée commerciale d'une métrique, telle que la limitation de la portée statistique du « montant du paiement » aux « produits pour la maternité et la petite enfance ».
Période : La plage temporelle ou le point dans le temps pour les statistiques d'une métrique, tel que la spécification de la période pour le « montant du paiement » comme « les 7 derniers jours ».
Métrique dérivée : Une combinaison d'une métrique atomique, de modificateurs et d'une période. Par exemple, « montant du paiement pour les produits pour la maternité et la petite enfance au cours des 7 derniers jours ».
-
Table de référence
Une table de référence définit la plage de valeurs pour une norme de champ. Dans une table de référence, vous pouvez spécifier le contenu et la plage de données qu'une norme de champ peut accepter. Par exemple, le contenu de la table de référence pour la norme de champ « genre » doit être masculin ou féminin.
-
Norme de champ
Une norme de champ est un critère de données utilisé pour gérer uniformément les données ayant la même signification mais des noms de champs différents. Une norme de champ peut définir la plage de valeurs d'un champ, l'unité de mesure et d'autres propriétés. Lorsqu'une norme de champ change, vous pouvez localiser ou modifier rapidement les tables correspondantes, ce qui améliore considérablement l'efficacité et la précision des applications.
DataStudio
-
Nœud
Le module DataStudio dans DataWorks propose divers types de nœuds, notamment des nœuds Data Integration pour la synchronisation des données, des nœuds de moteur de calcul pour le nettoyage des données (tels que ODPS SQL, Hologres SQL et EMR Hive), et des nœuds polyvalents pour le traitement de logique complexe sur les nœuds de moteur de calcul (tels que les nœuds virtuels pour la gestion de plusieurs nœuds et les nœuds do-while pour l'exécution en boucle du code). Vous pouvez combiner ces nœuds pour répondre à vos différents besoins de traitement des données.
-
Flux de travail
Un flux de travail est une méthode centrée sur le métier pour organiser le développement du code et améliorer l'efficacité de la gestion des tâches.
Les flux de travail vous aident à organiser le code d'un point de vue commercial :
Prend en charge l'organisation du code basée sur le type de tâche.
Prend en charge les sous-répertoires multiniveaux (jusqu'à quatre niveaux recommandés).
Permet de visualiser et d'optimiser l'ensemble du flux de travail d'un point de vue commercial.
Prend en charge l'organisation du déploiement et de l'exploitation et maintenance basée sur les flux de travail.
Fournit un tableau de bord de flux de travail pour vous aider à développer plus efficacement.
-
Flux de travail déclenché automatiquement
Un flux de travail déclenché automatiquement fournit une interface de développement DAG visuelle orientée métier. Vous pouvez intégrer des nœuds de sous-tâches par glisser-déposer, établir des dépendances entre les tâches et construire des pipelines de traitement des données pour gérer efficacement des projets de tâches complexes.
-
Notebook
Le notebook DataWorks fournit un environnement de développement interactif pour l'exploration des données, l'analyse et le développement de modèles d'IA en intégrant du code (tel que SQL et Python), du texte, des résultats d'exécution et des graphiques de visualisation.
-
Composant SQL
Disponible uniquement pour MaxCompute, vous pouvez abstraire la logique courante dans SQL en un modèle de script SQL pour améliorer la réutilisabilité du code.
Le processus de traitement du code SQL implique généralement l'importation d'une ou plusieurs tables source et leur traitement via des opérations de filtrage, de jointure et d'agrégation pour produire une nouvelle table cible requise par le métier. Un modèle de script SQL est un modèle procédural pour le code SQL avec plusieurs paramètres d'entrée et de sortie.
-
Dépendance de planification
Une dépendance de planification entre les tâches définit l'ordre dans lequel elles s'exécutent. Si le nœud B ne peut s'exécuter qu'après l'exécution du nœud A, alors A est une dépendance en amont de B, et B dépend de A. Dans un graphe acyclique dirigé (DAG), les dépendances sont représentées par des flèches entre les nœuds.
-
Horodatage des données
Un horodatage des données fait généralement référence à la date directement associée à une activité commerciale, reflétant l'heure réelle à laquelle les données commerciales ont été générées. Ce concept est particulièrement important dans les scénarios de calcul hors ligne. Par exemple, dans le commerce de détail, si vous devez calculer le chiffre d'affaires pour le 10 octobre 2024, vous commenceriez généralement le calcul tôt le matin du 11 octobre 2024. Les données résultantes représentent en réalité le chiffre d'affaires du 10 octobre 2024, qui constitue l'horodatage des données.
-
Nom de sortie
Le nom de sortie est le nom d'un point de sortie d'une tâche. Il s'agit d'une entité virtuelle utilisée pour connecter les tâches en amont et en aval lors de la configuration des dépendances au sein d'un même locataire (compte Alibaba Cloud).
Lorsque vous configurez des dépendances en amont et en aval pour une tâche, vous devez utiliser le nom de sortie, et non le nom du nœud ou l'ID du nœud. Une fois défini, le nom de sortie de la tâche sert également de nom d'entrée pour ses nœuds en aval.
RemarqueLe nom de sortie sert d'identifiant unique pour une tâche au sein d'un locataire. Le nom de sortie par défaut pour chaque nœud est
WorkspaceName.SystemGenerated9DigitNumber.out. Vous pouvez ajouter un nom de sortie personnalisé à une tâche, mais vous devez vous assurer que le nom de sortie est unique au sein du locataire. -
Nom de la table de sortie
Le nom de la table de sortie doit correspondre à la table produite par la tâche actuelle. Remplir correctement le nom de la table de sortie facilite la confirmation par les tâches en aval que les données proviennent de la table en amont attendue lors de la configuration des dépendances. Il n'est pas recommandé de modifier manuellement un nom de table de sortie analysé automatiquement. Le nom de la table de sortie sert uniquement d'identifiant ; sa modification n'affecte pas le nom réel de la table produite par le script SQL, qui est déterminé par la logique SQL.
RemarqueLe Output Name d'un nœud doit être globalement unique, tandis que le Output Table Name n'est pas soumis à cette restriction.
-
Paramètre de planification
Un paramètre de planification est une variable dans votre code à laquelle une valeur est attribuée dynamiquement au moment de l'exécution. Lorsque votre code nécessite des informations sur l'environnement d'exécution telles que la date ou l'heure, vous pouvez attribuer des valeurs basées sur les définitions des paramètres de planification dans le système de planification DataWorks.
-
Catalogue de données
Un catalogue de données est une liste ou une carte structurée de tous les actifs de données au sein d'une organisation, y compris les bases de données, les tables et les fichiers. Dans DataWorks, le catalogue de données enregistre les métadonnées de ces actifs.
-
Ressources de calcul, sources de données et catalogues de données
Ces trois éléments sont des objets indépendants mais liés. Leurs relations sont les suivantes :
Lorsque vous liez une ressource de calcul, une source de données et un catalogue de données peuvent être créés en association.
Lorsque vous créez une source de données, un catalogue de données peut être créé en association.
Lorsque vous créez un catalogue de données, vous ne pouvez pas créer de source de données ou de ressource de calcul en association.
Operation Center
-
Heure de planification
Heure d'exécution prévue pour une tâche déclenchée automatiquement, qui peut être définie à la minute près.
ImportantDe nombreux facteurs peuvent affecter l'exécution d'une tâche, ce qui signifie qu'une tâche ne s'exécutera pas nécessairement immédiatement lorsque son heure planifiée est atteinte. Avant d'exécuter une tâche, DataWorks vérifie que les tâches en amont ont été exécutées avec succès, que l'heure planifiée est atteinte et que les ressources de planification sont suffisantes. Une tâche ne commence à s'exécuter qu'après que toutes ces conditions sont remplies.
-
Horodatage des données
Un horodatage des données fait généralement référence à la date directement associée à une activité commerciale, reflétant l'heure réelle à laquelle les données commerciales ont été générées. Ce concept est particulièrement important dans les scénarios de calcul hors ligne. Par exemple, dans le commerce de détail, si vous devez calculer le chiffre d'affaires pour le 10 octobre 2024, vous commenceriez généralement le calcul tôt le matin du 11 octobre 2024. Les données résultantes représentent en réalité le chiffre d'affaires du 10 octobre 2024, qui constitue l'horodatage des données.
-
Tâche déclenchée automatiquement
Une tâche déclenchée automatiquement est une tâche qui est automatiquement déclenchée pour exécution par le système de planification en fonction d'un calendrier défini par l'utilisateur. Dans la liste des tâches déclenchées automatiquement d'Operation Center, vous pouvez effectuer une série d'opérations d'exploitation et de maintenance et de gestion sur une tâche, telles que la visualisation de son DAG, l'exécution de tests, la réalisation d'un remplissage de données et la modification du propriétaire de la tâche.
-
Instance déclenchée automatiquement
Une instance déclenchée automatiquement est une instance de tâche générée automatiquement pour exécution en fonction de la configuration de planification d'une tâche déclenchée automatiquement. Par exemple, si une tâche est configurée pour s'exécuter toutes les heures, la plateforme génère 24 instances de tâche en une journée, avec une instance automatiquement déclenchée pour s'exécuter chaque heure. Seules les instances possèdent des informations telles qu'un statut d'exécution. Dans la liste des instances déclenchées automatiquement d'Operation Center, vous pouvez effectuer une série d'opérations d'exploitation et de maintenance sur une instance, telles que l'arrêt, la définition sur succès et la réexécution.
-
Remplissage des données
DataWorks génère automatiquement une instance de remplissage des données en fonction de la tâche et de la plage temporelle que vous spécifiez. La fonctionnalité de remplissage des données est principalement utilisée pour réexécuter des données historiques et corriger des données. Avec cette fonctionnalité, vous pouvez recalculer les données pour n'importe quelle période passée ou future afin de garantir l'exhaustivité et l'exactitude des données.
-
Ligne de base
En fonction des configurations que vous définissez pour une ligne de base, telles que la priorité, l'heure d'achèvement engagée et la marge d'alerte, le système surveille automatiquement toutes les tâches sur la ligne de base et émet des avertissements pour tout risque susceptible d'affecter la production ponctuelle des tâches. Plus le nombre indiquant la priorité de la ligne de base est élevé, plus la priorité est élevée. DataWorks alloue plus de ressources aux tâches sur les lignes de base à haute priorité pour garantir leur heure de production. La marge d'alerte est principalement réservée à la gestion des exceptions. DataWorks calcule l'heure d'alerte en soustrayant la marge d'alerte de l'heure d'achèvement engagée. Si une tâche ne peut pas produire de résultat dans le délai d'alerte, la plateforme émet rapidement une alerte pour informer les parties commerciales concernées du risque.
Data Governance Center
-
Score de santé
Un score de santé est une métrique globale allant de 0 à 100 qui mesure la santé des actifs de données en fonction des éléments de gouvernance. Il reflète l'efficacité de la gouvernance au niveau du locataire, de l'espace de travail ou individuel à travers cinq dimensions : stockage, calcul, R&D, qualité et sécurité.
-
Élément de gouvernance
Un élément de gouvernance est un problème identifié dans un actif de données nécessitant une optimisation ou une résolution, couvrant des domaines tels que les normes de développement, la qualité des données, la sécurité et la conformité, et l'utilisation des ressources. Les éléments de gouvernance sont classés comme obligatoires (activés par défaut et non modifiables) et optionnels (activés selon vos besoins). Par exemple, les durées d'exécution de tâches excessivement longues, les nœuds avec des erreurs consécutives et les nœuds feuilles non consultés sont tous des éléments de gouvernance.
-
Élément de vérification
Un élément de vérification est un mécanisme de gouvernance proactive qui effectue des pré-vérifications aux étapes clés telles que la soumission et le déploiement des tâches pour détecter les problèmes potentiels avec le code ou les données, tels que les analyses de table complète ou les configurations manquantes de dépendance de planification. Si du contenu non conforme est détecté, le système génère un événement d'élément de vérification, intercepte automatiquement l'action et applique les normes de développement.
-
Plan de gouvernance des données
Un plan de gouvernance des données fournit des modèles pour différents scénarios de gouvernance. Guidé par des objectifs de gouvernance pour une période spécifique, il vous aide à sélectionner les éléments de gouvernance et de vérification pertinents et à identifier les objets à optimiser. Cela permet un suivi continu de l'efficacité de la gouvernance et incite l'équipe à atteindre les objectifs grâce à une évaluation quantitative.
-
Base de connaissances
La base de connaissances contient les définitions des éléments de vérification et de gouvernance intégrés dans Data Governance Center. Elle aide le personnel de gouvernance à identifier rapidement des problèmes spécifiques et fournit des informations de référence et des conseils pratiques pour résoudre les problèmes.
Security Center
-
Autorisation de données
Security Center fournit des fonctionnalités granulaires pour les demandes d'autorisation de données, les approbations et les audits, mettant en œuvre un contrôle d'accès basé sur le principe du moindre privilège. Vous pouvez également suivre facilement le processus d'approbation des autorisations à chaque étape. Pour plus d'informations, consultez la section Contrôle d'accès aux données.
-
Sécurité du contenu des données
Security Center fournit des fonctionnalités telles que la classification et la hiérarchisation des données, l'identification des données sensibles, l'audit de l'accès aux données sensibles et la traçabilité de la source des données. Lors du traitement des processus métier, il peut identifier rapidement et en temps opportun les données présentant des risques de sécurité potentiels, garantissant la sécurité et la fiabilité du contenu des données. Pour plus d'informations, consultez la section Présentation de Data Security Guard.
Data Quality
-
Surveillance de la qualité
La surveillance de la qualité suit et détecte continuellement l'état et les changements des objets de données (tels que des partitions spécifiques d'une table partitionnée) pour garantir qu'ils répondent aux exigences de qualité prédéfinies. Dans DataWorks, vous pouvez configurer une surveillance de la qualité déclenchée par des événements de planification pour effectuer automatiquement des contrôles de qualité et envoyer des alertes au personnel concerné.
-
Règle de qualité
Une règle de qualité est une condition spécifique ou une norme logique pour évaluer si la qualité des données répond aux attentes. Par exemple, « L'âge du client ne peut pas être inférieur à 0 » sont des règles de qualité. Dans DataWorks, vous pouvez configurer灵活ement différentes règles de qualité selon vos besoins commerciaux et les appliquer à la plage de données correspondante pour validation. Lorsque des données ne répondant pas aux attentes de la règle sont trouvées, le système les identifie automatiquement et émet une alerte de qualité.
-
Modèle de règle
Un modèle de règle est un exemple de règle de qualité avec une logique de validation prédéfinie. Vous pouvez l'utiliser directement ou modifier les seuils de validation selon vos besoins pour créer des règles de qualité répondant à vos exigences. DataWorks propose divers types de modèles de règles à choisir et prend également en charge la création de nouveaux modèles via SQL personnalisé :
Règles de modèle système : Vous pouvez créer des règles en utilisant les modèles de règle intégrés fournis par DataWorks.
Règles de modèle personnalisé : Si les modèles de règle intégrés ne répondent pas à vos besoins de surveillance de la qualité des données dans les expressions de partition, vous pouvez utiliser des modèles de règle personnalisés. Vous pouvez également enregistrer les règles personnalisées fréquemment utilisées en tant que modèles de règle pour une réutilisation facile.
Data Security Guard
-
Classification et hiérarchisation des données
Classification et hiérarchisation des données : Cette fonction est utilisée pour classer vos données actuelles en niveaux de sensibilité en fonction de leur valeur, de la sensibilité du contenu, de l'impact et de la portée de distribution. Différents niveaux de sensibilité ont différents principes de contrôle et exigences de développement de données.
-
Règle d'identification des données sensibles
Règle d'identification des données sensibles : En fonction de la source et de l'objectif des données, vous pouvez définir des catégories de données et configurer des types de champs sensibles pour identifier les données sensibles dans l'espace de travail actuel. DataWorks fournit des catégories de données et des règles d'identification intégrées, et vous pouvez également les personnaliser selon vos besoins.
-
Règle de masquage des données
Les règles de masquage des données sont utilisées pour configurer le masquage des données sensibles identifiées. En fonction des exigences de contrôle commercial, les contrôles de masquage des données pour différents niveaux de sensibilité varient.
-
Règle d'identification des risques
Les règles d'identification des risques utilisent la technologie d'analyse intelligente pour découvrir proactivement et émettre des alertes pour les opérations à risque. Cela vous aide à mener une gestion des risques plus complète et à identifier et éviter efficacement les risques.
Data Map
-
Métadonnées
Les métadonnées sont des données qui décrivent d'autres données. Elles peuvent spécifier les attributs d'une donnée (nom, taille, type de données), la structure (champs, types, longueurs) ou les informations connexes (emplacement, propriétaire, tâche de sortie, autorisations d'accès).
-
Lignée de données
La lignée de données décrit les relations formées lors du traitement et de la transformation des données, montrant l'ensemble du cycle de vie des données, de la création à la consommation en passant par le traitement. Sur la plateforme DataWorks, la lignée de données est visualisée pour aider les utilisateurs à localiser rapidement les problèmes et à évaluer l'impact de la modification d'une table ou d'un champ.
-
Album de données
Un album de données est une méthode d'organisation et de gestion des catégories de tables de données d'un point de vue commercial. Vous pouvez ajouter des tables spécifiées et d'autres actifs à un album cible pour une récupération et une localisation rapides et faciles.
DataAnalysis
-
Requête SQL
La requête SQL (héritée) utilise des instructions SQL standard pour interroger et analyser les données de diverses sources de données. Pour plus d'informations, consultez la section Requête SQL (héritée).
-
Classeur
Un classeur est un outil pour l'édition et la gestion en ligne des tables de données. Il prend en charge l'importation de données à partir des résultats de requête SQL ou de fichiers locaux dans un classeur cible pour examen, analyse et visualisation supplémentaires. Il prend également en charge l'exportation, le téléchargement et le partage de données depuis le classeur, répondant灵活ement aux besoins quotidiens d'analyse des données. Pour plus d'informations, consultez la section Créer et gérer un classeur.
-
Data insight
Data insight prend en charge l'exploration et la visualisation des données. Vous pouvez l'utiliser pour comprendre la distribution des données, créer des cartes de données et les combiner en rapports de données. Les résultats de Data insight peuvent être partagés sous forme de rapports longs et utilisent la technologie IA pour assister l'analyse des données, vous aidant à interpréter des données complexes et à soutenir les décisions commerciales.
DataService Studio
-
API
Une API (Interface de programmation d'application) dans DataService Studio permet aux développeurs de créer rapidement des API de données basées sur diverses sources de données. Ces API peuvent être appelées dans des applications commerciales, des logiciels, des systèmes et des rapports pour récupérer et consommer des données.
-
Fonction
Une fonction agit comme un filtre pour une API de données. Lorsqu'elle est utilisée comme pré-filtre, une fonction peut traiter les paramètres de requête, par exemple en modifiant ou en attribuant leurs valeurs. En tant que post-filtre, elle peut traiter les résultats renvoyés, tels que la modification de la structure des données ou l'ajout de contenu.
-
Push de données
DataWorks fournit un service de push de données qui vous permet de créer des tâches de push. Au sein d'une tâche, vous pouvez écrire du code SQL pour des requêtes de table unique ou multiple afin de définir la portée des données et organiser le contenu du message de push à l'aide de texte enrichi ou de tableaux. En configurant un cycle et une heure de planification, vous pouvez pousser périodiquement des données vers un webhook cible.
Open Platform
-
OpenAPI
La plateforme ouverte DataWorks fournit des capacités OpenAPI, vous permettant d'appeler les opérations API DataWorks pour intégrer et interagir entre vos applications et DataWorks.
-
OpenEvent
OpenEvent DataWorks livre les notifications de changement d'état sous forme de messages d'événements auxquels les utilisateurs peuvent s'abonner et répondre avec des actions personnalisées. Par exemple, vous pouvez vous abonner aux événements de changement de table via OpenEvent pour réaliser une surveillance en temps réel des tables centrales, ou vous abonner aux événements de changement de tâche pour une surveillance personnalisée des tâches.
-
Extensions
Les Extensions DataWorks sont des plug-ins qui, combinés à OpenAPI et OpenEvent, vous permettent d'appliquer une logique personnalisée aux actions des utilisateurs dans DataWorks et de mettre en œuvre des contrôles comportementaux tels que l'interception et le blocage. Par exemple, vous pouvez développer une extension de contrôle de changement de tâche pour implémenter un workflow de déploiement de tâche personnalisé.