DataWorks Data Quality (DQC) est une plateforme puissante conçue pour surveiller et protéger vos données. Elle détecte et intercepte de manière proactive les « données erronées » inattendues dans vos pipelines de production avant qu'elles ne se propagent en aval. Cela garantit la précision des décisions métier et réduit considérablement les coûts liés au dépannage et à la réexécution des ressources.
Concepts clés et flux de travail
Avant d'utiliser la fonctionnalité de qualité des données, il est essentiel de comprendre ses concepts fondamentaux et son fonctionnement. Le système de qualité des données s'articule autour des entités suivantes :
Template : Définit la logique de validation des données. DataWorks propose une bibliothèque riche de modèles intégrés (tels que le nombre de lignes d'une table ou le nombre de valeurs distinctes dans une colonne). Vous pouvez également créer des modèles personnalisés pour répondre à des exigences métier spécifiques.
Monitoring Rules : Instance spécifique d'un modèle de règle. Vous pouvez appliquer un modèle à une colonne d'une table et configurer un seuil précis. Par exemple, la colonne
order_countde la tabledaily_salesne doit pas être nulle.Monitor : Plan d'exécution qui associe une ou plusieurs Monitoring Rules à un nœud de planification. Lorsque le nœud de planification s'exécute avec succès, il déclenche automatiquement toutes les règles de qualité associées pour validation.
Règles fortes/faibles et blocage : Vous pouvez définir les règles comme des Strong rules ou des Weak rules. En cas d'échec d'une vérification, vous avez la possibilité de Blocks les tâches en aval ou simplement d'envoyer une Alert.
Flux de travail typique :
Les nœuds virtuels et les nœuds de test à blanc ne génèrent pas de données réelles et ne peuvent pas déclencher de règles de qualité des données.
Fonctionnalités
La fonctionnalité de qualité des données de DataWorks prend en charge les contrôles de qualité pour les services de stockage Big Data courants, tels que MaxCompute, E-MapReduce, Hologres et AnalyticDB. Vous pouvez configurer des règles de surveillance selon plusieurs dimensions, notamment l'exhaustivité, la précision et la cohérence, et les associer à des nœuds de planification pour activer la validation automatisée, les alertes et le blocage.
Les principaux modules de la qualité des données et leurs pages correspondantes dans la console sont présentés ci-dessous :
|
Module |
Description |
|
|
La page de présentation de la qualité des données affiche les indicateurs clés de qualité des données pour votre espace de travail, y compris la tendance et la distribution des statuts de vérification des règles de qualité déclenchés par les exécutions d'instances, les tables présentant le plus de problèmes de qualité et leurs responsables, la couverture des règles de qualité, etc. Cela permet aux gestionnaires de la qualité de comprendre rapidement l'état global de la qualité des données d'un espace de travail et de résoudre promptement les problèmes pour améliorer la qualité des données. |
||
|
Actifs de qualité |
Affiche la liste de toutes les règles de qualité configurées. |
|
|
La qualité des données prend en charge les bibliothèques de modèles de règles personnalisées. Vous pouvez gérer centralement les règles de surveillance personnalisées courantes dans une bibliothèque de modèles afin d'améliorer l'efficacité de la configuration des règles. |
||
|
Configuration des règles |
L'une des principales méthodes de configuration des règles de surveillance, qui permet d'effectuer une configuration granulaire pour une seule table. |
|
|
Configuration groupée de règles pour plusieurs tables répondant à des conditions spécifiées, basée sur des modèles de règles existants. |
||
|
Opérations de qualité |
La page de liste du moniteur de qualité affiche toutes les tâches de moniteur de qualité créées dans l'espace de travail actuel. |
|
|
Affiche les résultats des vérifications de règles lors des exécutions des tâches de moniteur de qualité. Une fois qu'une tâche de moniteur de qualité a été exécutée, vous pouvez consulter les détails sur la page des enregistrements d'exécution. |
||
|
Analyse de la qualité |
La qualité des données vous permet de créer des modèles de rapport et d'y ajouter diverses métriques pour la configuration et l'exécution des règles. Les rapports sont générés et envoyés automatiquement en fonction de la période statistique, de l'heure de livraison et des paramètres d'abonnement configurés. |
|
Facturation
Les coûts liés à l'exécution des règles de qualité des données se composent de deux parties :
Frais DataWorks : Facturation à l'utilisation basée sur le nombre d'exécutions d'instances de règles de qualité des données. Pour plus d'informations, reportez-vous à Facturation de la qualité des données.
Coûts du moteur de calcul : Les vérifications des règles de qualité des données génèrent des instructions SQL et les soumettent au moteur de calcul sous-jacent pour exécution. Cela entraîne des coûts de calcul facturés par le moteur respectif (par exemple, les coûts de calcul MaxCompute). Ces frais sont facturés par le fournisseur du moteur et n'apparaissent pas dans votre facture DataWorks.
Remarques
Sources de données prises en charge : Seules les sources MaxCompute, Hologres, E-MapReduce, DLF, CDH Hive, AnalyticDB PostgreSQL, AnalyticDB MySQL, StarRocks, MySQL, Lindorm et SQL Server sont prises en charge. Les régions disponibles varient selon le type de source de données. Reportez-vous aux régions prises en charge par le moteur spécifique.
Collecte des métadonnées : Avant de configurer des règles pour des sources de données autres que MaxCompute, telles que E-MapReduce, Hologres, AnalyticDB et CDH, vous devez d'abord effectuer la collecte des métadonnées. Pour plus d'informations, reportez-vous à Configurer la collecte des métadonnées.
Connectivité réseau : Lors de la vérification de sources de données autres que MaxCompute, le nœud de planification associé doit s'exécuter sur un groupe de ressources disposant d'une solution de connectivité réseau configurée.
Flux de travail de configuration et d'utilisation
1. Configurer les règles
Create Rule : La qualité des données vous permet de créer des règles de qualité des données table par table. Vous pouvez également utiliser des modèles de règles intégrés ou personnalisés pour créer des règles de qualité des données par lots pour plusieurs tables. Pour plus d'informations, reportez-vous à Créer une règle pour une seule table et Créer des règles par lots.
-
S'abonner aux alertes : Une fois les règles créées, vous pouvez configurer des notifications d'alerte via des abonnements. Plusieurs canaux sont pris en charge, notamment l'e-mail, les SMS, le robot de groupe DingTalk, WeCom, Lark, le téléphone et les webhooks personnalisés.
Seules les éditions Enterprise de DataWorks et supérieures prennent en charge la méthode custom Webhook.
2. Déclencher les vérifications de règles
Dans un Monitor, associez les règles à un nœud de planification. Lorsque le nœud de planification s'exécute avec succès dans Operation Center, les règles de qualité des données associées sont automatiquement déclenchées pour validation. DataWorks détermine s'il convient de définir l'instance de tâche comme ayant échoué et de bloquer les tâches en aval en fonction de la force de la règle et des résultats de la vérification, empêchant ainsi la propagation des données erronées.
3. Consulter les résultats des vérifications
Sur la page Running Records, vous pouvez effectuer une recherche par nom de table ou de nœud et consulter les résultats détaillés des vérifications ainsi que les journaux pour chaque exécution du moniteur de qualité. Pour plus d'informations, reportez-vous à Consulter les enregistrements d'exécution.
FAQ
Les alertes de qualité des données DataWorks et les alertes de groupe DingTalk MaxCompute font-elles doublon ?
MaxCompute ne propose pas de fonctionnalité indépendante de surveillance de la qualité des données. Les alertes de qualité des données reçues dans les groupes DingTalk MaxCompute sont en réalité configurées et déclenchées via DataWorks Data Quality (DQC). DataWorks Data Quality génère des instructions SQL à partir des règles de vérification et les soumet à des moteurs de calcul tels que MaxCompute pour exécution. Une fois les vérifications terminées, des notifications sont envoyées en fonction des abonnements aux alertes configurés pour les règles.
Par conséquent, les alertes de qualité des données DataWorks et les alertes des groupes DingTalk MaxCompute ne constituent pas deux systèmes indépendants et ne se chevauchent pas fonctionnellement. Il vous suffit de configurer les règles de surveillance et les abonnements aux alertes dans DataWorks Data Quality.
La décision de configurer la surveillance de la qualité des données pour une table dépend de l'importance critique des données de cette table pour votre activité. Pour les tables métier essentielles, la configuration de la surveillance de la qualité permet de recevoir des alertes rapides ou de bloquer les tâches en aval en cas d'anomalies de données, évitant ainsi que des données vides ou erronées ne perturbent les activités métier.