O Data Quality (DQC) do DataWorks é uma plataforma robusta para monitorar e proteger seus dados. Ele detecta e intercepta proativamente "dados incorretos" inesperados nos pipelines de produção antes que se propaguem para etapas posteriores. Isso garante decisões de negócios precisas e reduz significativamente os custos com solução de problemas e reexecução de recursos.
Conceitos principais e fluxo de trabalho
Antes de usar o Data Quality, compreenda seus conceitos principais e fluxo de trabalho. O sistema baseia-se nas seguintes entidades centrais:
Template: Define a lógica de validação de dados. O DataWorks oferece uma vasta biblioteca de modelos integrados, como contagem de linhas de tabela e número de valores distintos em uma coluna. Você também pode criar modelos personalizados para atender a requisitos específicos de negócios.
Monitoring Rules: Representa uma instância específica de um modelo de regra. Aplique um modelo a uma coluna de tabela e configure um limiar específico. Por exemplo, a coluna
order_countna tabeladaily_salesnão pode ser nula.Monitor: Plano de execução que associa uma ou mais Monitoring Rules a um nó de agendamento. Após a execução bem-sucedida do nó de agendamento, o sistema aciona automaticamente todas as regras de qualidade associadas para validação.
Regras fortes/fracas e bloqueio: Defina as regras como Strong rules ou Weak rules. Se a verificação falhar, escolha entre Blocks tarefas downstream ou enviar apenas um Alert.
Fluxo de trabalho típico:
Nós virtuais e nós de execução simulada não geram dados reais nem acionam regras de qualidade de dados.
Recursos
O Data Quality do DataWorks suporta verificações de qualidade para serviços comuns de armazenamento de big data, como MaxCompute, E-MapReduce, Hologres e AnalyticDB. Configure regras de monitoramento em várias dimensões, como integridade, precisão e consistência. Associe-as a nós de agendamento para habilitar validação automatizada, alertas e bloqueios.
Os principais módulos do Data Quality e suas páginas correspondentes no console são:
|
Módulo |
Descrição |
|
|
A página de visão geral do Data Quality exibe métricas essenciais de qualidade de dados do seu workspace. Inclui tendências e distribuição de status de verificações de regras acionadas por execuções de instâncias, tabelas com mais problemas de qualidade e respectivos responsáveis, além da cobertura de regras de qualidade. Essas informações ajudam os gestores a entender rapidamente o status geral da qualidade de dados e a resolver problemas prontamente. |
||
|
Ativos de qualidade |
Lista todas as regras de qualidade configuradas. |
|
|
O Data Quality suporta bibliotecas personalizadas de modelos de regras. Gerencie centralmente regras de monitoramento personalizadas comuns em uma biblioteca de modelos para aumentar a eficiência da configuração. |
||
|
Configuração de regras |
Principal método para configurar regras de monitoramento, permitindo configurações detalhadas para uma única tabela. |
|
|
Configura regras em lote para múltiplas tabelas que atendem a condições especificadas, com base em modelos existentes. |
||
|
Operações de qualidade |
Exibe todas as tarefas de monitoramento de qualidade criadas no workspace atual. |
|
|
Mostra os resultados das verificações de regras das execuções de tarefas de monitoramento. Após a execução de uma tarefa, visualize os detalhes nesta página. |
||
|
Análise de qualidade |
Permite criar modelos de relatórios e adicionar diversas métricas de configuração e execução de regras. O sistema gera e envia relatórios automaticamente conforme o período estatístico, horário de entrega e assinaturas definidos. |
|
Faturamento
Os custos de execução das regras de qualidade de dados dividem-se em duas partes:
Cobranças do DataWorks: Faturamento no modelo pagamento conforme o uso, baseado no número de execuções de instâncias de regras de qualidade de dados. Para obter mais informações, consulte Billing of data quality.
Custos do mecanismo de computação: As verificações de regras geram instruções SQL e as submetem ao mecanismo de computação subjacente para execução. Isso gera custos de computação do respectivo mecanismo (por exemplo, MaxCompute). O provedor do mecanismo cobra esses custos diretamente, sem reflexo na fatura do DataWorks.
Observações
Fontes de dados suportadas: Apenas MaxCompute, Hologres, E-MapReduce, DLF, CDH Hive, AnalyticDB PostgreSQL, AnalyticDB MySQL, StarRocks, MySQL, Lindorm e SQL Server têm suporte. As regiões variam conforme o tipo de fonte de dados. Consulte as regiões suportadas pelo mecanismo específico.
Coleta de metadados: Antes de configurar regras para fontes de dados externas ao MaxCompute, como E-MapReduce, Hologres, AnalyticDB e CDH, conclua a coleta de metadados. Para obter mais informações, consulte Configure metadata collection.
Conectividade de rede: Ao verificar fontes de dados externas ao MaxCompute, execute o nó de agendamento associado em um grupo de recursos com network connectivity solution configurado.
Fluxo de trabalho de configuração e uso
1. Configurar regras
Create Rule: Crie regras de qualidade de dados por tabela. Utilize modelos de regras integrados ou personalizados para criar regras em lote para várias tabelas. Para obter mais informações, consulte Create a rule for a single table e Create rules in batches.
-
Assinar alertas: Após criar as regras, configure notificações de alerta por meio de assinaturas. Há suporte para vários canais, incluindo e-mail, SMS, bot de grupo do DingTalk, WeCom, Lark, telefone e webhooks personalizados.
Apenas o DataWorks Enterprise Edition e versões superiores suportam o método de Webhook personalizado.
2. Acionar verificações de regras
Em um Monitor, associe regras a um nó de agendamento. Quando o nó de agendamento for executado com êxito no Operation Center, o sistema acionará automaticamente as regras de qualidade de dados associadas para validação. O DataWorks determina se deve definir a instância da tarefa como falha e bloquear tarefas downstream com base na força da regra e nos resultados da verificação, impedindo a propagação de dados incorretos.
3. Visualizar resultados das verificações
Na página Running Records, pesquise por nome de tabela ou nó e visualize os resultados detalhados das verificações e logs de cada execução de monitoramento. Para obter mais informações, consulte View running records.
Perguntas frequentes
Os alertas de qualidade de dados do DataWorks e os alertas de grupo do DingTalk do MaxCompute são duplicados?
O MaxCompute não fornece um recurso independente de monitoramento de qualidade de dados. Os alertas recebidos em grupos do DingTalk do MaxCompute são configurados e acionados pelo Data Quality (DQC) do DataWorks. O DQC gera instruções SQL a partir das regras de verificação e as submete a mecanismos de computação, como o MaxCompute, para execução. Após a conclusão das verificações, o sistema envia notificações com base nas assinaturas de alerta configuradas.
Portanto, os alertas do DataWorks e os dos grupos do DingTalk do MaxCompute não são sistemas independentes nem possuem sobreposição de funcionalidades. Configure as regras de monitoramento e as assinaturas de alerta apenas no Data Quality do DataWorks.
A decisão de configurar o monitoramento depende da criticidade dos dados da tabela para o seu negócio. Em tabelas essenciais, o monitoramento permite alertas oportunos ou o bloqueio de tarefas downstream quando ocorrem anomalias, evitando que dados vazios ou incorretos causem interrupções.