Todos os produtos
Search
Central de documentação

DataWorks:Visão geral do Data Quality

Última atualização: Aug 17, 2026

O Data Quality (DQC) do DataWorks é uma plataforma robusta para monitorar e proteger seus dados. Ele detecta e intercepta proativamente "dados incorretos" inesperados nos pipelines de produção antes que se propaguem para etapas posteriores. Isso garante decisões de negócios precisas e reduz significativamente os custos com solução de problemas e reexecução de recursos.

Conceitos principais e fluxo de trabalho

Antes de usar o Data Quality, compreenda seus conceitos principais e fluxo de trabalho. O sistema baseia-se nas seguintes entidades centrais:

  1. Template: Define a lógica de validação de dados. O DataWorks oferece uma vasta biblioteca de modelos integrados, como contagem de linhas de tabela e número de valores distintos em uma coluna. Você também pode criar modelos personalizados para atender a requisitos específicos de negócios.

  2. Monitoring Rules: Representa uma instância específica de um modelo de regra. Aplique um modelo a uma coluna de tabela e configure um limiar específico. Por exemplo, a coluna order_count na tabela daily_sales não pode ser nula.

  3. Monitor: Plano de execução que associa uma ou mais Monitoring Rules a um nó de agendamento. Após a execução bem-sucedida do nó de agendamento, o sistema aciona automaticamente todas as regras de qualidade associadas para validação.

  4. Regras fortes/fracas e bloqueio: Defina as regras como Strong rules ou Weak rules. Se a verificação falhar, escolha entre Blocks tarefas downstream ou enviar apenas um Alert.

Fluxo de trabalho típico:

Importante

Nós virtuais e nós de execução simulada não geram dados reais nem acionam regras de qualidade de dados.

image

Recursos

O Data Quality do DataWorks suporta verificações de qualidade para serviços comuns de armazenamento de big data, como MaxCompute, E-MapReduce, Hologres e AnalyticDB. Configure regras de monitoramento em várias dimensões, como integridade, precisão e consistência. Associe-as a nós de agendamento para habilitar validação automatizada, alertas e bloqueios.

Os principais módulos do Data Quality e suas páginas correspondentes no console são:

Módulo

Descrição

Data quality overview

A página de visão geral do Data Quality exibe métricas essenciais de qualidade de dados do seu workspace. Inclui tendências e distribuição de status de verificações de regras acionadas por execuções de instâncias, tabelas com mais problemas de qualidade e respectivos responsáveis, além da cobertura de regras de qualidade. Essas informações ajudam os gestores a entender rapidamente o status geral da qualidade de dados e a resolver problemas prontamente.

Ativos de qualidade

Rule list

Lista todas as regras de qualidade configuradas.

Rule template library

O Data Quality suporta bibliotecas personalizadas de modelos de regras. Gerencie centralmente regras de monitoramento personalizadas comuns em uma biblioteca de modelos para aumentar a eficiência da configuração.

Configuração de regras

Configure rules: By table

Principal método para configurar regras de monitoramento, permitindo configurações detalhadas para uma única tabela.

Configure rules by template

Configura regras em lote para múltiplas tabelas que atendem a condições especificadas, com base em modelos existentes.

Operações de qualidade

Quality monitor

Exibe todas as tarefas de monitoramento de qualidade criadas no workspace atual.

Running records

Mostra os resultados das verificações de regras das execuções de tarefas de monitoramento. Após a execução de uma tarefa, visualize os detalhes nesta página.

Análise de qualidade

Quality reports

Permite criar modelos de relatórios e adicionar diversas métricas de configuração e execução de regras. O sistema gera e envia relatórios automaticamente conforme o período estatístico, horário de entrega e assinaturas definidos.

Faturamento

Os custos de execução das regras de qualidade de dados dividem-se em duas partes:

  • Cobranças do DataWorks: Faturamento no modelo pagamento conforme o uso, baseado no número de execuções de instâncias de regras de qualidade de dados. Para obter mais informações, consulte Billing of data quality.

  • Custos do mecanismo de computação: As verificações de regras geram instruções SQL e as submetem ao mecanismo de computação subjacente para execução. Isso gera custos de computação do respectivo mecanismo (por exemplo, MaxCompute). O provedor do mecanismo cobra esses custos diretamente, sem reflexo na fatura do DataWorks.

Observações

  • Fontes de dados suportadas: Apenas MaxCompute, Hologres, E-MapReduce, DLF, CDH Hive, AnalyticDB PostgreSQL, AnalyticDB MySQL, StarRocks, MySQL, Lindorm e SQL Server têm suporte. As regiões variam conforme o tipo de fonte de dados. Consulte as regiões suportadas pelo mecanismo específico.

  • Coleta de metadados: Antes de configurar regras para fontes de dados externas ao MaxCompute, como E-MapReduce, Hologres, AnalyticDB e CDH, conclua a coleta de metadados. Para obter mais informações, consulte Configure metadata collection.

  • Conectividade de rede: Ao verificar fontes de dados externas ao MaxCompute, execute o nó de agendamento associado em um grupo de recursos com network connectivity solution configurado.

Fluxo de trabalho de configuração e uso

1. Configurar regras

  • Create Rule: Crie regras de qualidade de dados por tabela. Utilize modelos de regras integrados ou personalizados para criar regras em lote para várias tabelas. Para obter mais informações, consulte Create a rule for a single table e Create rules in batches.

  • Assinar alertas: Após criar as regras, configure notificações de alerta por meio de assinaturas. Há suporte para vários canais, incluindo e-mail, SMS, bot de grupo do DingTalk, WeCom, Lark, telefone e webhooks personalizados.

    Apenas o DataWorks Enterprise Edition e versões superiores suportam o método de Webhook personalizado.

2. Acionar verificações de regras

Em um Monitor, associe regras a um nó de agendamento. Quando o nó de agendamento for executado com êxito no Operation Center, o sistema acionará automaticamente as regras de qualidade de dados associadas para validação. O DataWorks determina se deve definir a instância da tarefa como falha e bloquear tarefas downstream com base na força da regra e nos resultados da verificação, impedindo a propagação de dados incorretos.

3. Visualizar resultados das verificações

Na página Running Records, pesquise por nome de tabela ou nó e visualize os resultados detalhados das verificações e logs de cada execução de monitoramento. Para obter mais informações, consulte View running records.

Perguntas frequentes

Os alertas de qualidade de dados do DataWorks e os alertas de grupo do DingTalk do MaxCompute são duplicados?

O MaxCompute não fornece um recurso independente de monitoramento de qualidade de dados. Os alertas recebidos em grupos do DingTalk do MaxCompute são configurados e acionados pelo Data Quality (DQC) do DataWorks. O DQC gera instruções SQL a partir das regras de verificação e as submete a mecanismos de computação, como o MaxCompute, para execução. Após a conclusão das verificações, o sistema envia notificações com base nas assinaturas de alerta configuradas.

Portanto, os alertas do DataWorks e os dos grupos do DingTalk do MaxCompute não são sistemas independentes nem possuem sobreposição de funcionalidades. Configure as regras de monitoramento e as assinaturas de alerta apenas no Data Quality do DataWorks.

A decisão de configurar o monitoramento depende da criticidade dos dados da tabela para o seu negócio. Em tabelas essenciais, o monitoramento permite alertas oportunos ou o bloqueio de tarefas downstream quando ocorrem anomalias, evitando que dados vazios ou incorretos causem interrupções.