Todos os produtos
Search
Central de documentação

DataWorks:Diretrizes de desenvolvimento do MaxCompute

Última atualização: Jun 27, 2026

O DataWorks permite criar um sistema offline de data warehousing e análise no MaxCompute. No console do DataWorks, configure nós do MaxCompute, ative o agendamento periódico e gerencie metadados para manter os pipelines de dados eficientes.

Este tópico aborda faturamento, configuração de ambiente, gerenciamento de permissões e fluxos de trabalho essenciais de desenvolvimento.

Como funciona

O DataWorks e o MaxCompute operam em três camadas distintas:

  • DataWorks: camada de orquestração. Gerencia o desenvolvimento de tarefas, o agendamento, a governança de dados e o monitoramento de O&M.

  • MaxCompute: camada de computação e armazenamento. Executa todas as consultas SQL, armazena dados e processa jobs.

  • Grupos de recursos: camada de execução. Fornecem a capacidade de computação para rodar tarefas agendadas e jobs de sincronização de dados.

Um fluxo de trabalho típico de ponta a ponta segue esta sequência:

  1. Sincronize dados da source para o MaxCompute com o Data Integration.

  2. Desenvolva e agende tarefas ODPS SQL no DataStudio.

  3. Implante as tarefas no ambiente de produção.

  4. Monitore e solucione problemas nas execuções agendadas no Operation Center.

Essa separação é fundamental para o faturamento: o DataWorks cobra pela orquestração (edições e grupos de recursos), enquanto o MaxCompute cobra separadamente por computação e armazenamento. Consulte Faturamento para mais detalhes.

Pré-requisitos

Antes de começar, verifique se você tem:

Faturamento

O uso do DataStudio e do Operation Center do DataWorks com o MaxCompute gera duas faturas separadas: uma do DataWorks e outra do MaxCompute (além de outros serviços da Alibaba Cloud utilizados).

Taxas do DataWorks

Taxa

Descrição

Taxa de edição

Cobrada ao adquirir as edições Standard, Professional ou Enterprise do DataWorks.

Taxa de recurso de agendamento

Recursos de agendamento são obrigatórios para executar tarefas periódicas. Adquira um grupo de recursos serverless (recomendado) ou um grupo de recursos exclusivo de versão anterior.

Taxa de recurso de sincronização

Tarefas de sincronização de dados consomem recursos de agendamento e de sincronização. Adquira um grupo de recursos serverless (recomendado) ou um grupo de recursos exclusivo de versão anterior.

Um único grupo de recursos serverless cobre o agendamento de tarefas, a sincronização de dados e o DataService Studio.

As taxas de agendamento não se aplicam quando você:

  • Executa tarefas manualmente usando Run ou Run with Parameters na barra de ferramentas do DataStudio.

  • Executa tarefas que falham ou rodam como simulação (dry run).

Para detalhes sobre o cálculo das taxas de agendamento, consulte Lógica de emissão de tarefas de agendamento no DataWorks.

Taxas de outros serviços da Alibaba Cloud

Essas cobranças aparecem nas faturas dos respectivos serviços, e não no DataWorks.

Taxa

Quando se aplica

Taxas de banco de dados

Execução de tarefas de sincronização de dados que leem ou gravam em bancos de dados

Taxas de computação e armazenamento do MaxCompute

Execução de tarefas em nós ODPS SQL que criam tabelas ou processam dados no MaxCompute

Taxas de rede

Estabelecimento de conexões de rede usando Express Connect, Elastic IP Address (EIP) ou Internet Shared Bandwidth

Para detalhes sobre o faturamento do MaxCompute, consulte Itens faturáveis do MaxCompute.

Preparação do ambiente

Conclua esta seção antes de desenvolver tarefas. Ao finalizar, você terá:

  • Uma edição do DataWorks e um grupo de recursos configurados para sua carga de trabalho.

  • Um projeto do MaxCompute associado ao seu workspace do DataWorks como fonte de dados.

  • Membros do workspace adicionados com as funções apropriadas para desenvolvimento colaborativo.

Selecione uma edição e um grupo de recursos

Item

Opções

Referência

DataWorks edition

Basic Edition: Cobre migração de dados para a nuvem, desenvolvimento de tarefas, agendamento e governança de dados. Standard, Professional ou Enterprise Edition: Necessárias para recursos avançados de governança e segurança de dados.

Comparar edições do DataWorks

Resource group

Serverless resource group (recomendado): Um único grupo de recursos atende simultaneamente a agendamento, sincronização de dados e DataService Studio. Grupo de recursos exclusivo ou compartilhado de versão anterior: Atende às necessidades básicas de agendamento. Observe que os grupos de recursos de versão anterior serão descontinuados.

Visão geral dos grupos de recursos do DataWorks

Configure o ambiente de desenvolvimento

Tarefa

O que envolve

Referência

Configurar sincronização de dados

Adicione um projeto do MaxCompute ao seu workspace como fonte de dados. As tarefas de sincronização só podem ser configuradas após a adição da fonte de dados.

Associar um recurso de computação do MaxCompute

Configurar desenvolvimento e análise de dados

Adicione um projeto do MaxCompute como fonte de dados e associe-o ao DataStudio para habilitar o desenvolvimento de tarefas, análise de dados e agendamento periódico.

Associar um recurso de computação do MaxCompute. Em seguida, siga Preparações antes do desenvolvimento de dados: Associar um recurso de computação ou cluster ao DataStudio.

Configurar desenvolvimento colaborativo

Adicione usuários RAM ao seu workspace como membros e atribua a função Development para permitir o desenvolvimento colaborativo.

Adicionar e gerenciar membros do workspace e suas permissões de função

Gerenciamento de permissões

O DataWorks utiliza um modelo de permissão de dois níveis:

  • Permissões de acesso a dados: controlam quais tabelas do MaxCompute um usuário RAM pode consultar.

  • Permissões de serviço e recurso: controlam a quais recursos do console do DataWorks um usuário RAM pode acessar.

Permissões de acesso a dados

Use um nó ODPS SQL ou de consulta ad hoc para consultar dados em tabelas do MaxCompute. Os workspaces do DataWorks operam no modo básico ou no modo padrão. Este tópico utiliza um workspace no modo padrão, que oferece gerenciamento granular de permissões e isolamento entre os ambientes de desenvolvimento e produção.

No modo padrão, duas identidades diferentes executam as tarefas:

  • Ambiente de desenvolvimento: A conta pessoal da Alibaba Cloud do executor da tarefa executa as tarefas por padrão.

  • Ambiente de produção: Uma identidade de acesso de agendamento (uma conta da Alibaba Cloud) executa as tarefas. Essa identidade possui altas permissões no projeto do MaxCompute de produção.

A conta que executa uma consulta depende de como você referencia o projeto no SQL:

Padrão SQL

Ambiente de desenvolvimento

Ambiente de produção

select col1 from projectname_dev.tablename; (projeto dev)

Conta pessoal do executor da tarefa

Identidade de acesso de agendamento

select col1 from projectname.tablename; (projeto prod pelo nome)

Conta pessoal do executor da tarefa (requer solicitação de permissão no Security Center para acessar dados de prod)

Identidade de acesso de agendamento

select col1 from tablename; (projeto atual)

Conta pessoal do executor da tarefa

Identidade de acesso de agendamento

Para visualizar quais projetos do MaxCompute estão associados a cada ambiente e as contas configuradas para eles, acesse a página Workspace e verifique a seção Compute Engine Information . Para mais detalhes, consulte Associar um recurso de computação do MaxCompute .

Permissões de usuário RAM por ambiente:

Após atribuir uma função no nível de workspace a um usuário RAM, as permissões dele no MaxCompute variam conforme o ambiente:

  • Ambiente de desenvolvimento: O usuário RAM recebe automaticamente as permissões da função correspondente no projeto de desenvolvimento do MaxCompute.

  • Ambiente de produção: O usuário RAM não possui permissões padrão. Para consultar tabelas no projeto do MaxCompute de produção, acesse o Security Center e solicite as permissões necessárias.

Para uma referência completa sobre permissões de dados do MaxCompute, consulte Permissões de dados do MaxCompute.

Permissões de serviço e recurso

Antes que um usuário RAM possa desenvolver dados no DataWorks, atribua a ele uma função no nível de workspace. Consulte Melhores práticas: Conceder permissões a usuários RAM.

Dois mecanismos de autorização estão disponíveis:

  • Autorização baseada em política RAM: Controla o acesso aos módulos de serviço do DataWorks (como impedir o acesso ao Data Map) e operações no nível do console (como excluir um workspace).

  • Controle de acesso baseado em função (RBAC): Controla o acesso a módulos no nível de workspace (como operações de desenvolvimento no DataStudio) e módulos globais (como o Data Security Guard).

开发流程

Primeiros passos

Integração de dados

O Data Integration lê e grava dados no MaxCompute. A sincronização ocorre em ambas as direções: de uma fonte de dados externa para o MaxCompute ou do MaxCompute para um sistema externo.

Cenários de sincronização compatíveis: sincronização em lote, sincronização em tempo real e sincronização completa e incremental.

Para escolher o cenário de sincronização adequado, consulte Visão geral do Data Integration.

Modelagem e desenvolvimento de dados

Data Modeling

O Data Modeling é o ponto de partida para a governança de dados de ponta a ponta. Ele aplica a metodologia de mid-end de dados da Alibaba para estruturar dados empresariais usando quatro módulos: planejamento de data warehouse, padrão de dados, modelagem dimensional e métrica de dados. Isso fornece às equipes uma estrutura compartilhada para interpretar dados de negócios de forma consistente.

Consulte Visão geral do Data Modeling.

DataStudio

O DataStudio encapsula o mecanismo de computação do MaxCompute para que você desenvolva e agende tarefas sem escrever scripts complexos de linha de comando. Ele oferece suporte a:

  • Desenvolvimento de dados: Crie e agende diferentes tipos de nós — ODPS SQL, PyODPS 2, PyODPS 3, ODPS Spark, MaxCompute Script, MaxCompute MR e nós de uso geral como Shell, Branch, Assignment, Do-while e For-each.

  • Sincronização de dados: Um subconjunto de cenários de sincronização em lote e em tempo real. Consulte Integração de dados para a lista completa de cenários.

Referências úteis para desenvolvimento de tarefas:

Após desenvolver as tarefas, conclua as etapas a seguir antes da produção:

  1. Configure as propriedades de agendamento: defina dependências e parâmetros de agendamento para permitir a execução periódica.

  2. Depure os nós: execute tarefas no ambiente de desenvolvimento para validar a lógica e evitar desperdício de recursos de computação na produção.

  3. Implante os nós: implante tarefas no ambiente de produção. As tarefas implantadas aparecem na página Auto Triggered Nodes no Operation Center.

  4. Gerencie os nós: implante, remova a implantação ou atualize em lote as propriedades de agendamento de várias tarefas.

  5. Gerencie o processo de desenvolvimento: use revisão de código, testes de fumaça obrigatórios e fluxos de trabalho de revisão personalizáveis para impor padrões de desenvolvimento.

Referências: Visão geral das propriedades de agendamento, Processo de depuração de tarefas, Publicar tarefas, Operações em lote, Controle do processo de desenvolvimento.

Operation Center

O Operation Center é uma plataforma de monitoramento e O&M de ponta a ponta para tarefas agendadas. Use-o para:

  • Visualizar o status das tarefas e o histórico de execução.

  • Executar diagnósticos inteligentes e reexecutar tarefas com falha.

  • Configurar linhas de base inteligentes para monitorar e impor SLAs de horário de entrega para tarefas críticas.

Consulte Realizar operações básicas de O&M em tarefas agendadas.

Data Quality

O Data Quality monitora dados em todo o processo de P&D de ponta a ponta, combinando verificações de qualidade baseadas em regras com o agendamento de tarefas. Quando uma regra de qualidade é violada, o DataWorks alerta você e pode bloquear a execução de tarefas downstream até que o problema seja resolvido.

Consulte Visão geral do Data Quality.

Governança de dados

Após associar uma fonte de dados do MaxCompute a um workspace, o DataWorks coleta metadados automaticamente. Três módulos oferecem suporte à governança de dados:

Módulo

Descrição

Referência

Data Map

Plataforma de gerenciamento de metadados de nível empresarial. Pesquise, navegue e compreenda ativos de dados em toda a organização com base em serviços unificados de metadados.

Visão geral do Data Map

Security Center / Data Security Guard / Approval Center

Governança de segurança de dados de ponta a ponta. Cobre classificação de ativos de dados, identificação de dados sensíveis, gerenciamento de autorização de acesso, mascaramento de dados, auditoria de acesso e detecção de riscos.

Visão geral do Security Center, Visão geral do Data Security Guard, Visão geral do Approval Center

Data Governance Center

Identifica automaticamente problemas de governança com base em regras derivadas de experiência e fornece soluções que abrangem prevenção prévia e correção posterior.

Visão geral do Data Governance Center

Análise de dados e serviços

Módulo

Descrição

Referência

DataAnalysis

Execute consultas baseadas em SQL online, explore dados, edite e compartilhe resultados de consultas, salve resultados como cartões de gráfico e gere relatórios visuais para reportes diários.

Visão geral do DataAnalysis

DataService Studio

Construa e publique serviços de API para consumidores internos e externos. Gerencia APIs centralizadamente para que as equipes possam compartilhar e acessar dados por meio de uma camada de serviço unificada.

Visão geral do DataService Studio

Open Platform

A Open Platform permite que seus sistemas de aplicativos se integrem programaticamente ao DataWorks.

Módulo

Funcionalidade

Referência

OpenAPI

Chame operações de API do DataWorks a partir de seus aplicativos para automatizar o processamento de big data, reduzir O&M manual e minimizar riscos de dados.

OpenAPI

OpenEvent

Assine eventos de alteração do DataWorks para que seus aplicativos possam detectar e reagir a mudanças de estado do pipeline em tempo real.

Visão geral do OpenEvent

Extensions

Registre um programa local como uma extensão para gerenciar eventos e processos de pontos de extensão em seu workspace do DataWorks.

Visão geral das Extensions

Apêndice: Relação entre DataWorks e MaxCompute

O DataWorks fornece capacidades de orquestração — agendamento, gerenciamento de metadados, governança de dados e segurança de dados — enquanto o MaxCompute lida com toda a computação e armazenamento de dados.

Em um workspace no modo padrão, você associa mecanismos de computação do MaxCompute separados aos ambientes de desenvolvimento e produção. Isso isola o armazenamento e os recursos entre os dois ambientes.

Para workspaces no modo básico, apenas o ambiente de produção está disponível, e você pode associar apenas um mecanismo de computação do MaxCompute.

引擎绑定