O DataWorks permite criar um sistema offline de data warehousing e análise no MaxCompute. No console do DataWorks, configure nós do MaxCompute, ative o agendamento periódico e gerencie metadados para manter os pipelines de dados eficientes.
Este tópico aborda faturamento, configuração de ambiente, gerenciamento de permissões e fluxos de trabalho essenciais de desenvolvimento.
Como funciona
O DataWorks e o MaxCompute operam em três camadas distintas:
DataWorks: camada de orquestração. Gerencia o desenvolvimento de tarefas, o agendamento, a governança de dados e o monitoramento de O&M.
MaxCompute: camada de computação e armazenamento. Executa todas as consultas SQL, armazena dados e processa jobs.
Grupos de recursos: camada de execução. Fornecem a capacidade de computação para rodar tarefas agendadas e jobs de sincronização de dados.
Um fluxo de trabalho típico de ponta a ponta segue esta sequência:
Sincronize dados da source para o MaxCompute com o Data Integration.
Desenvolva e agende tarefas ODPS SQL no DataStudio.
Implante as tarefas no ambiente de produção.
Monitore e solucione problemas nas execuções agendadas no Operation Center.
Essa separação é fundamental para o faturamento: o DataWorks cobra pela orquestração (edições e grupos de recursos), enquanto o MaxCompute cobra separadamente por computação e armazenamento. Consulte Faturamento para mais detalhes.
Pré-requisitos
Antes de começar, verifique se você tem:
DataWorks ativado. Consulte Compra.
MaxCompute ativado. Consulte Ativar o MaxCompute.
Um workspace do DataWorks criado. Consulte Criar e gerenciar workspaces.
Faturamento
O uso do DataStudio e do Operation Center do DataWorks com o MaxCompute gera duas faturas separadas: uma do DataWorks e outra do MaxCompute (além de outros serviços da Alibaba Cloud utilizados).
Taxas do DataWorks
|
Taxa |
Descrição |
|
Taxa de edição |
Cobrada ao adquirir as edições Standard, Professional ou Enterprise do DataWorks. |
|
Taxa de recurso de agendamento |
Recursos de agendamento são obrigatórios para executar tarefas periódicas. Adquira um grupo de recursos serverless (recomendado) ou um grupo de recursos exclusivo de versão anterior. |
|
Taxa de recurso de sincronização |
Tarefas de sincronização de dados consomem recursos de agendamento e de sincronização. Adquira um grupo de recursos serverless (recomendado) ou um grupo de recursos exclusivo de versão anterior. |
Um único grupo de recursos serverless cobre o agendamento de tarefas, a sincronização de dados e o DataService Studio.
As taxas de agendamento não se aplicam quando você:
Executa tarefas manualmente usando Run ou Run with Parameters na barra de ferramentas do DataStudio.
Executa tarefas que falham ou rodam como simulação (dry run).
Para detalhes sobre o cálculo das taxas de agendamento, consulte Lógica de emissão de tarefas de agendamento no DataWorks.
Taxas de outros serviços da Alibaba Cloud
Essas cobranças aparecem nas faturas dos respectivos serviços, e não no DataWorks.
|
Taxa |
Quando se aplica |
|
Taxas de banco de dados |
Execução de tarefas de sincronização de dados que leem ou gravam em bancos de dados |
|
Taxas de computação e armazenamento do MaxCompute |
Execução de tarefas em nós ODPS SQL que criam tabelas ou processam dados no MaxCompute |
|
Taxas de rede |
Estabelecimento de conexões de rede usando Express Connect, Elastic IP Address (EIP) ou Internet Shared Bandwidth |
Para detalhes sobre o faturamento do MaxCompute, consulte Itens faturáveis do MaxCompute.
Preparação do ambiente
Conclua esta seção antes de desenvolver tarefas. Ao finalizar, você terá:
Uma edição do DataWorks e um grupo de recursos configurados para sua carga de trabalho.
Um projeto do MaxCompute associado ao seu workspace do DataWorks como fonte de dados.
Membros do workspace adicionados com as funções apropriadas para desenvolvimento colaborativo.
Selecione uma edição e um grupo de recursos
|
Item |
Opções |
Referência |
|
DataWorks edition |
Basic Edition: Cobre migração de dados para a nuvem, desenvolvimento de tarefas, agendamento e governança de dados. Standard, Professional ou Enterprise Edition: Necessárias para recursos avançados de governança e segurança de dados. |
|
|
Resource group |
Serverless resource group (recomendado): Um único grupo de recursos atende simultaneamente a agendamento, sincronização de dados e DataService Studio. Grupo de recursos exclusivo ou compartilhado de versão anterior: Atende às necessidades básicas de agendamento. Observe que os grupos de recursos de versão anterior serão descontinuados. |
Configure o ambiente de desenvolvimento
|
Tarefa |
O que envolve |
Referência |
|
Configurar sincronização de dados |
Adicione um projeto do MaxCompute ao seu workspace como fonte de dados. As tarefas de sincronização só podem ser configuradas após a adição da fonte de dados. |
|
|
Configurar desenvolvimento e análise de dados |
Adicione um projeto do MaxCompute como fonte de dados e associe-o ao DataStudio para habilitar o desenvolvimento de tarefas, análise de dados e agendamento periódico. |
Associar um recurso de computação do MaxCompute. Em seguida, siga Preparações antes do desenvolvimento de dados: Associar um recurso de computação ou cluster ao DataStudio. |
|
Configurar desenvolvimento colaborativo |
Adicione usuários RAM ao seu workspace como membros e atribua a função Development para permitir o desenvolvimento colaborativo. |
Adicionar e gerenciar membros do workspace e suas permissões de função |
Gerenciamento de permissões
O DataWorks utiliza um modelo de permissão de dois níveis:
Permissões de acesso a dados: controlam quais tabelas do MaxCompute um usuário RAM pode consultar.
Permissões de serviço e recurso: controlam a quais recursos do console do DataWorks um usuário RAM pode acessar.
Permissões de acesso a dados
Use um nó ODPS SQL ou de consulta ad hoc para consultar dados em tabelas do MaxCompute. Os workspaces do DataWorks operam no modo básico ou no modo padrão. Este tópico utiliza um workspace no modo padrão, que oferece gerenciamento granular de permissões e isolamento entre os ambientes de desenvolvimento e produção.
No modo padrão, duas identidades diferentes executam as tarefas:
Ambiente de desenvolvimento: A conta pessoal da Alibaba Cloud do executor da tarefa executa as tarefas por padrão.
Ambiente de produção: Uma identidade de acesso de agendamento (uma conta da Alibaba Cloud) executa as tarefas. Essa identidade possui altas permissões no projeto do MaxCompute de produção.
A conta que executa uma consulta depende de como você referencia o projeto no SQL:
|
Padrão SQL |
Ambiente de desenvolvimento |
Ambiente de produção |
|
|
Conta pessoal do executor da tarefa |
Identidade de acesso de agendamento |
|
|
Conta pessoal do executor da tarefa (requer solicitação de permissão no Security Center para acessar dados de prod) |
Identidade de acesso de agendamento |
|
|
Conta pessoal do executor da tarefa |
Identidade de acesso de agendamento |
Para visualizar quais projetos do MaxCompute estão associados a cada ambiente e as contas configuradas para eles, acesse a página Workspace e verifique a seção Compute Engine Information . Para mais detalhes, consulte Associar um recurso de computação do MaxCompute .
Permissões de usuário RAM por ambiente:
Após atribuir uma função no nível de workspace a um usuário RAM, as permissões dele no MaxCompute variam conforme o ambiente:
Ambiente de desenvolvimento: O usuário RAM recebe automaticamente as permissões da função correspondente no projeto de desenvolvimento do MaxCompute.
Ambiente de produção: O usuário RAM não possui permissões padrão. Para consultar tabelas no projeto do MaxCompute de produção, acesse o Security Center e solicite as permissões necessárias.
Para uma referência completa sobre permissões de dados do MaxCompute, consulte Permissões de dados do MaxCompute.
Permissões de serviço e recurso
Antes que um usuário RAM possa desenvolver dados no DataWorks, atribua a ele uma função no nível de workspace. Consulte Melhores práticas: Conceder permissões a usuários RAM.
Dois mecanismos de autorização estão disponíveis:
Autorização baseada em política RAM: Controla o acesso aos módulos de serviço do DataWorks (como impedir o acesso ao Data Map) e operações no nível do console (como excluir um workspace).
Controle de acesso baseado em função (RBAC): Controla o acesso a módulos no nível de workspace (como operações de desenvolvimento no DataStudio) e módulos globais (como o Data Security Guard).

Primeiros passos
Integração de dados
O Data Integration lê e grava dados no MaxCompute. A sincronização ocorre em ambas as direções: de uma fonte de dados externa para o MaxCompute ou do MaxCompute para um sistema externo.
Cenários de sincronização compatíveis: sincronização em lote, sincronização em tempo real e sincronização completa e incremental.
Para escolher o cenário de sincronização adequado, consulte Visão geral do Data Integration.
Modelagem e desenvolvimento de dados
Data Modeling
O Data Modeling é o ponto de partida para a governança de dados de ponta a ponta. Ele aplica a metodologia de mid-end de dados da Alibaba para estruturar dados empresariais usando quatro módulos: planejamento de data warehouse, padrão de dados, modelagem dimensional e métrica de dados. Isso fornece às equipes uma estrutura compartilhada para interpretar dados de negócios de forma consistente.
Consulte Visão geral do Data Modeling.
DataStudio
O DataStudio encapsula o mecanismo de computação do MaxCompute para que você desenvolva e agende tarefas sem escrever scripts complexos de linha de comando. Ele oferece suporte a:
Desenvolvimento de dados: Crie e agende diferentes tipos de nós — ODPS SQL, PyODPS 2, PyODPS 3, ODPS Spark, MaxCompute Script, MaxCompute MR e nós de uso geral como Shell, Branch, Assignment, Do-while e For-each.
Sincronização de dados: Um subconjunto de cenários de sincronização em lote e em tempo real. Consulte Integração de dados para a lista completa de cenários.
Referências úteis para desenvolvimento de tarefas:
Após desenvolver as tarefas, conclua as etapas a seguir antes da produção:
Configure as propriedades de agendamento: defina dependências e parâmetros de agendamento para permitir a execução periódica.
Depure os nós: execute tarefas no ambiente de desenvolvimento para validar a lógica e evitar desperdício de recursos de computação na produção.
Implante os nós: implante tarefas no ambiente de produção. As tarefas implantadas aparecem na página Auto Triggered Nodes no Operation Center.
Gerencie os nós: implante, remova a implantação ou atualize em lote as propriedades de agendamento de várias tarefas.
Gerencie o processo de desenvolvimento: use revisão de código, testes de fumaça obrigatórios e fluxos de trabalho de revisão personalizáveis para impor padrões de desenvolvimento.
Referências: Visão geral das propriedades de agendamento, Processo de depuração de tarefas, Publicar tarefas, Operações em lote, Controle do processo de desenvolvimento.
Operation Center
O Operation Center é uma plataforma de monitoramento e O&M de ponta a ponta para tarefas agendadas. Use-o para:
Visualizar o status das tarefas e o histórico de execução.
Executar diagnósticos inteligentes e reexecutar tarefas com falha.
Configurar linhas de base inteligentes para monitorar e impor SLAs de horário de entrega para tarefas críticas.
Consulte Realizar operações básicas de O&M em tarefas agendadas.
Data Quality
O Data Quality monitora dados em todo o processo de P&D de ponta a ponta, combinando verificações de qualidade baseadas em regras com o agendamento de tarefas. Quando uma regra de qualidade é violada, o DataWorks alerta você e pode bloquear a execução de tarefas downstream até que o problema seja resolvido.
Consulte Visão geral do Data Quality.
Governança de dados
Após associar uma fonte de dados do MaxCompute a um workspace, o DataWorks coleta metadados automaticamente. Três módulos oferecem suporte à governança de dados:
|
Módulo |
Descrição |
Referência |
|
Data Map |
Plataforma de gerenciamento de metadados de nível empresarial. Pesquise, navegue e compreenda ativos de dados em toda a organização com base em serviços unificados de metadados. |
|
|
Security Center / Data Security Guard / Approval Center |
Governança de segurança de dados de ponta a ponta. Cobre classificação de ativos de dados, identificação de dados sensíveis, gerenciamento de autorização de acesso, mascaramento de dados, auditoria de acesso e detecção de riscos. |
Visão geral do Security Center, Visão geral do Data Security Guard, Visão geral do Approval Center |
|
Data Governance Center |
Identifica automaticamente problemas de governança com base em regras derivadas de experiência e fornece soluções que abrangem prevenção prévia e correção posterior. |
Análise de dados e serviços
|
Módulo |
Descrição |
Referência |
|
DataAnalysis |
Execute consultas baseadas em SQL online, explore dados, edite e compartilhe resultados de consultas, salve resultados como cartões de gráfico e gere relatórios visuais para reportes diários. |
|
|
DataService Studio |
Construa e publique serviços de API para consumidores internos e externos. Gerencia APIs centralizadamente para que as equipes possam compartilhar e acessar dados por meio de uma camada de serviço unificada. |
Open Platform
A Open Platform permite que seus sistemas de aplicativos se integrem programaticamente ao DataWorks.
|
Módulo |
Funcionalidade |
Referência |
|
OpenAPI |
Chame operações de API do DataWorks a partir de seus aplicativos para automatizar o processamento de big data, reduzir O&M manual e minimizar riscos de dados. |
|
|
OpenEvent |
Assine eventos de alteração do DataWorks para que seus aplicativos possam detectar e reagir a mudanças de estado do pipeline em tempo real. |
|
|
Extensions |
Registre um programa local como uma extensão para gerenciar eventos e processos de pontos de extensão em seu workspace do DataWorks. |
Apêndice: Relação entre DataWorks e MaxCompute
O DataWorks fornece capacidades de orquestração — agendamento, gerenciamento de metadados, governança de dados e segurança de dados — enquanto o MaxCompute lida com toda a computação e armazenamento de dados.
Em um workspace no modo padrão, você associa mecanismos de computação do MaxCompute separados aos ambientes de desenvolvimento e produção. Isso isola o armazenamento e os recursos entre os dois ambientes.
Para workspaces no modo básico, apenas o ambiente de produção está disponível, e você pode associar apenas um mecanismo de computação do MaxCompute.

Para adicionar uma fonte de dados do MaxCompute, associá-la ao DataStudio e visualizar quais projetos do MaxCompute são usados em cada ambiente, consulte Associar um recurso de computação do MaxCompute.
Para entender como o DataWorks emite e rastreia tarefas agendadas, consulte Lógica de emissão de nós de agendamento no DataWorks.