O DataWorks é uma plataforma unificada e completa para desenvolvimento e governança de big data, impulsionada por mecanismos como MaxCompute, Hologres, E-MapReduce (EMR), AnalyticDB e CDP. Ela oferece suporte a data warehouses, data lakes e arquiteturas lakehouse. Este tutorial demonstra como ingerir dados, orquestrar fluxos de trabalho empresariais, agendar tarefas periódicas e criar visualizações de dados com o DataWorks.
Primeiros passos
Este tutorial utiliza um cenário de e-commerce para demonstrar a construção de um Pipeline de Dados completo, desde a ingestão de dados brutos até a análise e Visualização de Dados. Seguir esse processo padronizado permite criar rapidamente Fluxos de Trabalho de dados reutilizáveis, garantindo Agendamento confiável e Observabilidade operacional. Essa abordagem possibilita que usuários de negócios transformem dados em insights sem necessidade de profundo conhecimento técnico, facilitando a adoção de aplicações de big data pela sua organização.
Neste tutorial, você irá:
Sincronização de Dados: Utilizar o módulo Data Integration no DataWorks para criar uma Tarefa em Lote de tabela única que sincroniza dados empresariais para uma plataforma de computação de big data, como o MaxCompute.
Limpeza de Dados: Usar o módulo Data Studio no DataWorks para processar, analisar e minerar dados empresariais.
Visualização de Dados: Empregar o módulo Data Analysis no DataWorks para converter resultados de análises em gráficos de fácil compreensão para usuários de negócios.
Agendamento Periódico: Configurar o Agendamento Periódico para os processos de Sincronização de Dados e Limpeza de Dados.

Neste tutorial, você utilizará o seguinte Fluxo de Trabalho para gerar um ranking diário das categorias de produtos mais vendidas, sincronizando e analisando dados brutos de produtos e pedidos de uma fonte de dados pública para o MaxCompute:
Pré-requisitos
Para concluir este tutorial, é necessária uma conta Alibaba Cloud ou um usuário RAM com a permissão AliyunDataWorksFullAccess. Para mais informações, consulte Preparar uma conta Alibaba Cloud ou Preparar um usuário RAM.
O DataWorks oferece um sistema abrangente de permissões que suporta controle de acesso nos níveis de produto e módulo. Caso necessite de um controle de acesso mais refinado, consulte Visão geral do sistema de gerenciamento de permissões do DataWorks.
Pré-requisitos
(Opcional) Ativar avaliação gratuita
Ativar o DataWorks
Criar workspace
Configurar grupo de recursos
Habilitar acesso à rede pública
Configurar recurso MaxCompute
Procedimento
Este tutorial demonstra os recursos principais do DataWorks por meio de um exemplo prático.
Imagine uma plataforma de e-commerce que armazena informações de produtos e pedidos em um banco de dados MySQL. O objetivo é analisar periodicamente esses dados e visualizar um ranking diário das categorias de produtos mais vendidas.
Etapa 1: Sincronizar dados
Criar uma fonte de dados
Nesta etapa, crie uma Data Source MySQL para conectar-se ao banco de dados de origem do tutorial.
Não é necessário preparar seus próprios dados empresariais. O DataWorks fornece um conjunto de dados de amostra em um banco de dados MySQL público para este tutorial. Crie uma Fonte de Dados MySQL para conectar-se a ele.
Acesse a página Management Center do DataWorks. Alterne a região para China (Shanghai), selecione seu Workspace na lista suspensa e clique em Default access identity.
-
No painel de navegação à esquerda, clique em Data Sources para ir à página Data Source List. Clique em Add Data Source, selecione o tipo MySQL e configure os parâmetros da Fonte de Dados.
NotaMantenha os valores padrão para os parâmetros não mencionados na tabela.
Ao adicionar uma fonte de dados pela primeira vez, é necessário concluir a China East 2 (Shanghai). Siga as instruções na tela para conceder a função vinculada ao serviço AliyunDIDefaultRole.
Parâmetro
Descrição
Go to Management Center
Para este tutorial, insira MySQL_Source.
Configuration Mode
Selecione Connection String Mode.
Endpoint
Host Address IP:
rm-bp1z69dodhh85z9qa.mysql.rds.aliyuncs.comPort:
3306
ImportanteOs dados deste tutorial destinam-se à prática hands-on com o DataWorks. São apenas para testes e somente leitura dentro do módulo Data Integration.
cross-service authorization
Insira
retail_e_commerce.Data Source Name
Insira
workshop.Password
Insira
workshop#2017. -
Na seção Connection Configuration, alterne para a aba Data Integration. Localize o grupo de recursos vinculado ao seu workspace e clique em Database Name na coluna Username.
NotaSe o teste de conectividade da fonte de dados MySQL falhar, execute as seguintes ações:
Conclua as etapas subsequentes na ferramenta de diagnóstico de conectividade.
Verifique se há um Elastic IP address (EIP) configurado para a VPC vinculada ao grupo de recursos. A fonte de dados MySQL exige que o grupo de recursos tenha acesso à rede pública. Para mais informações, consulte Habilitar acesso à rede pública para um grupo de recursos.
Clique em Complete Creation.
Construir um pipeline de sincronização
Nesta etapa, construa um pipeline de sincronização para transferir dados de produtos e pedidos de e-commerce para tabelas do MaxCompute para processamento posterior.
Clique no ícone
no canto superior esquerdo e selecione para ir à página do DataStudio.No topo da página, alterne para o seu Workspace. No painel de navegação à esquerda, clique em
para acessar a página do DataStudio.Na seção Connectivity Status, clique em
, selecione Create Workflow e nomeie-o como dw_quickstart.-
Na tela de fluxo de trabalho, arraste um nó Zero Load e dois nós de Batch Synchronization do painel esquerdo para a tela. Configure os nós de DataStudio (Data Development) da seguinte forma:
Data Source Type:
MySQLData Destination Type:
MaxComputeSpecific Type: Batch Synchronization Node
A tabela abaixo lista os nomes dos nós e suas funções neste tutorial:
Tipo de nó
Nome do nó
Função
Zero LoadworkshopServe como ponto de entrada do Fluxo de Trabalho para definir um fluxo de dados claro. Esta é uma tarefa Batch Synchronization que não requer código.
Batch Synchronization Nodeods_item_infoSincroniza a tabela de origem de informações de produtos
item_infodo MySQL para a tabelaods_item_infono MaxCompute.
Batch Synchronization Nodeods_trade_orderSincroniza a tabela de origem de informações de pedidos
trade_orderdo MySQL para a tabelaods_trade_orderno MaxCompute.Conecte os nós arrastando e soltando, tornando o nó
workshopo nó upstream para ambos os nós de Batch Synchronization. O resultado final deve ficar assim: -
Configure o agendamento do fluxo de trabalho.
No lado direito da tela de fluxo de trabalho, clique em Scheduling e configure os parâmetros. A tabela a seguir descreve os parâmetros principais para este tutorial. Utilize os valores padrão para todos os outros parâmetros.
Parâmetro de agendamento
Descrição
Scheduling Parameters
Define parâmetros de agendamento para todo o fluxo de trabalho. Eles podem ser usados diretamente pelos nós dentro do fluxo.
Para este tutorial, defina como
bizdate=$[yyyymmdd-1]para obter a data do dia anterior.NotaO DataWorks fornece parâmetros de agendamento que permitem valores dinâmicos no código. Defina variáveis no código SQL usando o formato
${variable_name}e atribua valores a elas em Scheduling > Scheduling Parameters. Para formatos de parâmetros suportados, consulte Formatos de parâmetros de agendamento.Dry-run
Para este tutorial, defina como
Daily.Scheduling Time
Para este tutorial, defina o Scheduling Time como
00:30. O fluxo de trabalho iniciará às00:30todos os dias.Scheduling Dependencies
Este fluxo de trabalho não possui dependências upstream, portanto, deixe esta opção sem configuração. Para gerenciamento unificado, clique em Use Workspace Root Node para anexar o fluxo ao nó raiz do workspace.
O nó raiz do workspace segue o formato de nome
WorkspaceName_root.
Configurar tarefas de sincronização
Etapa 2: Limpar e processar dados
Após sincronizar os dados para o MaxCompute, utilize o módulo DataStudio para limpar, processar e analisar as tabelas ods_item_info e ods_trade_order a fim de gerar um ranking diário das categorias de produtos mais vendidas.
Construir um pipeline de processamento de dados
-
No painel de navegação à esquerda do DataStudio, clique em
para ir à página do DataStudio. Na seção Workspace Directories, localize e clique no fluxo de trabalho criado. Na tela de fluxo de trabalho, arraste nós MaxCompute SQL do painel esquerdo e nomeie-os adequadamente.A tabela a seguir mostra os nomes de nós de exemplo e suas funções neste tutorial:
Tipo de nó
Nome do nó
Função
MaxCompute SQLdim_item_infoProcessa dados de produtos da tabela
ods_item_infopara criar a Tabela de Dimensãodim_item_info.
MaxCompute SQLdwd_trade_orderLimpa e transforma dados de transações da tabela
ods_trade_orderpara criar a Tabela Fatodwd_trade_order.
MaxCompute SQLdws_daily_category_salesAgrega os dados detalhados limpos e padronizados das tabelas
dwd_trade_orderedim_item_infopara produzir a tabela de resumo diário de vendas por categoria de produto,dws_daily_category_sales.
MaxCompute SQLads_top_selling_categoriesGera a tabela de ranking diário das categorias de produtos mais vendidas,
ads_top_selling_categories, com base na tabeladws_daily_category_sales. -
Arraste e solte para conectar os nós e configurar suas dependências upstream. O resultado final deve ficar assim:
NotaÉ possível definir dependências conectando nós manualmente ou habilitando a análise automática do código dentro de cada nó. Este tutorial utiliza o método de conexão manual. Para mais informações sobre análise automática, consulte Análise automática de dependências.
Configurar nós de processamento de dados
Etapa 3: Executar e depurar o fluxo de trabalho
Após configurar o Fluxo de Trabalho, execute-o para verificar sua configuração antes de implantá-lo no Ambiente de Produção.
No painel de navegação à esquerda do DataStudio, clique em
para ir à página do DataStudio e localize o fluxo de trabalho criado na seção Workspace Directories.-
Clique em Run na barra de ferramentas do nó. Na caixa de diálogo Enter running parameters, insira a data do dia anterior (por exemplo,
20250416).NotaOs nós do fluxo de trabalho usam parâmetros de agendamento para código dinâmico. Durante a depuração, é necessário atribuir um valor constante a esses parâmetros para teste.
Clique em OK para ir à página de execução de depuração.
-
Aguarde a conclusão da execução. O resultado esperado é o seguinte:

Etapa 4: Consultar e visualizar dados
Com os dados brutos processados e agregados na tabela ads_top_selling_categories, faça consultas para visualizar os resultados.
Clique no ícone
no canto superior esquerdo e clique em .Ao lado de My Files, clique em . Insira um File Name personalizado e clique em All Products.
-
No editor SQL Query, insira a seguinte instrução SQL.
SELECT * FROM ads_top_selling_categories WHERE pt=${bizdate}; No canto superior direito, selecione a fonte de dados MaxCompute e clique em OK.
Clique no botão Run na parte superior. Na página Cost Estimation, clique em Run.
-
Nos resultados da consulta, clique em
para visualizar o gráfico. É possível clicar no ícone
no canto superior direito do gráfico para personalizar seu estilo. Também é possível clicar em OK no canto superior direito do gráfico para salvá-lo como um cartão. Em seguida, visualize-o clicando em Card (
) no painel de navegação à esquerda.
Etapa 5: Configurar agendamento periódico
Para obter atualizações diárias, implante o Fluxo de Trabalho no Ambiente de Produção para execução periódica.
Os parâmetros de agendamento já foram configurados para o fluxo de trabalho e seus nós durante as etapas de sincronização e processamento de dados. Basta implantar o fluxo de trabalho no ambiente de produção. Para mais informações sobre configurações de agendamento, consulte Configurar agendamento de nó.
Clique no ícone
no canto superior esquerdo e clique em .No painel de navegação à esquerda do DataStudio, clique em
para ir à página do DataStudio. Alterne para o Workspace usado neste tutorial e localize o fluxo de trabalho criado na seção Workspace Directories.Clique em Deploy na barra de ferramentas do nó. No painel de implantação, clique em Start Deployment to Production. Aguarde a conclusão das etapas Build Package e Prod Online Check e clique em Deploy.
-
Quando o status Prod Online mudar para Complete, clique em Perform O&M para ir ao Operation Center.

Em , é possível visualizar a tarefa periódica do Fluxo de Trabalho (nomeada
dw_quickstartneste tutorial).-
Para visualizar as tarefas periódicas dos nós filhos dentro do Fluxo de Trabalho, clique com o botão direito na tarefa periódica do fluxo e selecione View Internal Tasks.

O resultado esperado é o seguinte:

Próximas etapas
Para detalhes sobre operações e parâmetros dos módulos abordados neste tutorial, consulte Data Integration, Data Studio (nova versão), Data Analysis e Configuração de agendamento de nó.
Além dos módulos abordados neste tutorial, o DataWorks também suporta outros módulos como Data Modeling, Data Quality, Data Security Guard e DataService Studio para fornecer monitoramento e O&M de dados de ponta a ponta.
Para mais tutoriais práticos e casos de uso, consulte Tutoriais para diferentes cenários de negócios.


