O DataStudio é o módulo do DataWorks para desenvolvimento e agendamento de tarefas periódicas. Ele se integra ao Operation Center e oferece uma interface visual de desenvolvimento para mecanismos de computação como MaxCompute, Hologres e E-MapReduce, com desenvolvimento inteligente de código, fluxos de trabalho híbridos multimotor e publicação padronizada de tarefas. O DataStudio ajuda a construir data warehouses offline, data warehouses em tempo real e sistemas de consulta ad hoc.
Acesse o DataStudio
Faça login no console do DataWorks. Na região desejada, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Development.
O DataStudio é compatível apenas com o Google Chrome 69 ou superior em PCs.
Visão geral
Recursos
A tabela a seguir descreve os principais recursos do DataStudio. Os termos-chave estão definidos no Apêndice: Conceitos.
|
Tipo |
Descrição |
|
Organização e gerenciamento de objetos |
O DataStudio organiza e gerencia objetos das seguintes formas:
Criar um fluxo de trabalho. Modos de gerenciamento. Nota
No DataStudio, aplicam-se os seguintes limites ao número de fluxos de trabalho e objetos que podem ser criados em um workspace:
Se a quantidade de fluxos de trabalho ou objetos no workspace atual atingir o limite superior, não será possível criar novos itens. |
|
Desenvolvimento de tarefas |
Todos os tipos de nó disponíveis estão listados em Tipos de nó suportados. |
|
Agendamento de tarefas |
Configurar propriedades de tempo. Guia para configuração de dependências de agendamento. |
|
Depuração de tarefas |
O DataStudio permite depurar tarefas individuais e fluxos de trabalho inteiros. Processo de depuração de tarefas. |
|
Controle de processo |
Oferece publicação padronizada de tarefas e controle de processo:
|
|
Outros recursos |
|
Visão geral da UI
Consulte o guia de recursos do DataStudio para conhecer a interface de desenvolvimento de dados e aprender a usar os recursos de cada módulo.
Processo de desenvolvimento
O DataStudio suporta tarefas de sincronização em tempo real, tarefas agendadas offline (incluindo sincronização e processamento) e tarefas acionadas manualmente para diversos mecanismos de computação. Para detalhes sobre as capacidades de sincronização de dados, consulte Data Integration. Antes de começar, compreenda os requisitos de desenvolvimento de cada mecanismo de computação e escolha o tipo de tarefa apropriado.
-
Guias de desenvolvimento por mecanismo de computação: O DataWorks oferece suporte a várias fontes de dados e mecanismos de computação. Os requisitos de configuração variam conforme o mecanismo. Principais guias:
-
Processo geral de desenvolvimento: Os workspaces do DataWorks operam nos modos padrão e básico. O fluxo de desenvolvimento difere ligeiramente entre esses modos.
Processo de desenvolvimento em um workspace no modo padrão.

Processo de desenvolvimento em um workspace no modo básico.

Processo básico: No modo padrão, o ciclo de vida da tarefa agendada inclui desenvolvimento, depuração, configuração de agendamento, confirmação, publicação e O&M. Guia do processo de desenvolvimento de dados.
-
Controle de processo: Utilize a revisão de código e os testes de fumaça integrados, as verificações predefinidas no Data Governance Center e a validação personalizada via extensões da Open Platform para garantir a conformidade com os padrões.
NotaAs opções de controle de processo variam conforme o modo do workspace. Os recursos disponíveis no console são definitivos.
Organização
No DataStudio, o fluxo de trabalho é a unidade básica para desenvolvimento de código e organização de recursos. Fluxos de trabalho e nós de tarefa são desenvolvidos independentemente em cada workspace, sem interferência mútua. Criar um fluxo de trabalho.
Os fluxos de trabalho são apresentados como uma árvore de diretórios e um painel de operações, facilitando a organização do código sob uma perspectiva de negócios.
Estrutura de árvore de diretórios: Oferece uma forma de organizar o código com base nos tipos de tarefa.
Painel de fluxo de trabalho: Proporciona uma exibição orientada a processos da lógica de negócios.

Primeiros passos
Pré-requisitos
Para desenvolver tarefas, modelar dados ou agendar tarefas periódicas no DataWorks, associe suas fontes de dados ou clusters como recursos de computação no DataStudio. Sem essa associação, não é possível criar nós de desenvolvimento de dados.
-
Crie as fontes de dados ou clusters necessários para os tipos de tarefa planejados.
Fonte de dados ou cluster
Descrição
O DataWorks associa automaticamente a primeira fonte de dados do MaxCompute. Associe manualmente as subsequentes.
Associe manualmente estas fontes de dados após a criação.
Associar um recurso de computação do AnalyticDB for PostgreSQL
Associar um recurso de computação do AnalyticDB for MySQL 3.0
O DataWorks associa automaticamente os clusters registrados. Nenhuma associação manual é necessária.
-
Faça login no console do DataWorks. Na região desejada, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Development.
-
No painel de navegação à esquerda, clique em Computing Resources.
Se o módulo Computing Resource não estiver visível no painel de navegação à esquerda, adicione-o nas Configurações Pessoais . Gerenciamento de Módulos .
-
Associe um recurso de computação.
Na página Computing Resource, pesquise a fonte de dados ou cluster desejado pelo Computing Resource Name ou Computing Resource Type e clique em Associate. Após a associação, a fonte de dados estará pronta para desenvolvimento.
NotaSe houver alterações nas informações da fonte de dados, atualize a página para visualizar as mudanças.

-
Em alguns casos, a associação de uma fonte de dados ou cluster ao DataStudio pode falhar:
A associação depende da configuração. Por exemplo, fontes de dados que utilizam um par AccessKey não podem ser associadas. Verifique as limitações na página de associação.
A fonte de dados não possui ambiente de desenvolvimento ou produção configurado.
Um recurso de computação do MaxCompute não pode ser associado a múltiplos workspaces do DataWorks simultaneamente.
NotaA plataforma exibe o motivo de qualquer falha de associação.
Apenas MaxCompute, E-MapReduce, Hologres, AnalyticDB for MySQL, ClickHouse, CDH/CDP e AnalyticDB for PostgreSQL podem ser associados ao DataStudio.
Os tipos de fontes de dados associáveis e seus limites variam conforme a edição do DataWorks. Recursos das diferentes edições do DataWorks.
-
Tutorial
O guia Primeiros passos com o desenvolvimento de dados aborda as operações básicas e o processo de desenvolvimento.
Tipos de nó suportados
O DataStudio oferece diversos tipos de nó, muitos dos quais suportam agendamento periódico. Escolha os nós de acordo com suas necessidades de negócios. Tipos de nó suportados.
Apêndice: Conceitos
-
Desenvolvimento de tarefas
Termo
Descrição
Solution
Conjunto de fluxos de trabalho gerenciados coletivamente. Fluxos de trabalho podem ser reutilizados em múltiplas Solutions para colaboração.
Workflow
Agrupamento de tarefas, tabelas, recursos e funções para atender a uma necessidade de negócio. As tarefas são executadas conforme agendamento.
Manually triggered workflow
Coleção de tarefas, tabelas, recursos e funções para uma necessidade específica.
Diferente dos fluxos regulares, as tarefas aqui devem ser acionadas manualmente, sem execução agendada.
DAG
Sigla para
directed acyclic graph(grafo acíclico direcionado). Exibe os nós e suas dependências. No DataStudio, todas as tarefas de um fluxo compartilham um único DAG.Task
Unidade básica de execução no DataWorks. As tarefas rodam sequencialmente respeitando as dependências.
Node
Representação de uma tarefa dentro de um DAG. Os nós executam em sequência baseada nas dependências.
-
Agendamento de tarefas
Termo
Descrição
Dependency
Define a ordem de execução entre tarefas. Se a tarefa B roda apenas após a conclusão da tarefa A, então A é uma dependência upstream de B. Representado por setas no DAG.
Output name
Identificador globalmente único para um nó. Um nó pode ter múltiplos nomes de saída. O DataWorks utiliza esses nomes para definir dependências de agendamento.
Output table name
Nome da tabela de saída da tarefa, auxiliando tarefas downstream a confirmar a fonte de dados correta. Não modifique nomes de tabela de saída gerados automaticamente. Este identificador não altera o nome real da tabela, definido pela lógica SQL.
NotaO Output Name de um nó deve ser globalmente único, enquanto o Output Table Name não possui essa restrição.
Scheduling resource group
Grupo de recursos utilizado para o agendamento de tarefas. Visão geral dos grupos de recursos do DataWorks.
Scheduling parameter
Variáveis no código que obtêm dinamicamente valores de tempo de execução, como data e hora. Defina parâmetros de agendamento no DataWorks para atribuir valores às variáveis do código durante a execução.
Business date
Data em que uma transação de negócios ocorreu. Em computação offline, geralmente corresponde ao dia anterior à execução da tarefa. Por padrão, o DataWorks define este valor como o dia anterior à execução, com precisão diária. Por exemplo, ao gerar estatísticas de vendas de ontem, a data de negócios é ontem.
Scheduling time
Horário previsto para a execução da tarefa, com precisão de segundos. O horário real de início pode variar devido a diversos fatores.