Todos os produtos
Search
Central de documentação

DataWorks:DataStudio (legacy)

Última atualização: Jun 27, 2026

O DataStudio é o módulo do DataWorks para desenvolvimento e agendamento de tarefas periódicas. Ele se integra ao Operation Center e oferece uma interface visual de desenvolvimento para mecanismos de computação como MaxCompute, Hologres e E-MapReduce, com desenvolvimento inteligente de código, fluxos de trabalho híbridos multimotor e publicação padronizada de tarefas. O DataStudio ajuda a construir data warehouses offline, data warehouses em tempo real e sistemas de consulta ad hoc.

Acesse o DataStudio

Faça login no console do DataWorks. Na região desejada, clique em Data Development and O&M > Data Development no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Development.

Nota

O DataStudio é compatível apenas com o Google Chrome 69 ou superior em PCs.

Visão geral

Recursos

A tabela a seguir descreve os principais recursos do DataStudio. Os termos-chave estão definidos no Apêndice: Conceitos.

image

Tipo

Descrição

Organização e gerenciamento de objetos

O DataStudio organiza e gerencia objetos das seguintes formas:

  • Organização de objetos: Gerenciamento em dois níveis com Solution > workflow. Os objetos são organizados por fluxo de trabalho em uma árvore de diretórios e em um painel visual. Crie objetos na árvore ou arraste e solte componentes no painel para construir fluxos de dados. As soluções agrupam fluxos de trabalho relacionados.

  • Gerenciamento de objetos: Crie e gerencie nós, tabelas, recursos e funções por meio de uma interface visual.

Criar um fluxo de trabalho. Modos de gerenciamento.

Nota

No DataStudio, aplicam-se os seguintes limites ao número de fluxos de trabalho e objetos que podem ser criados em um workspace:

  • Fluxos de trabalho: Limite máximo de 10.000 fluxos de trabalho.

  • Objetos (nós, arquivos, tabelas, recursos e funções): No DataWorks Enterprise Edition, o limite é de 200.000 objetos. Nas edições Professional, Standard ou Basic, o máximo é de 100.000 objetos.

Se a quantidade de fluxos de trabalho ou objetos no workspace atual atingir o limite superior, não será possível criar novos itens.

Desenvolvimento de tarefas

  • Capacidades abrangentes:

    • Compatibilidade com uma ampla variedade de nós de mecanismos de computação.

    • Disponibiliza nós de uso geral para lógicas complexas: gatilhos externos, verificações de arquivo, ramificações condicionais, loops e passagem de saída.

  • Operações simplificadas:

    • Editor visual de fluxos de trabalho para orquestração de tarefas multimotor via arrastar e soltar.

    • Editor SQL inteligente com sugestões automáticas, estruturas visuais de operadores e verificação de permissões.

Todos os tipos de nó disponíveis estão listados em Tipos de nó suportados.

Agendamento de tarefas

  • Métodos de acionamento: Suporte a gatilhos externos, baseados em eventos e baseados em dependências extraídas da linhagem de dados.

  • Tipos de dependência: Compatibilidade com dependências no mesmo ciclo e entre ciclos diferentes, abrangendo diversos tipos de tarefa e ciclos de agendamento.

  • Controle de execução: Configuração de políticas de reexecução, controle de agendamento downstream, datas de vigência e tipos de agendamento como dry run (ignora a execução sem bloquear o downstream) ou freeze (ignora a execução e bloqueia o downstream).

  • Idempotência: Permite definir condições personalizadas de reexecução e contagem de tentativas.

Configurar propriedades de tempo. Guia para configuração de dependências de agendamento.

Depuração de tarefas

O DataStudio permite depurar tarefas individuais e fluxos de trabalho inteiros. Processo de depuração de tarefas.

Controle de processo

Oferece publicação padronizada de tarefas e controle de processo:

Outros recursos

  • Extensibilidade: Integração com a Open Platform para operações OpenAPI, pontos de extensão integrados e assinaturas de eventos.

  • Controle de permissões: Gerenciamento de permissões de acesso a recursos da UI e a dados. Gerenciar permissões em serviços no nível de workspace.

  • Visualização de registros de operação: Integração com o ActionTrail da Alibaba Cloud para consulta e pesquisa de logs de operação.

Visão geral da UI

Consulte o guia de recursos do DataStudio para conhecer a interface de desenvolvimento de dados e aprender a usar os recursos de cada módulo.

Processo de desenvolvimento

O DataStudio suporta tarefas de sincronização em tempo real, tarefas agendadas offline (incluindo sincronização e processamento) e tarefas acionadas manualmente para diversos mecanismos de computação. Para detalhes sobre as capacidades de sincronização de dados, consulte Data Integration. Antes de começar, compreenda os requisitos de desenvolvimento de cada mecanismo de computação e escolha o tipo de tarefa apropriado.

  • Guias de desenvolvimento por mecanismo de computação: O DataWorks oferece suporte a várias fontes de dados e mecanismos de computação. Os requisitos de configuração variam conforme o mecanismo. Principais guias:

  • Processo geral de desenvolvimento: Os workspaces do DataWorks operam nos modos padrão e básico. O fluxo de desenvolvimento difere ligeiramente entre esses modos.

    Processo de desenvolvimento em um workspace no modo padrão.Development process in standard mode

    Processo de desenvolvimento em um workspace no modo básico.Development process in basic mode

    • Processo básico: No modo padrão, o ciclo de vida da tarefa agendada inclui desenvolvimento, depuração, configuração de agendamento, confirmação, publicação e O&M. Guia do processo de desenvolvimento de dados.

    • Controle de processo: Utilize a revisão de código e os testes de fumaça integrados, as verificações predefinidas no Data Governance Center e a validação personalizada via extensões da Open Platform para garantir a conformidade com os padrões.

      Nota

      As opções de controle de processo variam conforme o modo do workspace. Os recursos disponíveis no console são definitivos.

Organização

No DataStudio, o fluxo de trabalho é a unidade básica para desenvolvimento de código e organização de recursos. Fluxos de trabalho e nós de tarefa são desenvolvidos independentemente em cada workspace, sem interferência mútua. Criar um fluxo de trabalho.

Os fluxos de trabalho são apresentados como uma árvore de diretórios e um painel de operações, facilitando a organização do código sob uma perspectiva de negócios.

  • Estrutura de árvore de diretórios: Oferece uma forma de organizar o código com base nos tipos de tarefa.

  • Painel de fluxo de trabalho: Proporciona uma exibição orientada a processos da lógica de negócios.

Development organization structure

Primeiros passos

Pré-requisitos

Para desenvolver tarefas, modelar dados ou agendar tarefas periódicas no DataWorks, associe suas fontes de dados ou clusters como recursos de computação no DataStudio. Sem essa associação, não é possível criar nós de desenvolvimento de dados.

  1. Crie as fontes de dados ou clusters necessários para os tipos de tarefa planejados.

    Fonte de dados ou cluster

    Descrição

    Associar um recurso de computação do MaxCompute

    O DataWorks associa automaticamente a primeira fonte de dados do MaxCompute. Associe manualmente as subsequentes.

    Associar um recurso de computação do Hologres

    Associe manualmente estas fontes de dados após a criação.

    Associar um recurso de computação do AnalyticDB for PostgreSQL

    Associar um recurso de computação do AnalyticDB for MySQL 3.0

    Associar um recurso de computação do ClickHouse

    Registrar um cluster do E-MapReduce no DataWorks

    O DataWorks associa automaticamente os clusters registrados. Nenhuma associação manual é necessária.

    Registrar um cluster CDH ou CDP no DataWorks

  2. Faça login no console do DataWorks. Na região desejada, clique em Data Development and O&M > Data Development no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Development.

  3. No painel de navegação à esquerda, clique em Computing Resources.

    Se o módulo Computing Resource não estiver visível no painel de navegação à esquerda, adicione-o nas Configurações Pessoais . Gerenciamento de Módulos .
  4. Associe um recurso de computação.

    Na página Computing Resource, pesquise a fonte de dados ou cluster desejado pelo Computing Resource Name ou Computing Resource Type e clique em Associate. Após a associação, a fonte de dados estará pronta para desenvolvimento.

    Nota

    Se houver alterações nas informações da fonte de dados, atualize a página para visualizar as mudanças.

    image

    • Em alguns casos, a associação de uma fonte de dados ou cluster ao DataStudio pode falhar:

      • A associação depende da configuração. Por exemplo, fontes de dados que utilizam um par AccessKey não podem ser associadas. Verifique as limitações na página de associação.

      • A fonte de dados não possui ambiente de desenvolvimento ou produção configurado.

      • Um recurso de computação do MaxCompute não pode ser associado a múltiplos workspaces do DataWorks simultaneamente.

      Nota

      A plataforma exibe o motivo de qualquer falha de associação.

    • Apenas MaxCompute, E-MapReduce, Hologres, AnalyticDB for MySQL, ClickHouse, CDH/CDP e AnalyticDB for PostgreSQL podem ser associados ao DataStudio.

    • Os tipos de fontes de dados associáveis e seus limites variam conforme a edição do DataWorks. Recursos das diferentes edições do DataWorks.

Tutorial

O guia Primeiros passos com o desenvolvimento de dados aborda as operações básicas e o processo de desenvolvimento.

Tipos de nó suportados

O DataStudio oferece diversos tipos de nó, muitos dos quais suportam agendamento periódico. Escolha os nós de acordo com suas necessidades de negócios. Tipos de nó suportados.

Apêndice: Conceitos

  • Desenvolvimento de tarefas

    Termo

    Descrição

    Solution

    Conjunto de fluxos de trabalho gerenciados coletivamente. Fluxos de trabalho podem ser reutilizados em múltiplas Solutions para colaboração.

    Workflow

    Agrupamento de tarefas, tabelas, recursos e funções para atender a uma necessidade de negócio. As tarefas são executadas conforme agendamento.

    Manually triggered workflow

    Coleção de tarefas, tabelas, recursos e funções para uma necessidade específica.

    Diferente dos fluxos regulares, as tarefas aqui devem ser acionadas manualmente, sem execução agendada.

    DAG

    Sigla para directed acyclic graph (grafo acíclico direcionado). Exibe os nós e suas dependências. No DataStudio, todas as tarefas de um fluxo compartilham um único DAG.

    Task

    Unidade básica de execução no DataWorks. As tarefas rodam sequencialmente respeitando as dependências.

    Node

    Representação de uma tarefa dentro de um DAG. Os nós executam em sequência baseada nas dependências.

  • Agendamento de tarefas

    Termo

    Descrição

    Dependency

    Define a ordem de execução entre tarefas. Se a tarefa B roda apenas após a conclusão da tarefa A, então A é uma dependência upstream de B. Representado por setas no DAG.

    Output name

    Identificador globalmente único para um nó. Um nó pode ter múltiplos nomes de saída. O DataWorks utiliza esses nomes para definir dependências de agendamento.

    Output table name

    Nome da tabela de saída da tarefa, auxiliando tarefas downstream a confirmar a fonte de dados correta. Não modifique nomes de tabela de saída gerados automaticamente. Este identificador não altera o nome real da tabela, definido pela lógica SQL.

    Nota

    O Output Name de um nó deve ser globalmente único, enquanto o Output Table Name não possui essa restrição.

    Scheduling resource group

    Grupo de recursos utilizado para o agendamento de tarefas. Visão geral dos grupos de recursos do DataWorks.

    Scheduling parameter

    Variáveis no código que obtêm dinamicamente valores de tempo de execução, como data e hora. Defina parâmetros de agendamento no DataWorks para atribuir valores às variáveis do código durante a execução.

    Business date

    Data em que uma transação de negócios ocorreu. Em computação offline, geralmente corresponde ao dia anterior à execução da tarefa. Por padrão, o DataWorks define este valor como o dia anterior à execução, com precisão diária. Por exemplo, ao gerar estatísticas de vendas de ontem, a data de negócios é ontem.

    Scheduling time

    Horário previsto para a execução da tarefa, com precisão de segundos. O horário real de início pode variar devido a diversos fatores.