Todos os produtos
Search
Central de documentação

DataWorks:Data Studio (nova versão)

Última atualização: Aug 13, 2026

Plataforma inteligente de desenvolvimento para data lakehouse que se integra a diversos serviços de computação da Alibaba Cloud para oferecer ETL, gerenciamento de catálogo de dados e orquestração de fluxos de trabalho entre motores. O Data Studio oferece suporte a desenvolvimento em Python, análises com Notebook, integração com Git e um ecossistema de plugins que unifica processamento em tempo real e offline, arquitetura de lakehouse e big data com IA, permitindo gerenciar todo o ciclo de vida de Dados+IA.

O que é o Data Studio?

O Data Studio integra-se a dezenas de serviços de computação de big data e IA da Alibaba Cloud — incluindo MaxCompute, E-MapReduce, Hologres, Flink e PAI — para proporcionar desenvolvimento inteligente de ETL em data warehouses, data lakes e arquiteturas de lakehouse OpenLake. As principais capacidades incluem:

  • Catálogo de dados: Gerenciamento de metadados projetado para ambientes de lakehouse.

  • Fluxo de trabalho: Orquestra nós de processamento de dados em tempo real e offline, além de nós de IA, em dezenas de tipos de motor.

  • Ambiente de desenvolvimento pessoal: Desenvolvimento e depuração de nós Python, análises interativas com Notebook e gerenciamento de código baseado em Git integrado ao armazenamento NAS/OSS.

  • Notebook: Ferramenta interativa para desenvolvimento e análise de dados. Execute ou depure código SQL ou Python em vários motores de dados e visualize os resultados instantaneamente.

Ativar o novo Data Studio

Para ativar o novo Data Studio:

  • Ao criar um workspace, selecione Use Data Studio (New Version). Para mais detalhes, consulte Create a workspace.

  • No DataStudio legado, clique no botão DataStudio na parte superior da página. Em seguida, clique em Upgrade to New Version e siga as instruções para migrar seus dados para o novo Data Studio.

  • O novo Data Studio está disponível nas seguintes regiões: China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), Thailand (Bangkok), Germany (Frankfurt), UK (London), US (Silicon Valley), US (Virginia).

Importante
  • Caso enfrente problemas ao usar o novo Data Studio, participe do Grupo de suporte dedicado no DingTalk para atualização para o novo Data Studio.

  • Os dados no novo Data Studio e no DataStudio legado são completamente separados e não podem ser compartilhados.

  • A atualização do DataStudio legado para a nova versão é irreversível. Após uma atualização bem-sucedida, não é possível reverter para a versão anterior. Antes de fazer a transição, crie um workspace de teste com o novo Data Studio ativado para verificar se ele atende às suas necessidades de negócios.

  • A partir de 19 de fevereiro de 2025, quando uma conta raiz criar um workspace do DataWorks pela primeira vez em uma região compatível, o novo Data Studio será ativado por padrão. O DataStudio legado deixará de estar disponível.

Acessar o Data Studio

Acesse a página Workspaces no console do DataWorks. Na barra de navegação superior, selecione a região desejada. Localize o workspace de interesse e escolha Shortcuts > Data Studio na coluna Actions.

Nota
  • Esta entrada fica visível apenas para workspaces onde a opção Use Data Studio (New Version) está ativada. Para mais detalhes, consulte Enable the new Data Studio.

  • O Data Studio funciona somente no navegador Chrome versão 69 ou posterior em desktop.

Principais recursos do Data Studio

O Data Studio oferece os seguintes recursos principais. Para mais informações, consulte Appendix: Concepts Related to Data Development.

image

Tipo

Descrição

Gerenciamento de fluxo

O DataWorks fornece um modelo de desenvolvimento baseado em Workflow. Os fluxos de trabalho utilizam uma interface visual baseada em DAG para simplificar o gerenciamento de pipelines complexos de tarefas sob uma perspectiva de negócios.

Para mais informações, consulte Recurring workflow orchestration, Event-triggered workflows e Manually triggered workflows.

Nota

No Data Studio, cada workspace possui os seguintes limites para nós internos de fluxo de trabalho e objetos:

  • Nós internos: Cada fluxo de trabalho suporta até 400 nós.

  • Objetos (fluxos de trabalho, nós, arquivos, tabelas, recursos e funções): Usuários com DataWorks Enterprise Edition podem criar até 200.000 objetos. Usuários com DataWorks Professional, Standard ou Basic Edition podem criar até 100.000 objetos.

Se o seu workspace atingir esses limites, não será possível criar novos fluxos de trabalho ou objetos.

Desenvolvimento de tarefas

  • Capacidades ampliadas:

    • Nós de motores diversificados com funcionalidade totalmente encapsulada do motor.

    • Nós de uso geral para lógica complexa quando combinados com nós de motor — por exemplo, gatilhos de sistemas externos, verificações de objetos de arquivo, ramificações condicionais, execução em loop e passagem de resultados.

    • Suporte a tarefas de processamento de fluxo Flink usando Realtime Compute for Apache Flink, permitindo desenvolvimento colaborativo entre Flink e motores como MaxCompute e Hologres.

  • Operações simplificadas:

    • Construtor visual de fluxos de trabalho — arraste e solte componentes para orquestrar rapidamente tarefas multimotor.

    • Editor SQL inteligente com sugestões de código, exibição visual da estrutura de operadores e verificação de permissões.

Para tipos de nós compatíveis, consulte Node development.

Agendamento de tarefas

  • Métodos de acionamento: Suporta gatilhos de sistemas externos, gatilhos de eventos e agendamento acionado por upstream via análise automática de linhagem.

  • Tipos de dependência: Suporta dependências no mesmo ciclo e entre ciclos, além de dependências mútuas em diferentes ciclos de agendamento e tipos de tarefa.

  • Controle de execução: Permite configurar se uma tarefa pode ser reexecutada, controlar o momento do agendamento downstream com base nas tarefas upstream, definir datas de vigência para tarefas agendadas e estabelecer comportamentos de agendamento — por exemplo, dry-run (pula a execução sem bloquear tarefas downstream) ou freeze (pula a execução e bloqueia tarefas downstream).

  • Garantia de idempotência: Oferece um mecanismo de reexecução com condições personalizáveis e número configurável de tentativas.

Para mais detalhes sobre agendamento, consulte Node scheduling configuration.

Controle de qualidade

Publicação padronizada de tarefas com múltiplos mecanismos de controle de qualidade:

  • Revisão de código: Exige code review manual antes da publicação para impedir agendamentos problemáticos em produção.

  • Verificações de validação: Integra governance item checks de governança de dados e lógica de validação personalizada de extensões para automatizar e personalizar controles de envio e publicação.

  • Data Quality: Vincula quality monitoring a nós de agendamento, acionando a validação de regras após a conclusão da tarefa para ajudar a detectar problemas de dados imediatamente.

Outros

  • Capacidades abertas: OpenAPI abrangente por meio da Open Platform, com pontos de extensão integrados para assinar eventos de desenvolvimento do DataWorks.

  • Controle de acesso: Gerencia permissões de recursos da UI e permissões de acesso a dados. Consulte Workspace-level module permission control.

Interface do Data Studio

Consulte Data Studio feature guide para conhecer o layout da interface e como utilizar cada módulo.

Fluxo de trabalho de desenvolvimento de tarefas

O DataWorks oferece suporte a tarefas de sincronização em tempo real, tarefas agendadas offline (incluindo sincronização offline e jobs de transformação) e tarefas acionadas manualmente. Para capacidades de sincronização de dados, consulte o módulo Data Integration.

Os workspaces do DataWorks operam em standard mode or basic mode. Os fluxos de trabalho de desenvolvimento de tarefas diferem entre os modos conforme mostrado abaixo.

Fluxo de trabalho de desenvolvimento em workspace no modo Standard

image

Fluxo de trabalho no modo Basic

image
  • Fluxo básico: No modo standard, o desenvolvimento de tarefas agendadas inclui etapas como desenvolvimento, depuração, configuração de agendamento, publicação e O&M. Para o processo geral de desenvolvimento, consulte Overview of the new Data Studio.

  • Controle de fluxo: Durante o desenvolvimento, combine code review integrado, verificações predefinidas de data governance e lógica de validação personalizada de extensões da Open Platform para garantir que as tarefas estejam em conformidade com os padrões.

Abordagens de desenvolvimento de dados

O Data Studio permite personalizar seu processo de desenvolvimento. Construa pipelines de dados usando fluxos de trabalho ou crie manualmente nós de tarefa e configure dependências.

Para mais detalhes, consulte Workflows.

Tipos de nós compatíveis no Data Studio

O Data Studio oferece suporte a dezenas de tipos de nós — incluindo integração de dados, MaxCompute, Hologres, EMR, Flink, Python, Notebook e ADB — muitos dos quais permitem agendamento recorrente. Escolha o tipo de nó adequado com base nas suas necessidades de negócios. Para a lista completa, consulte Supported node types.

Apêndice: Conceitos-chave no desenvolvimento de dados

Desenvolvimento de tarefas

Conceito

Descrição

Fluxo de trabalho

Abordagem de desenvolvimento visual baseada em DAG que simplifica pipelines complexos de tarefas sob uma perspectiva de negócios. Os fluxos de trabalho permitem orquestrar dezenas de tipos de nós — incluindo integração de dados, MaxCompute, Hologres, EMR, Flink, Python, Notebook e ADB — e oferecem agendamento no nível do fluxo. Oferecem suporte tanto a fluxos recorrentes quanto acionados por eventos.

Fluxo de trabalho acionado manualmente

Conjunto de tarefas, tabelas, recursos e funções para uma necessidade específica de negócios.

Diferentemente dos fluxos recorrentes, as tarefas em fluxos acionados manualmente devem ser iniciadas manualmente, e não por agendamento.

Nó de tarefa

Unidade básica de execução no DataWorks. O Data Studio fornece múltiplos tipos de nó: nós de integração de dados para sincronização, nós de computação de motor para limpeza de dados (como ODPS SQL, Hologres SQL, EMR Hive) e nós de uso geral para lógica complexa (como nós zero load para gerenciar múltiplos nós ou nós do-while para loops). A combinação desses nós atende a diversas necessidades de processamento de dados.

Agendamento de tarefas

Conceito

Descrição

Dependência

As dependências definem a ordem de execução entre tarefas. Se o nó B executa somente após a conclusão do nó A, então A é a dependência upstream de B (ou B depende de A). Em um DAG, as dependências aparecem como setas entre os nós.

Nome de saída

Nome do ponto de saída de uma tarefa. Dentro de um único tenant (conta Alibaba Cloud), essa entidade virtual conecta tarefas upstream e downstream quando você define dependências.

Ao configurar dependências entre tarefas, utilize o nome de saída — não o nome ou ID do nó. Uma vez configurado, esse nome de saída torna-se o nome de entrada para o nó downstream.

Nome da tabela de saída

Defina o nome da tabela de saída para corresponder à tabela de saída real da tarefa atual. Isso ajuda as tarefas downstream a confirmar que estão usando os dados upstream esperados. Não altere manualmente os nomes de tabela de saída gerados automaticamente — eles servem apenas como identificadores e não afetam a tabela real produzida pelo seu script SQL, que é determinada pela própria lógica SQL.

Nota

O Output Name de um nó deve ser globalmente único, mas o Output table name não possui essa restrição.

Grupo de recursos de agendamento

O resource group utilizado para o agendamento de tarefas.

Parâmetros de agendamento

Scheduling parameters são variáveis no seu código que recebem valores dinâmicos em tempo de execução. Para acessar informações contextuais como data ou hora durante execuções repetidas, defina variáveis usando a sintaxe de parâmetros de agendamento do DataWorks.

Data dos dados

Data associada a uma atividade de negócios, indicando quando os dados de negócios correspondentes foram gerados. Esse conceito é especialmente importante em cenários de computação offline. Por exemplo, no varejo, o volume de vendas de 20241010 costuma ser calculado na madrugada de 20241011. O resultado representa o volume real de vendas de 20241010. Nesse caso, 20241010 é a data dos dados.

Hora agendada

Horário exato, com precisão de minutos, definido para a execução de uma tarefa recorrente.

Importante

Alcançar a hora agendada não garante execução imediata. O DataWorks verifica se as tarefas upstream foram concluídas com sucesso, se a hora agendada já passou e se há recursos de agendamento suficientes disponíveis. Somente quando todas as condições são atendidas a tarefa é acionada.