Todos os produtos
Search
Central de documentação

DataWorks:Visão geral do Data Studio

Última atualização: Jul 03, 2026

O Data Studio é uma plataforma inteligente de desenvolvimento para data lakehouse, integrada aos serviços de computação da Alibaba Cloud para ETL, gerenciamento de catálogo de dados e orquestração de fluxos de trabalho entre motores. Com ambientes de desenvolvimento pessoais, análise via Notebook, suporte a Python, integração com git e um rico ecossistema de plugins, a solução unifica o processamento em tempo real e offline com IA em todo o ciclo de vida de Dados+IA.

Data Studio

O Data Studio é uma plataforma inteligente de desenvolvimento para data lakehouse, criada com base nas melhores práticas de big data da Alibaba. Ela se integra aos serviços de big data e IA da Alibaba Cloud, como MaxCompute, E-MapReduce, Hologres, Flink e PAI, oferecendo desenvolvimento inteligente de ETL para data warehouses, data lakes e arquiteturas OpenLake. Os principais recursos incluem:

  • Suporte a data lakehouse e múltiplos motores: Acesse dados em data lakes (como OSS) e data warehouses (como MaxCompute) de forma contínua, por meio de um catálogo de dados unificado e um conjunto diversificado de nós de motor, permitindo o desenvolvimento híbrido com vários motores.

  • Fluxos de trabalho flexíveis e agendamento: Utilize diversos nós de controle de fluxo para orquestrar visualmente tarefas entre motores em um fluxo de trabalho. A plataforma suporta tanto agendamento periódico baseado em tempo quanto agendamento baseado em gatilhos orientado a eventos.

  • Ambiente aberto de desenvolvimento Dados+IA: Construa uma estação de trabalho flexível para pesquisa e desenvolvimento de IA com um ambiente de desenvolvimento pessoal que permite dependências personalizadas, um Notebook com suporte a codificação mista em SQL e Python, além de recursos como gerenciamento de datasets e integração com git.

  • Assistência inteligente e engenharia de IA: O poderoso Copilot integrado auxilia você durante todo o processo de desenvolvimento de código. Nós de algoritmo do PAI profissionais e nós de modelos grandes fornecem suporte nativo para engenharia de IA de ponta a ponta.

Conceitos principais

Conceito

Definição

Valor principal

Palavras-chave

Fluxo de trabalho

Unidade para organização e orquestração de tarefas

Permite o gerenciamento de dependências e o agendamento automatizado de tarefas complexas. Serve como contêiner para desenvolvimento e agendamento.

Visual, DAG, periódico/baseado em gatilho, orquestração

Menor unidade de execução em um fluxo de trabalho

Local onde você escreve código e implementa lógicas de negócio específicas. Representa a operação atômica para processamento de dados.

SQL, Python, Shell, Integração de Dados

Imagem personalizada

Snapshot padronizado de um ambiente

Garante extensibilidade, consistência e reprodutibilidade do ambiente.

Congelamento de ambiente, padronização, replicação, consistência

Agendamento

Regras para acionamento automático de tarefas

Automatiza a produção de dados ao converter tarefas manuais em cargas de trabalho automatizadas e prontas para produção.

Agendamento periódico, agendamento baseado em gatilho, dependência, automação

Catálogo de Dados

Workbench unificada de metadados

Organiza e gerencia ativos de dados (como tabelas) e recursos de computação (como funções e recursos) de maneira estruturada.

Metadados, gerenciamento de tabelas, perfil de dados

Dataset

Mapeamento lógico para armazenamento externo

Conecta dados não estruturados externos (imagens, documentos) ao ambiente de desenvolvimento, servindo como ponte essencial de dados para o desenvolvimento de IA.

Integração OSS/NAS, montagem de dados, dados não estruturados

Notebook

Canvas interativo de desenvolvimento Dados+IA

Combina códigos SQL e Python para acelerar a exploração de dados e a validação de algoritmos.

Interativo, multilíngue, visual, análise exploratória

Guia de processos do Data Studio

O Data Studio suporta tanto o desenvolvimento de data warehouse quanto o desenvolvimento de IA. A seção a seguir descreve dois caminhos comuns. Adapte-os conforme suas necessidades.

Caminho comum: Processo de desenvolvimento de data warehouse (tarefas periódicas de ETL)

Este processo é ideal para construir data warehouses de nível empresarial com processamento de dados em lote estável e automatizado.

  • Público-alvo: Engenheiros de dados e desenvolvedores de ETL.

  • Objetivo principal: Criar um data warehouse empresarial estável, padronizado e com agendamento automático para processamento de dados em lote e geração de relatórios.

  • Tecnologias-chave: Catálogo de Dados, fluxos de trabalho agendados, nós SQL e configurações de agendamento.

image

Etapa

Fase

Operações e objetivos principais

Caminho principal e referências

1

Associar um motor de computação

Associe um ou mais motores de computação principais (como o MaxCompute) ao workspace para servir como ambiente de execução de todas as tarefas SQL.

image

Console > Workspace Settings

Para mais informações, consulte Associar motores de computação.

2

Gerenciamento do Catálogo de Dados

Crie ou explore as estruturas de tabela necessárias para cada camada do data warehouse (ODS, DWD, ADS, etc.) no Catálogo de Dados para definir as entradas e saídas do processamento de dados.

Recomendamos o uso do módulo Modelagem de Dados para construir o sistema de data warehouse.

Data Studio > Data Catalog

Para mais informações, consulte Catálogo de Dados.

3

Criar um fluxo de trabalho agendado

Crie um fluxo de trabalho agendado no diretório do projeto para atuar como contêiner na organização e gestão das tarefas de ETL relacionadas.

Data Studio > Project Directory > Scheduled Workflow

Para mais informações, consulte Fluxos de trabalho agendados.

4

Desenvolvimento e depuração de nós

Crie nós ODPS SQL ou outros tipos de nó, escreva a lógica central de ETL (limpeza, transformação e agregação de dados) no editor e depure os nós.

  • Data Studio > Node Development > Node Editor

  • Data Studio > Node Development > Run Configuration

Para mais informações, consulte Desenvolvimento de nós.

5

Desenvolvimento assistido pelo Copilot

Utilize os recursos do DataWorks Copilot para gerar, corrigir, reescrever e converter códigos SQL e Python.

  • Data Studio > Node Development > Copilot

  • Data Studio > Copilot > Agent

    Para mais informações, consulte Copilot.

6

Orquestração e agendamento de nós

No canvas DAG do fluxo de trabalho, defina as dependências upstream e downstream entre os nós arrastando-os e conectando-os. Vários nós de controle de fluxo estão disponíveis para orquestrações complexas.

Configure as definições de agendamento para o ambiente de produção no nível do fluxo de trabalho ou do nó, incluindo cronograma, horário e dependências. A plataforma suporta agendamento em ultra larga escala, com dezenas de milhões de instâncias por dia.

  • Data Studio > Workflow > Workflow Canvas

  • Data Studio > Node Development > Schedule Settings

Para mais informações, consulte Nós gerais de controle de fluxo e Configurações de agendamento.

7

Implantação e O&M de fluxo de trabalho/nó

  • Implantação: Implante os nós ou fluxos de trabalho depurados no ambiente de produção por meio do processo de implantação.

  • O&M: Monitore, configure alertas, faça backfill de dados e realize validação periódica das tarefas de produção no Operation Center. Use linhas de base inteligentes para garantir a conclusão pontual das tarefas e utilize alertas de monitoramento para tratar exceções rapidamente.

Nota

Para um tutorial relacionado de introdução, consulte Tutorial de introdução.

Caminho avançado: Processo de desenvolvimento de IA com big data

Indicado para desenvolvimento de modelos de IA, exploração de ciência de dados e aplicações de IA em tempo real, com ênfase na flexibilidade e interatividade do ambiente.

  • Público-alvo: Engenheiros de IA, cientistas de dados e engenheiros de algoritmos.

  • Objetivo principal: Realizar exploração de dados, treinamento de modelos e validação de algoritmos, ou construir aplicações de IA em tempo real (como RAG e serviços de inferência em tempo real).

  • Tecnologias-chave: Ambiente de desenvolvimento pessoal, Notebook, fluxos de trabalho baseados em gatilhos, datasets e imagens personalizadas.

image

Etapa

Fase

Operações e objetivos principais

Caminho principal e referências

1

Criar um ambiente de desenvolvimento pessoal

Crie uma instância de contêiner em nuvem isolada e personalizável para instalar dependências Python e realizar o desenvolvimento de IA.

Data Studio > Personal Development Environment

Para mais informações, consulte Ambiente de desenvolvimento pessoal.

2

Criar um fluxo de trabalho baseado em gatilho

Crie um fluxo de trabalho orientado a eventos no diretório do projeto para servir como contêiner de orquestração de aplicações de IA em tempo real.

Data Studio > Project Directory > Trigger-based Workflow

Para mais informações, consulte Fluxos de trabalho baseados em gatilhos.

3

Criar e configurar um gatilho

Configure um gatilho no Operation Center para definir quais eventos externos (como eventos do OSS ou mensagens do Kafka) iniciarão o fluxo de trabalho.

  • Criação: Operation Center > Trigger Management

  • Uso: Data Studio > Trigger-based Workflow > Schedule Settings

Para mais informações, consulte Gerenciamento de gatilhos e Configurações de agendamento de fluxo de trabalho baseado em gatilho.

4

Criar um nó Notebook

Crie a unidade central de desenvolvimento para escrever códigos de IA/Python. Recomendamos explorar primeiro em um Notebook no diretório pessoal.

Project Directory > Trigger-based Workflow > Notebook Node

Para mais informações, consulte Desenvolvimento de nó Notebook.

5

Criar e usar datasets

Registre dados não estruturados (imagens, documentos, etc.) armazenados no OSS ou NAS como datasets e monte-os no ambiente de desenvolvimento ou nas tarefas para acesso via código.

  • Criação: Data Map > Data Catalog > Dataset

  • Uso: Data Studio > Personal Development Environment > Dataset Configuration

Para mais informações, consulte Criar um dataset e Usar datasets.

6

Desenvolver e depurar Notebooks/nós

Escreva a lógica do algoritmo no ambiente de desenvolvimento pessoal. Realize exploração de dados, validação de modelos e iterações rápidas.

Data Studio > Notebook Editor

Para mais informações, consulte Notebook.

7

Instalar pacotes de dependência personalizados

No terminal do ambiente de desenvolvimento pessoal ou em uma célula do Notebook, use ferramentas como pip para instalar todas as bibliotecas Python de terceiros exigidas pelo modelo.

Data Studio > Personal Development Environment > Terminal

Para mais informações, consulte Instalar pacotes de dependência personalizados.

8

Criar uma imagem personalizada

Congele o ambiente de desenvolvimento pessoal com todas as dependências configuradas em uma imagem padronizada, garantindo total consistência entre o desenvolvimento e a produção.

Se você não instalou pacotes de dependência personalizados, pule esta etapa.
  • Data Studio > Personal Development Environment > Manage Environment

  • Console > Custom Image

Para mais informações, consulte Imagens personalizadas.

9

Configurações de agendamento do nó

Nas configurações de agendamento do nó de produção, você deve especificar a imagem personalizada criada na etapa anterior como ambiente de execução e montar os datasets necessários.

Data Studio > Notebook Node > Schedule Settings

Para mais informações, consulte Configurações de agendamento.

10

Implantação e O&M de nó/fluxo de trabalho

  • Implantação: Implante o fluxo de trabalho baseado em gatilho configurado no ambiente de produção.

  • O&M: Acione um evento real (como o upload de um arquivo) para verificar se o processo de ponta a ponta funciona corretamente e realize a validação do gatilho.

Módulos principais do Data Studio

image

Módulo principal

Principais capacidades

Orquestração de fluxos de trabalho

Oferece um canvas DAG visual para criar e gerenciar pipelines de tarefas complexas arrastando e conectando nós. Suporta fluxos de trabalho agendados, fluxos de trabalho baseados em gatilhos e fluxos de trabalho manuais para atender às necessidades de automação em diferentes cenários.

Ambientes e modos de execução

Fornece ambientes de desenvolvimento abertos e flexíveis para aumentar a eficiência e a colaboração.

Desenvolvimento de nós

Suporta uma ampla variedade de tipos de nós e motores de computação para processamento e análise flexíveis de dados.

  • Motores de computação: Integra-se perfeitamente a motores de big data como MaxCompute, EMR, Hologres e Flink, além de serviços de computação de IA como o PAI.

  • Tipos de nós: Oferece Integração de Dados, SQL, Python, Shell, Notebook, nós de modelos grandes e vários nós interativos de IA para atender a diversas demandas, como sincronização, limpeza, processamento de dados e treinamento de IA.

Para mais informações, consulte Motores de computação e Desenvolvimento de nós.

Agendamento de nós

Proporciona agendamento automatizado flexível para garantir que as tarefas sejam executadas pontualmente e na ordem correta.

  • Mecanismo de agendamento: Suporta agendamento periódico baseado em tempo (por ano, mês, dia, hora, minuto ou segundo) e agendamento orientado a eventos ou acionado via API.

  • Dependências de agendamento: Aceita dependências complexas no mesmo ciclo, entre ciclos, entre fluxos de trabalho e entre workspaces, além de dependências entre tarefas com diferentes agendamentos e tipos.

  • Políticas de agendamento: Inclui políticas avançadas como intervalos de tempo efetivos, nova execução em caso de falha, execuções simuladas (dry runs) e congelamento.

  • Parâmetros de agendamento: Compatível com parâmetros de fluxo de trabalho, parâmetros de workspace, parâmetros de contexto e parâmetros de nó.

    Para mais informações, consulte Configurações de agendamento.

Gerenciamento de recursos de desenvolvimento

Oferece gerenciamento unificado dos ativos utilizados no desenvolvimento de dados.

  • Catálogo de Dados: Fornece capacidades de gerenciamento de metadados de lakehouse, permitindo a criação, visualização e administração de tabelas de dados.

  • Funções e recursos: Suporta o gerenciamento e a referência de UDFs e diversos arquivos de recursos (como arquivos JAR e Python).

  • Datasets: Permite montar e gerenciar datasets provenientes de armazenamentos externos, como OSS e NAS.

    Para mais informações, consulte Catálogo de Dados, Funções e recursos e Datasets.

Controle de qualidade

Dispõe de mecanismos de controle integrados para padronizar os processos de produção de dados e garantir a precisão dos dados de saída.

  • Revisão de código: Suporta revisão manual de código antes da implantação da tarefa para assegurar a qualidade do código.

  • Controle de processo: Combina testes de fumaça (smoke testing), verificações de itens de governança e extensões para realizar validações automatizadas durante o envio e a implantação de tarefas.

  • Qualidade de Dados: Associa regras de monitoramento de qualidade de dados acionadas automaticamente após a execução da tarefa, detectando problemas o mais cedo possível.

    Para mais informações, consulte Revisão de código, Controle de processo, Extensões e Configuração de regras de qualidade de dados.

Abertura e extensibilidade

Oferece interfaces abertas e pontos de extensão para integração com sistemas externos e desenvolvimento personalizado.

  • OpenAPI: Disponibiliza interfaces de API abrangentes para gerenciar e operar tarefas de desenvolvimento programaticamente.

  • Mensagens de eventos: Permite a assinatura de mensagens de eventos de desenvolvimento de dados para integração com sistemas externos.

    Para mais informações, consulte Open API, Open Event e Extensões.

Faturamento do Data Studio

  • Custos faturados pelo DataWorks (aparecem na sua fatura do DataWorks)

  • Custos relacionados não faturados pelo DataWorks (não aparecem na sua fatura do DataWorks)

    Ao executar tarefas de nós de desenvolvimento de dados, as taxas de motor de computação e armazenamento associadas, como taxas de armazenamento do OSS, não são faturadas pelo DataWorks.

Introdução ao Data Studio

Criar ou habilitar o novo Data Studio

  • Ao criar um workspace, selecione Use Data Studio (New Version). Para mais informações, consulte Criar um workspace.

  • No Data Studio legado, clique em Upgrade to New Version na parte superior da página DataStudio e siga as instruções na tela para migrar seus dados para o novo Data Studio. Para mais informações, consulte Atualizar para o novo Data Studio.

Abrir o novo Data Studio

Acesse a página Workspaces no console do DataWorks. Na barra de navegação superior, selecione a região desejada. Localize o workspace pretendido e escolha Shortcuts > Data Studio na coluna Actions.

FAQ

  • P: Como diferenciar o novo Data Studio do Data Studio legado?

    R: Ambos possuem estilos de página completamente distintos. O novo Data Studio apresenta uma barra superior com tema escuro e um diretório em estrutura de árvore no lado esquerdo, enquanto o Data Studio legado utiliza um fundo claro e um layout tradicional de painéis.

  • P: Após atualizar para o novo Data Studio, posso reverter para o Data Studio legado?

    R: A atualização do Data Studio legado para a nova versão é uma operação irreversível. Após a conclusão da atualização, não é possível reverter para o Data Studio legado. Antes de atualizar, recomendamos criar primeiro um workspace com o novo Data Studio habilitado para testes, garantindo que ele atenda aos seus requisitos de negócios. Além disso, os dados no novo Data Studio e no Data Studio legado são independentes entre si.

  • P: Por que não vejo a opção Use Data Studio (New Version) ao criar um workspace?

    R: Se essa opção não estiver disponível na página, significa que seu workspace já possui o novo Data Studio habilitado por padrão.

    Importante

    Se encontrar problemas ao usar o novo Data Studio, participe do Grupo de Suporte à Atualização do DataWorks Data Studio no DingTalk para obter assistência.