Plataforma inteligente de desenvolvimento para data lakehouse que se integra a diversos serviços de computação da Alibaba Cloud para oferecer ETL, gerenciamento de catálogo de dados e orquestração de fluxos de trabalho entre motores. O Data Studio oferece suporte a desenvolvimento em Python, análises com Notebook, integração com Git e um ecossistema de plugins que unifica processamento em tempo real e offline, arquitetura de lakehouse e big data com IA, permitindo gerenciar todo o ciclo de vida de Dados+IA.
O que é o Data Studio?
O Data Studio integra-se a dezenas de serviços de computação de big data e IA da Alibaba Cloud — incluindo MaxCompute, E-MapReduce, Hologres, Flink e PAI — para proporcionar desenvolvimento inteligente de ETL em data warehouses, data lakes e arquiteturas de lakehouse OpenLake. As principais capacidades incluem:
Catálogo de dados: Gerenciamento de metadados projetado para ambientes de lakehouse.
Fluxo de trabalho: Orquestra nós de processamento de dados em tempo real e offline, além de nós de IA, em dezenas de tipos de motor.
Ambiente de desenvolvimento pessoal: Desenvolvimento e depuração de nós Python, análises interativas com Notebook e gerenciamento de código baseado em Git integrado ao armazenamento NAS/OSS.
Notebook: Ferramenta interativa para desenvolvimento e análise de dados. Execute ou depure código SQL ou Python em vários motores de dados e visualize os resultados instantaneamente.
Ativar o novo Data Studio
Para ativar o novo Data Studio:
Ao criar um workspace, selecione Use Data Studio (New Version). Para mais detalhes, consulte Create a workspace.
No DataStudio legado, clique no botão DataStudio na parte superior da página. Em seguida, clique em Upgrade to New Version e siga as instruções para migrar seus dados para o novo Data Studio.
O novo Data Studio está disponível nas seguintes regiões: China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Ulanqab), China (Shenzhen), China (Chengdu), China (Hong Kong), Japan (Tokyo), Singapore, Malaysia (Kuala Lumpur), Indonesia (Jakarta), Thailand (Bangkok), Germany (Frankfurt), UK (London), US (Silicon Valley), US (Virginia).
Caso enfrente problemas ao usar o novo Data Studio, participe do Grupo de suporte dedicado no DingTalk para atualização para o novo Data Studio.
Os dados no novo Data Studio e no DataStudio legado são completamente separados e não podem ser compartilhados.
A atualização do DataStudio legado para a nova versão é irreversível. Após uma atualização bem-sucedida, não é possível reverter para a versão anterior. Antes de fazer a transição, crie um workspace de teste com o novo Data Studio ativado para verificar se ele atende às suas necessidades de negócios.
A partir de 19 de fevereiro de 2025, quando uma conta raiz criar um workspace do DataWorks pela primeira vez em uma região compatível, o novo Data Studio será ativado por padrão. O DataStudio legado deixará de estar disponível.
Acessar o Data Studio
Acesse a página Workspaces no console do DataWorks. Na barra de navegação superior, selecione a região desejada. Localize o workspace de interesse e escolha na coluna Actions.
Esta entrada fica visível apenas para workspaces onde a opção Use Data Studio (New Version) está ativada. Para mais detalhes, consulte Enable the new Data Studio.
O Data Studio funciona somente no navegador Chrome versão 69 ou posterior em desktop.
Principais recursos do Data Studio
O Data Studio oferece os seguintes recursos principais. Para mais informações, consulte Appendix: Concepts Related to Data Development.
Tipo | Descrição |
Gerenciamento de fluxo | O DataWorks fornece um modelo de desenvolvimento baseado em Workflow. Os fluxos de trabalho utilizam uma interface visual baseada em DAG para simplificar o gerenciamento de pipelines complexos de tarefas sob uma perspectiva de negócios. Para mais informações, consulte Recurring workflow orchestration, Event-triggered workflows e Manually triggered workflows. Nota No Data Studio, cada workspace possui os seguintes limites para nós internos de fluxo de trabalho e objetos:
Se o seu workspace atingir esses limites, não será possível criar novos fluxos de trabalho ou objetos. |
Desenvolvimento de tarefas |
Para tipos de nós compatíveis, consulte Node development. |
Agendamento de tarefas |
Para mais detalhes sobre agendamento, consulte Node scheduling configuration. |
Controle de qualidade | Publicação padronizada de tarefas com múltiplos mecanismos de controle de qualidade:
|
Outros |
|
Interface do Data Studio
Consulte Data Studio feature guide para conhecer o layout da interface e como utilizar cada módulo.
Fluxo de trabalho de desenvolvimento de tarefas
O DataWorks oferece suporte a tarefas de sincronização em tempo real, tarefas agendadas offline (incluindo sincronização offline e jobs de transformação) e tarefas acionadas manualmente. Para capacidades de sincronização de dados, consulte o módulo Data Integration.
Os workspaces do DataWorks operam em standard mode or basic mode. Os fluxos de trabalho de desenvolvimento de tarefas diferem entre os modos conforme mostrado abaixo.
Fluxo de trabalho de desenvolvimento em workspace no modo Standard
Fluxo de trabalho no modo Basic
Fluxo básico: No modo standard, o desenvolvimento de tarefas agendadas inclui etapas como desenvolvimento, depuração, configuração de agendamento, publicação e O&M. Para o processo geral de desenvolvimento, consulte Overview of the new Data Studio.
Controle de fluxo: Durante o desenvolvimento, combine code review integrado, verificações predefinidas de data governance e lógica de validação personalizada de extensões da Open Platform para garantir que as tarefas estejam em conformidade com os padrões.
Abordagens de desenvolvimento de dados
O Data Studio permite personalizar seu processo de desenvolvimento. Construa pipelines de dados usando fluxos de trabalho ou crie manualmente nós de tarefa e configure dependências.
Para mais detalhes, consulte Workflows.
Tipos de nós compatíveis no Data Studio
O Data Studio oferece suporte a dezenas de tipos de nós — incluindo integração de dados, MaxCompute, Hologres, EMR, Flink, Python, Notebook e ADB — muitos dos quais permitem agendamento recorrente. Escolha o tipo de nó adequado com base nas suas necessidades de negócios. Para a lista completa, consulte Supported node types.
Apêndice: Conceitos-chave no desenvolvimento de dados
Desenvolvimento de tarefas
|
Conceito |
Descrição |
|
Fluxo de trabalho |
Abordagem de desenvolvimento visual baseada em DAG que simplifica pipelines complexos de tarefas sob uma perspectiva de negócios. Os fluxos de trabalho permitem orquestrar dezenas de tipos de nós — incluindo integração de dados, MaxCompute, Hologres, EMR, Flink, Python, Notebook e ADB — e oferecem agendamento no nível do fluxo. Oferecem suporte tanto a fluxos recorrentes quanto acionados por eventos. |
|
Fluxo de trabalho acionado manualmente |
Conjunto de tarefas, tabelas, recursos e funções para uma necessidade específica de negócios. Diferentemente dos fluxos recorrentes, as tarefas em fluxos acionados manualmente devem ser iniciadas manualmente, e não por agendamento. |
|
Nó de tarefa |
Unidade básica de execução no DataWorks. O Data Studio fornece múltiplos tipos de nó: nós de integração de dados para sincronização, nós de computação de motor para limpeza de dados (como ODPS SQL, Hologres SQL, EMR Hive) e nós de uso geral para lógica complexa (como nós zero load para gerenciar múltiplos nós ou nós do-while para loops). A combinação desses nós atende a diversas necessidades de processamento de dados. |
Agendamento de tarefas
Conceito | Descrição |
Dependência | As dependências definem a ordem de execução entre tarefas. Se o nó B executa somente após a conclusão do nó A, então A é a dependência upstream de B (ou B depende de A). Em um DAG, as dependências aparecem como setas entre os nós. |
Nome de saída | Nome do ponto de saída de uma tarefa. Dentro de um único tenant (conta Alibaba Cloud), essa entidade virtual conecta tarefas upstream e downstream quando você define dependências. Ao configurar dependências entre tarefas, utilize o nome de saída — não o nome ou ID do nó. Uma vez configurado, esse nome de saída torna-se o nome de entrada para o nó downstream. |
Nome da tabela de saída | Defina o nome da tabela de saída para corresponder à tabela de saída real da tarefa atual. Isso ajuda as tarefas downstream a confirmar que estão usando os dados upstream esperados. Não altere manualmente os nomes de tabela de saída gerados automaticamente — eles servem apenas como identificadores e não afetam a tabela real produzida pelo seu script SQL, que é determinada pela própria lógica SQL. Nota O Output Name de um nó deve ser globalmente único, mas o Output table name não possui essa restrição. |
Grupo de recursos de agendamento | O resource group utilizado para o agendamento de tarefas. |
Parâmetros de agendamento | Scheduling parameters são variáveis no seu código que recebem valores dinâmicos em tempo de execução. Para acessar informações contextuais como data ou hora durante execuções repetidas, defina variáveis usando a sintaxe de parâmetros de agendamento do DataWorks. |
Data dos dados | Data associada a uma atividade de negócios, indicando quando os dados de negócios correspondentes foram gerados. Esse conceito é especialmente importante em cenários de computação offline. Por exemplo, no varejo, o volume de vendas de 20241010 costuma ser calculado na madrugada de 20241011. O resultado representa o volume real de vendas de 20241010. Nesse caso, 20241010 é a data dos dados. |
Hora agendada | Horário exato, com precisão de minutos, definido para a execução de uma tarefa recorrente. Importante Alcançar a hora agendada não garante execução imediata. O DataWorks verifica se as tarefas upstream foram concluídas com sucesso, se a hora agendada já passou e se há recursos de agendamento suficientes disponíveis. Somente quando todas as condições são atendidas a tarefa é acionada. |