O Data Studio é uma plataforma inteligente de desenvolvimento para data lakehouse, integrada aos serviços de computação da Alibaba Cloud para ETL, gerenciamento de catálogo de dados e orquestração de fluxos de trabalho entre motores. Com ambientes de desenvolvimento pessoais, análise via Notebook, suporte a Python, integração com git e um rico ecossistema de plugins, a solução unifica o processamento em tempo real e offline com IA em todo o ciclo de vida de Dados+IA.
Data Studio
O Data Studio é uma plataforma inteligente de desenvolvimento para data lakehouse, criada com base nas melhores práticas de big data da Alibaba. Ela se integra aos serviços de big data e IA da Alibaba Cloud, como MaxCompute, E-MapReduce, Hologres, Flink e PAI, oferecendo desenvolvimento inteligente de ETL para data warehouses, data lakes e arquiteturas OpenLake. Os principais recursos incluem:
Suporte a data lakehouse e múltiplos motores: Acesse dados em data lakes (como OSS) e data warehouses (como MaxCompute) de forma contínua, por meio de um catálogo de dados unificado e um conjunto diversificado de nós de motor, permitindo o desenvolvimento híbrido com vários motores.
Fluxos de trabalho flexíveis e agendamento: Utilize diversos nós de controle de fluxo para orquestrar visualmente tarefas entre motores em um fluxo de trabalho. A plataforma suporta tanto agendamento periódico baseado em tempo quanto agendamento baseado em gatilhos orientado a eventos.
Ambiente aberto de desenvolvimento Dados+IA: Construa uma estação de trabalho flexível para pesquisa e desenvolvimento de IA com um ambiente de desenvolvimento pessoal que permite dependências personalizadas, um Notebook com suporte a codificação mista em SQL e Python, além de recursos como gerenciamento de datasets e integração com git.
Assistência inteligente e engenharia de IA: O poderoso Copilot integrado auxilia você durante todo o processo de desenvolvimento de código. Nós de algoritmo do PAI profissionais e nós de modelos grandes fornecem suporte nativo para engenharia de IA de ponta a ponta.
Conceitos principais
|
Conceito |
Definição |
Valor principal |
Palavras-chave |
|
Fluxo de trabalho |
Unidade para organização e orquestração de tarefas |
Permite o gerenciamento de dependências e o agendamento automatizado de tarefas complexas. Serve como contêiner para desenvolvimento e agendamento. |
Visual, DAG, periódico/baseado em gatilho, orquestração |
|
Nó |
Menor unidade de execução em um fluxo de trabalho |
Local onde você escreve código e implementa lógicas de negócio específicas. Representa a operação atômica para processamento de dados. |
SQL, Python, Shell, Integração de Dados |
|
Imagem personalizada |
Snapshot padronizado de um ambiente |
Garante extensibilidade, consistência e reprodutibilidade do ambiente. |
Congelamento de ambiente, padronização, replicação, consistência |
|
Agendamento |
Regras para acionamento automático de tarefas |
Automatiza a produção de dados ao converter tarefas manuais em cargas de trabalho automatizadas e prontas para produção. |
Agendamento periódico, agendamento baseado em gatilho, dependência, automação |
|
Catálogo de Dados |
Workbench unificada de metadados |
Organiza e gerencia ativos de dados (como tabelas) e recursos de computação (como funções e recursos) de maneira estruturada. |
Metadados, gerenciamento de tabelas, perfil de dados |
|
Dataset |
Mapeamento lógico para armazenamento externo |
Conecta dados não estruturados externos (imagens, documentos) ao ambiente de desenvolvimento, servindo como ponte essencial de dados para o desenvolvimento de IA. |
Integração OSS/NAS, montagem de dados, dados não estruturados |
|
Notebook |
Canvas interativo de desenvolvimento Dados+IA |
Combina códigos SQL e Python para acelerar a exploração de dados e a validação de algoritmos. |
Interativo, multilíngue, visual, análise exploratória |
Guia de processos do Data Studio
O Data Studio suporta tanto o desenvolvimento de data warehouse quanto o desenvolvimento de IA. A seção a seguir descreve dois caminhos comuns. Adapte-os conforme suas necessidades.
Caminho comum: Processo de desenvolvimento de data warehouse (tarefas periódicas de ETL)
Este processo é ideal para construir data warehouses de nível empresarial com processamento de dados em lote estável e automatizado.
Público-alvo: Engenheiros de dados e desenvolvedores de ETL.
Objetivo principal: Criar um data warehouse empresarial estável, padronizado e com agendamento automático para processamento de dados em lote e geração de relatórios.
Tecnologias-chave: Catálogo de Dados, fluxos de trabalho agendados, nós SQL e configurações de agendamento.
|
Etapa |
Fase |
Operações e objetivos principais |
Caminho principal e referências |
|
1 |
Associar um motor de computação |
Associe um ou mais motores de computação principais (como o MaxCompute) ao workspace para servir como ambiente de execução de todas as tarefas SQL.
|
Console > Workspace Settings Para mais informações, consulte Associar motores de computação. |
|
2 |
Gerenciamento do Catálogo de Dados |
Crie ou explore as estruturas de tabela necessárias para cada camada do data warehouse (ODS, DWD, ADS, etc.) no Catálogo de Dados para definir as entradas e saídas do processamento de dados. Recomendamos o uso do módulo Modelagem de Dados para construir o sistema de data warehouse. |
Data Studio > Data Catalog Para mais informações, consulte Catálogo de Dados. |
|
3 |
Criar um fluxo de trabalho agendado |
Crie um fluxo de trabalho agendado no diretório do projeto para atuar como contêiner na organização e gestão das tarefas de ETL relacionadas. |
Data Studio > Project Directory > Scheduled Workflow Para mais informações, consulte Fluxos de trabalho agendados. |
|
4 |
Desenvolvimento e depuração de nós |
Crie nós ODPS SQL ou outros tipos de nó, escreva a lógica central de ETL (limpeza, transformação e agregação de dados) no editor e depure os nós. |
Para mais informações, consulte Desenvolvimento de nós. |
|
5 |
Desenvolvimento assistido pelo Copilot |
Utilize os recursos do DataWorks Copilot para gerar, corrigir, reescrever e converter códigos SQL e Python. |
|
|
6 |
Orquestração e agendamento de nós |
No canvas DAG do fluxo de trabalho, defina as dependências upstream e downstream entre os nós arrastando-os e conectando-os. Vários nós de controle de fluxo estão disponíveis para orquestrações complexas. Configure as definições de agendamento para o ambiente de produção no nível do fluxo de trabalho ou do nó, incluindo cronograma, horário e dependências. A plataforma suporta agendamento em ultra larga escala, com dezenas de milhões de instâncias por dia. |
Para mais informações, consulte Nós gerais de controle de fluxo e Configurações de agendamento. |
|
7 |
Implantação e O&M de fluxo de trabalho/nó |
|
|
Para um tutorial relacionado de introdução, consulte Tutorial de introdução.
Caminho avançado: Processo de desenvolvimento de IA com big data
Indicado para desenvolvimento de modelos de IA, exploração de ciência de dados e aplicações de IA em tempo real, com ênfase na flexibilidade e interatividade do ambiente.
Público-alvo: Engenheiros de IA, cientistas de dados e engenheiros de algoritmos.
Objetivo principal: Realizar exploração de dados, treinamento de modelos e validação de algoritmos, ou construir aplicações de IA em tempo real (como RAG e serviços de inferência em tempo real).
Tecnologias-chave: Ambiente de desenvolvimento pessoal, Notebook, fluxos de trabalho baseados em gatilhos, datasets e imagens personalizadas.
|
Etapa |
Fase |
Operações e objetivos principais |
Caminho principal e referências |
|
1 |
Criar um ambiente de desenvolvimento pessoal |
Crie uma instância de contêiner em nuvem isolada e personalizável para instalar dependências Python e realizar o desenvolvimento de IA. |
Data Studio > Personal Development Environment Para mais informações, consulte Ambiente de desenvolvimento pessoal. |
|
2 |
Criar um fluxo de trabalho baseado em gatilho |
Crie um fluxo de trabalho orientado a eventos no diretório do projeto para servir como contêiner de orquestração de aplicações de IA em tempo real. |
Data Studio > Project Directory > Trigger-based Workflow Para mais informações, consulte Fluxos de trabalho baseados em gatilhos. |
|
3 |
Criar e configurar um gatilho |
Configure um gatilho no Operation Center para definir quais eventos externos (como eventos do OSS ou mensagens do Kafka) iniciarão o fluxo de trabalho. |
Para mais informações, consulte Gerenciamento de gatilhos e Configurações de agendamento de fluxo de trabalho baseado em gatilho. |
|
4 |
Criar um nó Notebook |
Crie a unidade central de desenvolvimento para escrever códigos de IA/Python. Recomendamos explorar primeiro em um Notebook no diretório pessoal. |
Project Directory > Trigger-based Workflow > Notebook Node Para mais informações, consulte Desenvolvimento de nó Notebook. |
|
5 |
Criar e usar datasets |
Registre dados não estruturados (imagens, documentos, etc.) armazenados no OSS ou NAS como datasets e monte-os no ambiente de desenvolvimento ou nas tarefas para acesso via código. |
Para mais informações, consulte Criar um dataset e Usar datasets. |
|
6 |
Desenvolver e depurar Notebooks/nós |
Escreva a lógica do algoritmo no ambiente de desenvolvimento pessoal. Realize exploração de dados, validação de modelos e iterações rápidas. |
Data Studio > Notebook Editor Para mais informações, consulte Notebook. |
|
7 |
Instalar pacotes de dependência personalizados |
No terminal do ambiente de desenvolvimento pessoal ou em uma célula do Notebook, use ferramentas como |
Data Studio > Personal Development Environment > Terminal Para mais informações, consulte Instalar pacotes de dependência personalizados. |
|
8 |
Criar uma imagem personalizada |
Congele o ambiente de desenvolvimento pessoal com todas as dependências configuradas em uma imagem padronizada, garantindo total consistência entre o desenvolvimento e a produção. Se você não instalou pacotes de dependência personalizados, pule esta etapa. |
Para mais informações, consulte Imagens personalizadas. |
|
9 |
Configurações de agendamento do nó |
Nas configurações de agendamento do nó de produção, você deve especificar a imagem personalizada criada na etapa anterior como ambiente de execução e montar os datasets necessários. |
Data Studio > Notebook Node > Schedule Settings Para mais informações, consulte Configurações de agendamento. |
|
10 |
Implantação e O&M de nó/fluxo de trabalho |
|
|
Módulos principais do Data Studio
|
Módulo principal |
Principais capacidades |
|
Orquestração de fluxos de trabalho |
Oferece um canvas DAG visual para criar e gerenciar pipelines de tarefas complexas arrastando e conectando nós. Suporta fluxos de trabalho agendados, fluxos de trabalho baseados em gatilhos e fluxos de trabalho manuais para atender às necessidades de automação em diferentes cenários. |
|
Ambientes e modos de execução |
Fornece ambientes de desenvolvimento abertos e flexíveis para aumentar a eficiência e a colaboração.
|
|
Desenvolvimento de nós |
Suporta uma ampla variedade de tipos de nós e motores de computação para processamento e análise flexíveis de dados.
Para mais informações, consulte Motores de computação e Desenvolvimento de nós. |
|
Agendamento de nós |
Proporciona agendamento automatizado flexível para garantir que as tarefas sejam executadas pontualmente e na ordem correta.
|
|
Gerenciamento de recursos de desenvolvimento |
Oferece gerenciamento unificado dos ativos utilizados no desenvolvimento de dados.
|
|
Controle de qualidade |
Dispõe de mecanismos de controle integrados para padronizar os processos de produção de dados e garantir a precisão dos dados de saída.
|
|
Abertura e extensibilidade |
Oferece interfaces abertas e pontos de extensão para integração com sistemas externos e desenvolvimento personalizado.
|
Faturamento do Data Studio
-
Custos faturados pelo DataWorks (aparecem na sua fatura do DataWorks)
-
Taxas de grupo de recursos: O desenvolvimento de nós e os ambientes de desenvolvimento individual utilizam um grupo de recursos. Dependendo do tipo de grupo de recursos, você será cobrado por um grupo de recursos serverless ou por um grupo de recursos exclusivo para agendamento.
Se você utilizar serviços de modelos grandes , também haverá cobrança referente a um grupo de recursos serverless.
Taxas de agendamento de tarefas: Caso uma tarefa seja implantada no ambiente de produção para execuções agendadas, serão aplicadas taxas de agendamento de tarefas (ao usar um grupo de recursos serverless) ou taxas de um grupo de recursos exclusivo para agendamento (ao usar um grupo de recursos exclusivo).
Taxas de Qualidade de Dados: Se você configurar o monitoramento de qualidade para uma tarefa periódica e uma instância for acionada com sucesso, haverá cobrança de taxas de instância de Qualidade de Dados.
Taxas de linha de base inteligente: Ao configurar uma linha de base inteligente para uma tarefa periódica, você será cobrado pelas taxas de instância de linha de base inteligente de cada linha de base inteligente ativada.
-
Taxas de SMS e chamadas telefônicas de alerta: Se você configurar alertas de monitoramento para uma tarefa periódica e um alerta via SMS ou telefone for acionado, haverá cobrança de taxas de SMS e chamadas telefônicas de alerta.
NotaMódulos envolvidos: Data Studio, Qualidade de Dados e Operation Center.
-
-
Custos relacionados não faturados pelo DataWorks (não aparecem na sua fatura do DataWorks)
Ao executar tarefas de nós de desenvolvimento de dados, as taxas de motor de computação e armazenamento associadas, como taxas de armazenamento do OSS, não são faturadas pelo DataWorks.
Introdução ao Data Studio
Criar ou habilitar o novo Data Studio
Ao criar um workspace, selecione Use Data Studio (New Version). Para mais informações, consulte Criar um workspace.
No Data Studio legado, clique em Upgrade to New Version na parte superior da página DataStudio e siga as instruções na tela para migrar seus dados para o novo Data Studio. Para mais informações, consulte Atualizar para o novo Data Studio.
Abrir o novo Data Studio
Acesse a página Workspaces no console do DataWorks. Na barra de navegação superior, selecione a região desejada. Localize o workspace pretendido e escolha na coluna Actions.
FAQ
-
P: Como diferenciar o novo Data Studio do Data Studio legado?
R: Ambos possuem estilos de página completamente distintos. O novo Data Studio apresenta uma barra superior com tema escuro e um diretório em estrutura de árvore no lado esquerdo, enquanto o Data Studio legado utiliza um fundo claro e um layout tradicional de painéis.
-
P: Após atualizar para o novo Data Studio, posso reverter para o Data Studio legado?
R: A atualização do Data Studio legado para a nova versão é uma operação irreversível. Após a conclusão da atualização, não é possível reverter para o Data Studio legado. Antes de atualizar, recomendamos criar primeiro um workspace com o novo Data Studio habilitado para testes, garantindo que ele atenda aos seus requisitos de negócios. Além disso, os dados no novo Data Studio e no Data Studio legado são independentes entre si.
-
P: Por que não vejo a opção Use Data Studio (New Version) ao criar um workspace?
R: Se essa opção não estiver disponível na página, significa que seu workspace já possui o novo Data Studio habilitado por padrão.
ImportanteSe encontrar problemas ao usar o novo Data Studio, participe do Grupo de Suporte à Atualização do DataWorks Data Studio no DingTalk para obter assistência.
