Para usar instâncias como MaxCompute e Hologres no desenvolvimento de dados com o DataWorks, associe-as previamente como recursos de computação. Em seguida, crie e gerencie esses recursos para dar suporte ao desenvolvimento e ao agendamento de tarefas.
Relação entre recursos de computação e fontes de dados
O DataWorks oferece suporte a diversos recursos de computação. Após associar um recurso de computação, desenvolva tarefas complexas de processamento de dados e agendamentos periódicos no Data Studio. Ao associar a maioria dos recursos de computação ao DataWorks, o sistema cria automaticamente uma fonte de dados com o mesmo nome. Use essa fonte de dados no módulo Data Integration para tarefas de sincronização. As diferenças entre um mecanismo de computação e uma fonte de dados são as seguintes:
Um recurso de computação é uma instância de mecanismo de computação que executa tarefas de processamento e análise de dados.
Uma fonte de dados conecta-se a serviços de armazenamento para guardar e gerenciar dados.
Ao executar transformações ETL de dados por meio de nós SQL, como converter uma coluna JSON de uma tabela do AnalyticDB for MySQL em uma nova tabela, associe também o mecanismo de computação correspondente. Os nós SQL no Data Studio exigem um mecanismo de computação para executar instruções SQL, mesmo quando se usam apenas funcionalidades de transformação de dados.
Recursos de computação compatíveis
O DataWorks oferece suporte aos seguintes recursos de computação para desenvolvimento de dados.
|
Categoria |
Tipo de recurso |
Guia de associação |
Data Studio (nova versão) |
Data Studio (versão legada) |
|
Computação offline |
|
|
||
|
|
|
|||
|
Serverless Ray |
|
|
||
|
Consulta em tempo real |
|
|
||
|
Associar um recurso de computação do AnalyticDB for PostgreSQL |
|
|
||
|
|
|
|||
|
|
|
|||
|
|
|
|||
|
|
|
|||
|
Associar um recurso de computação do EMR Serverless StarRocks |
|
|
||
|
Computação em tempo real |
|
|
||
|
Pesquisa multimodal |
|
|
||
|
Gerenciamento de cluster |
|
|
||
|
|
|
Ao associar um recurso de computação do MaxCompute, AnalyticDB for MySQL, AnalyticDB for PostgreSQL, AnalyticDB for Spark, ClickHouse, Hologres, Lindorm, EMR Serverless StarRocks ou OpenSearch, o sistema cria automaticamente uma fonte de dados com o mesmo nome no workspace atual.
Descrição de permissões
Apenas membros do workspace com a função de operador ou administrador do workspace, ou aqueles que possuem a política de permissões AliyunDataWorksFullAccess ou AdministratorAccess, podem criar recursos de computação. Para mais detalhes, consulte Gerenciar permissões em services no nível do workspace e Conceder permissões a um usuário RAM.
Além das permissões mencionadas, alguns recursos de computação podem exigir permissões adicionais durante a criação. Siga as instruções na tela para conceder o acesso necessário.
Associar um recurso de computação
Associe um recurso de computação pelo ponto de entrada correspondente, dependendo se o workspace tem a opção Use Data Studio (New Version) ativada.
Associar um recurso de computação usando o Data Studio (nova versão)
Faça login no console do DataWorks, mude para a região desejada e clique em no painel de navegação à esquerda. Selecione o workspace alvo na lista suspensa e clique em Go to Management Center.
-
No painel de navegação à esquerda, clique em Computing Resources para acessar a página de lista de recursos de computação. Consulte a documentação específica conforme o tipo de recurso de computação que deseja associar.
Associar um recurso de computação sem o Data Studio (nova versão)
-
Faça login no console do DataWorks. Na região desejada, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Development.
-
No painel de navegação à esquerda, clique no ícone
para acessar a página de lista de Computing Resources. Consulte a documentação adequada conforme o tipo de recurso de computação que pretende associar.-
Gerenciamento de recursos de computação: Clique no botão Create Computing Resource no canto superior direito para criar um recurso de computação.
-
Gerenciamento de cluster: Acesse a página da lista de Computing Resources e clique no botão Create Cluster no canto superior direito para criar um mecanismo de cluster.
Gerenciamento de cluster
Versão/tipo de cluster compatível
Documentação de associação de cluster
Associar um cluster CDH/CDP
O DataWorks disponibiliza as versões CDH5.16.2, CDH6.1.1, CDH6.2.1, CDH6.3.2 e CDP7.1.7 para seleção direta. As versões dos componentes incluídas nessas versões de cluster (ou seja, a versão de cada componente nas informações de conexão do cluster) são fixas. Caso essas versões não atendam aos seus requisitos de negócio, selecione Custom Version.
Associar um cluster EMR
Tipos de cluster EMR compatíveis: Cluster DataLake (novo data lake): EMR on ECS, Cluster personalizado: EMR on ECS, Cluster Hadoop (data lake legado): EMR on ECS, Cluster Spark: EMR on ACK e clusters EMR Serverless Spark.
Importante-
O DataWorks oferece suporte às seguintes versões EMR de clusters Hadoop (data lake legado):
EMR-3.38.2, EMR-3.38.3, EMR-4.9.0, EMR-5.6.0, EMR-3.26.3, EMR-3.27.2, EMR-3.29.0, EMR-3.32.0, EMR-3.35.0, EMR-4.3.0, EMR-4.4.1, EMR-4.5.0, EMR-4.5.1, EMR-4.6.0, EMR-4.8.0, EMR-5.2.1, EMR-5.4.3
-
Clusters Hadoop (data lake legado) não são mais recomendados. Migre para clusters DataLake o mais breve possível. Para mais informações, consulte Migrar clusters Hadoop para clusters DataLake.
-
-
Desassociar um recurso de computação
Tenha cautela ao desassociar um recurso de computação. A desassociação também exclui a fonte de dados com o mesmo nome. Isso pode afetar tarefas que referenciam o recurso de computação ou a fonte de dados em módulos como Data Integration, Operation Center, Data Analysis, APIs do Data Service e Data Quality. Antes de prosseguir, leia atentamente os avisos na tela e migre todas as tarefas vinculadas ao recurso de computação para outro recurso.
Na página de recursos de computação, localize o recurso desejado e clique em Disassociate para removê-lo do workspace atual.
Apêndice: Descrição do ambiente de execução de tarefas
Em um workspace no modo padrão, um recurso de computação possui dois conjuntos de configurações: um para o ambiente de desenvolvimento e outro para o ambiente de produção. Cada ambiente pode usar um banco de dados ou instância diferente. O sistema direciona automaticamente o acesso ao recurso de computação correto com base no ambiente de execução, isolando o desenvolvimento da produção. Por exemplo, uma tarefa de sincronização em lote no ambiente de desenvolvimento acessa o banco de dados de desenvolvimento, enquanto a mesma tarefa em produção acessa o banco de dados de produção.
Um workspace no modo básico possui apenas um ambiente e não permite isolar o desenvolvimento da produção. Para mais detalhes sobre os modos de workspace, consulte Diferenças entre modos de workspace.
Caso faça upgrade do modo básico para o modo padrão (workspaces com a opção Use Data Studio (new version) ativada não oferecem suporte a esse upgrade), o recurso de computação único original será dividido em dois recursos isolados para os ambientes de produção e desenvolvimento. Para mais informações, consulte Fazer upgrade do modo de workspace.