Para desenvolver e gerenciar tarefas do EMR Serverless Spark no DataWorks, associe seu workspace do EMR Serverless Spark ao DataWorks como um recurso de computação serverless Spark. Após a associação, use esse recurso para desenvolvimento de dados no DataWorks.
Pré-requisitos
-
Você já criou um workspace do DataWorks. Seu usuário RAM deve ter a função Workspace Administrator no workspace.
ImportanteSomente workspaces com a opção Use Data Studio (New Version) selecionada são compatíveis.
Você já usou um grupo de recursos serverless e o associou ao workspace do DataWorks desejado.
Limitações
Regiões compatíveis: China (Hangzhou), China (Shanghai), China (Beijing), China (Shenzhen), China (Chengdu), China (Hong Kong), Japão (Tóquio), Singapura, Indonésia (Jacarta), Alemanha (Frankfurt), EUA (Vale do Silício) e EUA (Virgínia).
-
Permissões:
Usuário/função
Permissões necessárias
Conta Alibaba Cloud
Nenhuma permissão adicional necessária.
Usuário RAM ou função RAM
Permissões de gerenciamento do DataWorks: Apenas membros do workspace com a função O&M ou Workspace Administrator, ou membros com a política
AliyunDataWorksFullAccesspodem criar recursos de computação. Para mais informações sobre autorização, consulte Conceder a função Workspace Administrator a um usuário.Permissões do serviço EMR Serverless Spark:
A política
AliyunEMRServerlessSparkFullAccess.A permissão de
Ownerpara o workspace do EMR Serverless Spark. Para mais informações, consulte Gerenciar usuários e funções.
Acessar a página da lista de recursos de computação
Faça login no console do DataWorks. No painel de navegação à esquerda, mude para a região desejada e clique em . Selecione seu workspace na lista suspensa e clique em Go to Management Center.
No painel de navegação à esquerda, clique em Computing Resources para abrir a página da lista de recursos de computação.
Associar um recurso serverless Spark
Na página Computing Resources, configure e associe um recurso de computação serverless Spark.
-
Selecione o tipo de recurso de computação a associar.
Clique em Associate Computing Resources para abrir a página Associate Computing Resources.
Na página Associate Computing Resources, selecione Serverless Spark como tipo de recurso de computação. A página de configuração Associate EMR Serverless Spark Computing Resource será aberta.
-
Configure o recurso de computação serverless Spark.
Na página de configuração Associate EMR Serverless Spark Computing Resource, defina os parâmetros conforme descrito na tabela a seguir.
Parâmetro
Descrição
EMR Serverless Spark Workspace
Selecione o workspace Spark a associar. Também é possível clicar em Create na lista suspensa para criar um workspace Spark.
Default Engine Version
Selecione a versão do mecanismo a usar.
Ao criar uma tarefa EMR Spark no Data Studio, esta versão do mecanismo é usada por padrão.
Para usar versões diferentes do mecanismo em tarefas específicas, configure-as nas configurações avançadas do editor de tarefas Spark.
Default Resource Queue
Escolha a fila de recursos a usar. Também é possível clicar em Create na lista suspensa para adicionar uma fila.
Ao criar uma tarefa EMR Spark no Data Studio, esta fila de recursos é usada por padrão.
Para usar filas de recursos diferentes em tarefas específicas, configure-as nas configurações avançadas do editor de tarefas Spark.
Default Kyuubi Gateway
Opcional. A configuração do Kyuubi Gateway afeta a execução das seguintes tarefas:
Se você configurar um Kyuubi Gateway:
Todas as tarefas relacionadas (EMR Spark SQL/Kyuubi, Serverless Spark SQL/Kyuubi) serão executadas por meio do Kyuubi Gateway.
Se você não configurar um Kyuubi Gateway:
As tarefas EMR Spark SQL e Serverless Spark SQL serão executadas usando
spark-submit.As tarefas EMR Kyuubi e Serverless Kyuubi falharão na execução.
Para configurar um gateway, acesse para criar um Kyuubi Gateway e um token .
Se o Kerberos não estiver ativado: Clique no nome do Kyuubi Gateway para obter a URL JDBC e o token. Em seguida, concatene-os para formar a URL completa.
Se o Kerberos estiver ativado: Obtenha a URL Beeline com base nas informações do Kerberos configuradas. Para mais informações, consulte Usar Kerberos com Kyuubi Gateway.
# Example of a regular URL jdbc:hive2://kyuubi-cn-hangzhou-internal.spark.emr.aliyuncs.com:80/;transportMode=http;httpPath=cliservice/token/<token> # Example of a URL for a Kerberos-enabled cluster (Make sure to include the principal of the Kyuubi service) jdbc:hive2://ep-xxxxxxxxxxx.epsrv-xxxxxxxxxxx.cn-hangzhou.privatelink.aliyuncs.com:10009/;principal=kyuubi/_HOST@EMR.C-DFD43*****7C204.COM
Default Access Identity
Especifica a identidade usada para acessar o workspace do EMR Serverless Spark.
Ambiente de desenvolvimento: Apenas a identidade Executor é compatível.
Ambiente de produção: É possível usar uma Alibaba Cloud Account, uma Alibaba Cloud RAM Sub-account e um Task Owner.
Computing Resource Instance Name
Identifica o recurso de computação. Durante a execução, o nome da instância seleciona o recurso de computação para uma tarefa.
Clique em Confirm para concluir a configuração do recurso de computação serverless Spark.
Configurar parâmetros globais do Spark
No DataWorks, especifique parâmetros do Spark para cada módulo no nível do workspace e configure se os parâmetros globais têm precedência sobre os parâmetros locais dentro de um módulo específico, como o Data Studio. Após a configuração, as tarefas usam os parâmetros correspondentes do Spark por padrão. A tabela a seguir descreve como configurar esses parâmetros.
|
Escopo |
Método de configuração |
|
Global |
Configure parâmetros globais do Spark para um módulo funcional do DataWorks no nível do workspace ao executar tarefas EMR. Defina também se esses parâmetros globais do Spark têm precedência sobre os parâmetros do Spark configurados dentro de um módulo específico. Para mais informações, consulte Configurar parâmetros globais do Spark. |
|
Específico do nó |
No Data Studio, defina propriedades específicas do Spark para uma única tarefa de nó na página de edição do nó. Outros módulos de produto não suportam a definição separada de propriedades do Spark dentro do módulo. |
Permissões
Apenas as seguintes funções podem configurar parâmetros globais do Spark:
Uma conta Alibaba Cloud.
Um usuário RAM ou função RAM com a política
AliyunDataWorksFullAccess.Um usuário RAM com a função Workspace Administrator.
Configurar parâmetros globais do Spark
Siga estas etapas para configurar parâmetros globais do Spark. Para mais informações sobre os parâmetros do Spark configuráveis para um recurso de computação serverless Spark, consulte Configuração de job.
Acesse a página Computing Resources e localize o recurso de computação serverless Spark associado.
Clique em Spark parameters para abrir o painel de configuração de parâmetros do Spark, onde é possível visualizar as configurações globais.
-
Defina os parâmetros globais do Spark.
No canto superior direito da página Spark parameters, clique em Edit Spark parameters para configurar os parâmetros globais do Spark e suas prioridades para cada módulo.
NotaEsta é uma configuração no nível do workspace. Antes de prosseguir, certifique-se de ter selecionado o workspace correto.
Parâmetro
Procedimento
Spark property
Configure as propriedades do Spark usadas ao executar tarefas Serverless Spark.
Clique em Add e insira um Spark Property Name e seu Spark Property Value correspondente para definir a propriedade do Spark.
Para mais informações sobre as propriedades do Spark compatíveis, consulte Spark Configuration e Lista de parâmetros personalizados do Spark Conf.
Global Settings Take Precedence
Se você selecionar esta opção, as configurações globais substituirão as dos módulos de produto. As tarefas serão então executadas com base nas propriedades globais do Spark configuradas.
Configuração global: As propriedades do Spark configuradas na página Spark parameters para o recurso de computação serverless Spark correspondente em .
Atualmente, é possível definir parâmetros globais do Spark apenas para os módulos Data Studio, Operation Center e Data Analysis.
Configuração dentro de um módulo de produto:
Data Studio: Para nós EMR Spark, EMR Kyuubi, EMR Spark SQL, EMR Spark Streaming, Serverless Spark Batch, Serverless Spark SQL e Serverless Kyuubi, defina propriedades do Spark para uma única tarefa de nó na seção Spark Parameters da aba Run Configuration ou Scheduling Settings na página de edição do nó.
Outros módulos de produto: Não há suporte para definir propriedades do Spark separadamente nestes módulos.
Clique em Confirm para salvar os parâmetros globais do Spark configurados.
Configurar mapeamento de contas do cluster
Mapeie manualmente as contas em nuvem dos membros do DataWorks para identidades especificadas em um cluster EMR. Isso permite que os membros executem tarefas do EMR Serverless Spark usando as identidades de cluster mapeadas.
Este recurso está disponível apenas em um grupo de recursos serverless. Se você adquiriu um grupo de recursos serverless antes de 15 de agosto de 2025 e deseja usar este recurso, abra um ticket para atualizar o grupo de recursos.
Acesse a página Computing Resources e localize o recurso de computação serverless Spark associado.
Clique em Account Mappings para ir ao painel de configuração de parâmetros Account Mappings.
-
Clique em Edit Account Mapping para configurar o mapeamento de contas do cluster. Defina os parâmetros com base no Mapping Type selecionado.
Mapping Type
Descrição da execução
Detalhes da configuração
Mapeamento de conta do sistema
Executa tarefas de nó EMR Spark, EMR Spark SQL, EMR Kyuubi e Notebook usando a conta do cluster com o mesmo nome da Default Access Identity nas informações básicas do recurso de computação.
Por padrão, o mapeamento de mesmo nome é utilizado. Caso precise usar um mapeamento de conta diferente, configure-o manualmente.
Mapeamento de conta OpenLDAP
Executa tarefas EMR Spark e EMR Spark SQL usando a Default Access Identity nas informações básicas do recurso de computação.
Executa tarefas de nó EMR Kyuubi e Notebook usando a conta OpenLDAP mapeada para a identidade de acesso padrão nas informações básicas do recurso de computação.
Se você tiver configurado e ativado a autenticação LDAP para o Kyuubi Gateway, configure mapeamentos entre Account e contas OpenLDAP (LDAP Account, LDAP Password) para executar as tarefas correspondentes.
ImportanteSe a conta em nuvem necessária para executar uma tarefa do DataWorks não estiver na lista de mapeamento de contas, a tarefa poderá falhar.
Mapeamento de conta Kerberos
Executa tarefas EMR Spark e EMR Spark SQL usando a Default Access Identity nas informações básicas do recurso de computação.
Executa tarefas de nó EMR Kyuubi usando a conta Kerberos mapeada para a identidade de acesso padrão nas informações básicas do recurso de computação.
Faça upload do arquivo krb5.conf do serviço Kerberos configurado para o cluster EMR Serverless Spark.
Configure o principal e o keytab necessários para a autenticação Kerberos da conta em nuvem especificada como identidade de acesso padrão.
Clique em OK para concluir a configuração do mapeamento de contas do cluster.
Próximas etapas
Após configurar o recurso de computação serverless Spark, use-o para desenvolver tarefas de nó no Data Studio. Para mais informações, consulte Nó EMR Spark, Nó EMR Spark SQL, Nó EMR Spark Streaming, Nó EMR Kyuubi, Nó Serverless Spark Batch, Nó Serverless Spark SQL e Nó Serverless Kyuubi.