Todos os produtos
Search
Central de documentação

DataWorks:Associar um recurso EMR Serverless Spark

Última atualização: Jun 27, 2026

Para desenvolver e gerenciar tarefas do EMR Serverless Spark no DataWorks, associe seu workspace do EMR Serverless Spark ao DataWorks como um recurso de computação serverless Spark. Após a associação, use esse recurso para desenvolvimento de dados no DataWorks.

Pré-requisitos

Limitações

  • Regiões compatíveis: China (Hangzhou), China (Shanghai), China (Beijing), China (Shenzhen), China (Chengdu), China (Hong Kong), Japão (Tóquio), Singapura, Indonésia (Jacarta), Alemanha (Frankfurt), EUA (Vale do Silício) e EUA (Virgínia).

  • Permissões:

    Usuário/função

    Permissões necessárias

    Conta Alibaba Cloud

    Nenhuma permissão adicional necessária.

    Usuário RAM ou função RAM

    • Permissões de gerenciamento do DataWorks: Apenas membros do workspace com a função O&M ou Workspace Administrator, ou membros com a política AliyunDataWorksFullAccess podem criar recursos de computação. Para mais informações sobre autorização, consulte Conceder a função Workspace Administrator a um usuário.

    • Permissões do serviço EMR Serverless Spark:

      • A política AliyunEMRServerlessSparkFullAccess.

      • A permissão de Owner para o workspace do EMR Serverless Spark. Para mais informações, consulte Gerenciar usuários e funções.

Acessar a página da lista de recursos de computação

  1. Faça login no console do DataWorks. No painel de navegação à esquerda, mude para a região desejada e clique em More > Management Center. Selecione seu workspace na lista suspensa e clique em Go to Management Center.

  2. No painel de navegação à esquerda, clique em Computing Resources para abrir a página da lista de recursos de computação.

Associar um recurso serverless Spark

Na página Computing Resources, configure e associe um recurso de computação serverless Spark.

  1. Selecione o tipo de recurso de computação a associar.

    1. Clique em Associate Computing Resources para abrir a página Associate Computing Resources.

    2. Na página Associate Computing Resources, selecione Serverless Spark como tipo de recurso de computação. A página de configuração Associate EMR Serverless Spark Computing Resource será aberta.

  2. Configure o recurso de computação serverless Spark.

    Na página de configuração Associate EMR Serverless Spark Computing Resource, defina os parâmetros conforme descrito na tabela a seguir.

    Parâmetro

    Descrição

    EMR Serverless Spark Workspace

    Selecione o workspace Spark a associar. Também é possível clicar em Create na lista suspensa para criar um workspace Spark.

    Default Engine Version

    Selecione a versão do mecanismo a usar.

    • Ao criar uma tarefa EMR Spark no Data Studio, esta versão do mecanismo é usada por padrão.

    • Para usar versões diferentes do mecanismo em tarefas específicas, configure-as nas configurações avançadas do editor de tarefas Spark.

    Default Resource Queue

    Escolha a fila de recursos a usar. Também é possível clicar em Create na lista suspensa para adicionar uma fila.

    • Ao criar uma tarefa EMR Spark no Data Studio, esta fila de recursos é usada por padrão.

    • Para usar filas de recursos diferentes em tarefas específicas, configure-as nas configurações avançadas do editor de tarefas Spark.

    Default Kyuubi Gateway

    Opcional. A configuração do Kyuubi Gateway afeta a execução das seguintes tarefas:

    • Se você configurar um Kyuubi Gateway:

      • Todas as tarefas relacionadas (EMR Spark SQL/Kyuubi, Serverless Spark SQL/Kyuubi) serão executadas por meio do Kyuubi Gateway.

    • Se você não configurar um Kyuubi Gateway:

      • As tarefas EMR Spark SQL e Serverless Spark SQL serão executadas usando spark-submit.

      • As tarefas EMR Kyuubi e Serverless Kyuubi falharão na execução.

    Para configurar um gateway, acesse EMR Serverless Spark Console > Operation Center > Gateway > Kyuubi Gateway para criar um Kyuubi Gateway e um token .

    • Se o Kerberos não estiver ativado: Clique no nome do Kyuubi Gateway para obter a URL JDBC e o token. Em seguida, concatene-os para formar a URL completa.

    • Se o Kerberos estiver ativado: Obtenha a URL Beeline com base nas informações do Kerberos configuradas. Para mais informações, consulte Usar Kerberos com Kyuubi Gateway.

      # Example of a regular URL
      jdbc:hive2://kyuubi-cn-hangzhou-internal.spark.emr.aliyuncs.com:80/;transportMode=http;httpPath=cliservice/token/<token>
      # Example of a URL for a Kerberos-enabled cluster (Make sure to include the principal of the Kyuubi service)
      jdbc:hive2://ep-xxxxxxxxxxx.epsrv-xxxxxxxxxxx.cn-hangzhou.privatelink.aliyuncs.com:10009/;principal=kyuubi/_HOST@EMR.C-DFD43*****7C204.COM

    Default Access Identity

    Especifica a identidade usada para acessar o workspace do EMR Serverless Spark.

    • Ambiente de desenvolvimento: Apenas a identidade Executor é compatível.

    • Ambiente de produção: É possível usar uma Alibaba Cloud Account, uma Alibaba Cloud RAM Sub-account e um Task Owner.

    Computing Resource Instance Name

    Identifica o recurso de computação. Durante a execução, o nome da instância seleciona o recurso de computação para uma tarefa.

  3. Clique em Confirm para concluir a configuração do recurso de computação serverless Spark.

Configurar parâmetros globais do Spark

No DataWorks, especifique parâmetros do Spark para cada módulo no nível do workspace e configure se os parâmetros globais têm precedência sobre os parâmetros locais dentro de um módulo específico, como o Data Studio. Após a configuração, as tarefas usam os parâmetros correspondentes do Spark por padrão. A tabela a seguir descreve como configurar esses parâmetros.

Escopo

Método de configuração

Global

Configure parâmetros globais do Spark para um módulo funcional do DataWorks no nível do workspace ao executar tarefas EMR. Defina também se esses parâmetros globais do Spark têm precedência sobre os parâmetros do Spark configurados dentro de um módulo específico. Para mais informações, consulte Configurar parâmetros globais do Spark.

Específico do nó

No Data Studio, defina propriedades específicas do Spark para uma única tarefa de nó na página de edição do nó. Outros módulos de produto não suportam a definição separada de propriedades do Spark dentro do módulo.

Permissões

Apenas as seguintes funções podem configurar parâmetros globais do Spark:

  • Uma conta Alibaba Cloud.

  • Um usuário RAM ou função RAM com a política AliyunDataWorksFullAccess.

  • Um usuário RAM com a função Workspace Administrator.

Configurar parâmetros globais do Spark

Siga estas etapas para configurar parâmetros globais do Spark. Para mais informações sobre os parâmetros do Spark configuráveis para um recurso de computação serverless Spark, consulte Configuração de job.

  1. Acesse a página Computing Resources e localize o recurso de computação serverless Spark associado.

  2. Clique em Spark parameters para abrir o painel de configuração de parâmetros do Spark, onde é possível visualizar as configurações globais.

  3. Defina os parâmetros globais do Spark.

    No canto superior direito da página Spark parameters, clique em Edit Spark parameters para configurar os parâmetros globais do Spark e suas prioridades para cada módulo.

    Nota

    Esta é uma configuração no nível do workspace. Antes de prosseguir, certifique-se de ter selecionado o workspace correto.

    Parâmetro

    Procedimento

    Spark property

    Configure as propriedades do Spark usadas ao executar tarefas Serverless Spark.

    Global Settings Take Precedence

    Se você selecionar esta opção, as configurações globais substituirão as dos módulos de produto. As tarefas serão então executadas com base nas propriedades globais do Spark configuradas.

    • Configuração global: As propriedades do Spark configuradas na página Spark parameters para o recurso de computação serverless Spark correspondente em Management Center > Computing Resources.

      Atualmente, é possível definir parâmetros globais do Spark apenas para os módulos Data Studio, Operation Center e Data Analysis.

    • Configuração dentro de um módulo de produto:

      • Data Studio: Para nós EMR Spark, EMR Kyuubi, EMR Spark SQL, EMR Spark Streaming, Serverless Spark Batch, Serverless Spark SQL e Serverless Kyuubi, defina propriedades do Spark para uma única tarefa de nó na seção Spark Parameters da aba Run Configuration ou Scheduling Settings na página de edição do nó.

      • Outros módulos de produto: Não há suporte para definir propriedades do Spark separadamente nestes módulos.

  4. Clique em Confirm para salvar os parâmetros globais do Spark configurados.

Configurar mapeamento de contas do cluster

Mapeie manualmente as contas em nuvem dos membros do DataWorks para identidades especificadas em um cluster EMR. Isso permite que os membros executem tarefas do EMR Serverless Spark usando as identidades de cluster mapeadas.

Importante

Este recurso está disponível apenas em um grupo de recursos serverless. Se você adquiriu um grupo de recursos serverless antes de 15 de agosto de 2025 e deseja usar este recurso, abra um ticket para atualizar o grupo de recursos.

  1. Acesse a página Computing Resources e localize o recurso de computação serverless Spark associado.

  2. Clique em Account Mappings para ir ao painel de configuração de parâmetros Account Mappings.

  3. Clique em Edit Account Mapping para configurar o mapeamento de contas do cluster. Defina os parâmetros com base no Mapping Type selecionado.

    Mapping Type

    Descrição da execução

    Detalhes da configuração

    Mapeamento de conta do sistema

    Executa tarefas de nó EMR Spark, EMR Spark SQL, EMR Kyuubi e Notebook usando a conta do cluster com o mesmo nome da Default Access Identity nas informações básicas do recurso de computação.

    Por padrão, o mapeamento de mesmo nome é utilizado. Caso precise usar um mapeamento de conta diferente, configure-o manualmente.

    Mapeamento de conta OpenLDAP

    Executa tarefas EMR Spark e EMR Spark SQL usando a Default Access Identity nas informações básicas do recurso de computação.

    Executa tarefas de nó EMR Kyuubi e Notebook usando a conta OpenLDAP mapeada para a identidade de acesso padrão nas informações básicas do recurso de computação.

    Se você tiver configurado e ativado a autenticação LDAP para o Kyuubi Gateway, configure mapeamentos entre Account e contas OpenLDAP (LDAP Account, LDAP Password) para executar as tarefas correspondentes.

    Importante

    Se a conta em nuvem necessária para executar uma tarefa do DataWorks não estiver na lista de mapeamento de contas, a tarefa poderá falhar.

    Mapeamento de conta Kerberos

    Executa tarefas EMR Spark e EMR Spark SQL usando a Default Access Identity nas informações básicas do recurso de computação.

    Executa tarefas de nó EMR Kyuubi usando a conta Kerberos mapeada para a identidade de acesso padrão nas informações básicas do recurso de computação.

    1. Faça upload do arquivo krb5.conf do serviço Kerberos configurado para o cluster EMR Serverless Spark.

    2. Configure o principal e o keytab necessários para a autenticação Kerberos da conta em nuvem especificada como identidade de acesso padrão.

  4. Clique em OK para concluir a configuração do mapeamento de contas do cluster.

Próximas etapas

Após configurar o recurso de computação serverless Spark, use-o para desenvolver tarefas de nó no Data Studio. Para mais informações, consulte Nó EMR Spark, Nó EMR Spark SQL, Nó EMR Spark Streaming, Nó EMR Kyuubi, Nó Serverless Spark Batch, Nó Serverless Spark SQL e Nó Serverless Kyuubi.