Todos os produtos
Search
Central de documentação

DataWorks:Data Studio (legacy): Registre um cluster EMR

Última atualização: Jun 27, 2026

O DataWorks permite criar nós como Hive, MapReduce (MR), Presto e Spark SQL em um cluster E-MapReduce (EMR) para configurar fluxos de trabalho de tarefas, agendar jobs e gerenciar metadados. Este tópico descreve como registrar um cluster EMR pertencente à mesma conta Alibaba Cloud ou a uma conta diferente.

Contexto

A plataforma de desenvolvimento de big data open source E-MapReduce (EMR) é uma solução de processamento de big data executada na plataforma Alibaba Cloud.

Baseado no Apache Hadoop e Apache Spark open source, o EMR permite utilizar outros sistemas desses ecossistemas para analisar e processar dados. O EMR também transfere dados de e para outros serviços da Alibaba Cloud, como Object Storage Service (OSS) e RDS. O Alibaba Cloud EMR está disponível em vários formatos, incluindo on ECS, on ACK e serverless, para atender a diferentes necessidades dos usuários.

Ao executar tarefas do EMR no DataWorks, escolha entre diversos componentes do EMR. A configuração ideal varia conforme o componente. Ao configurar um cluster EMR, consulte as Recomendações de configuração de cluster EMR e selecione uma opção com base nos seus requisitos reais.

Tipos de cluster suportados

Antes de executar tarefas relacionadas, crie e registre um cluster EMR no DataWorks. O DataWorks suporta o registro dos seguintes tipos de cluster: Clusters DataLake (novo data lake): EMR on ECS, Clusters personalizados: EMR on ECS, Clusters Hadoop (data lake legado): EMR on ECS, Clusters Spark: EMR on ACK e clusters EMR Serverless Spark.

Importante
  • O DataWorks suporta as seguintes versões do EMR para clusters Hadoop (data lake legado):

    EMR-3.38.2, EMR-3.38.3, EMR-4.9.0, EMR-5.6.0, EMR-3.26.3, EMR-3.27.2, EMR-3.29.0, EMR-3.32.0, EMR-3.35.0, EMR-4.3.0, EMR-4.4.1, EMR-4.5.0, EMR-4.5.1, EMR-4.6.0, EMR-4.8.0, EMR-5.2.1, EMR-5.4.3

  • Clusters Hadoop (data lake legado) não são mais recomendados. Recomendamos migrar seus clusters Hadoop para clusters DataLake o mais breve possível. Para obter mais informações, consulte Migrar um cluster Hadoop para um cluster DataLake.

Nota

Caso o tipo de cluster utilizado não possa ser registrado no DataWorks, envie um ticket para entrar em contato com o suporte técnico.

Limitações

  • Permissões: Apenas usuários RAM ou funções RAM com as identidades abaixo podem registrar um cluster EMR. Para conceder essas permissões, consulte Conceder permissões a um usuário RAM.

    • Uma conta Alibaba Cloud.

    • Um usuário RAM ou função RAM com a função DataWorks Workspace Administrator e a política AliyunEMRFullAccess.

    • Um usuário RAM ou função RAM com as políticas AliyunDataWorksFullAccess e AliyunEMRFullAccess.

  • Região: O EMR Serverless Spark está disponível apenas em China (Hangzhou), China (Shanghai), China (Beijing), China (Shenzhen), China (Chengdu), China (Hong Kong), Japão (Tóquio), Singapura, Indonésia (Jacarta), Alemanha (Frankfurt) e EUA (Virgínia).

  • Tipo de tarefa: O DataWorks não suporta tarefas EMR Flink.

  • Execução de tarefas: O DataWorks suporta a execução de tarefas EMR usando grupos de recursos serverless (recomendado) ou grupos de recursos exclusivos legados para agendamento.

  • Governança de dados:

    • Apenas tarefas SQL em nós EMR Hive, EMR Spark e EMR Spark SQL suportam geração de linhagem de dados. Para clusters versão 5.9.1 ou 3.43.1 e posteriores, esses nós suportam linhagem de dados tanto no nível de tabela quanto no nível de coluna.

      Nota

      Para nós Spark, a linhagem de dados no nível de tabela e de coluna é suportada em clusters EMR versão 5.8.0 ou 3.42.0 e posteriores. Em versões anteriores, apenas o Spark 2.x suporta linhagem de dados no nível de tabela.

    • Para gerenciar metadados de um cluster DataLake ou personalizado no DataWorks, configure primeiro o EMR-HOOK no cluster. Sem a configuração do EMR-HOOK, o DataWorks não consegue exibir metadados em tempo real, gerar logs de auditoria ou mostrar linhagem de dados. Atualmente, o EMR-HOOK é suportado apenas para os serviços EMR Hive e EMR Spark SQL. Para obter mais informações, consulte Configurar EMR-HOOK para Hive e Configurar EMR-HOOK para Spark SQL.

  • Em clusters EMR com autenticação Kerberos ativada, adicione uma regra de entrada no grupo de segurança para permitir acesso UDP a partir do bloco CIDR do vSwitch associado ao grupo de recursos.

    Nota

    Clique em no ícone image referente ao Cluster Security Group na aba Basic information do cluster EMR. Essa ação leva à página Security Group Details. Na aba Access Rules, clique em Inbound e, em seguida, clique em Added Manually. Defina Protocol Type como Custom UDP. No campo Port Range, insira a porta KDC especificada no arquivo /etc/krb5.conf do cluster EMR. Defina o Authorized object como o bloco CIDR do vSwitch associado ao grupo de recursos.

Observações de uso

  • Para isolar os ambientes de desenvolvimento e produção de um workspace do DataWorks no modo padrão, registre dois clusters EMR separados: um para o ambiente de desenvolvimento e outro para o ambiente de produção. Armazene os metadados desses clusters por meio de um dos seguintes métodos:

  • É possível registrar um cluster EMR em múltiplos workspaces dentro da mesma conta Alibaba Cloud, mas não em contas diferentes.

  • Para garantir que um grupo de recursos do DataWorks acesse um cluster EMR, caso o grupo de recursos ainda não consiga se conectar após vinculá-lo à mesma VPC e vSwitch do cluster EMR, verifique as regras do grupo de segurança do cluster. Adicione regras de entrada para o bloco CIDR do vSwitch e para as portas de componentes open source comuns. Para obter mais informações, consulte Gerenciar grupos de segurança de um cluster EMR.

Etapa 1: Acesse a página de registro de cluster

  1. Faça login no console do DataWorks. Na região desejada, clique em More > Management Center no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Management Center.

  2. No painel de navegação à esquerda, clique em Clusters para abrir a página Clusters. Clique em Register Cluster e defina Select Cluster Type como E-MapReduce. A página Register EMR Cluster será exibida.

Etapa 2: Registre um cluster EMR

Na página Register EMR Cluster, configure as informações do cluster.

Nota

Para workspaces no modo padrão, configure as informações do cluster separadamente para os ambientes de desenvolvimento e produção. Para obter mais informações sobre os modos de workspace, consulte Diferenças entre modos de workspace.

  • Display Name of Cluster: Insira um nome de exibição exclusivo para o cluster.

  • Alibaba Cloud Account To Which Cluster Belongs: Selecione a conta proprietária do cluster EMR.

    Nota

    Clusters EMR Serverless Spark não podem ser registrados entre contas diferentes.

Configure os parâmetros com base no tipo de conta selecionado.

Conta atual

Se o cluster pertence à Current Alibaba Cloud Account, configure os seguintes parâmetros:

Parâmetro

Descrição

Cluster Type

Selecione o tipo de cluster EMR a ser registrado. Para obter uma lista dos tipos de cluster suportados, consulte Limitações.

Cluster

Selecione o cluster EMR na conta atual que deseja registrar no DataWorks.

Nota

Se selecionar EMR Serverless Spark, siga as instruções na tela e consulte as descrições para selecionar um Workspace Created in EMR Serverless Spark (o cluster a ser registrado), uma versão padrão do mecanismo e uma fila de recursos padrão.

Default Access Identity

Especifique a identidade usada para acessar o cluster EMR no workspace atual.

  • Ambiente de desenvolvimento: Use a conta do cluster hadoop ou a conta do cluster mapeada para o executor da tarefa.

  • Ambiente de produção: Use a conta do cluster hadoop ou a conta do cluster mapeada para o proprietário da tarefa, conta Alibaba Cloud ou usuário RAM.

Nota

Ao selecionar uma identidade mapeada para uma conta de cluster (como proprietário da tarefa, conta Alibaba Cloud ou usuário RAM), configure manualmente os mapeamentos entre membros do DataWorks e contas específicas do cluster EMR. Para obter mais informações, consulte Configurar mapeamentos de identidade do cluster. Se uma identidade de acesso que exige mapeamento for usada para executar uma tarefa EMR no DataWorks, mas nenhum mapeamento específico estiver configurado, o DataWorks aplicará as seguintes políticas:

  • Se um usuário RAM executar a tarefa, o DataWorks executará a tarefa usando uma conta de sistema EMR com o mesmo nome do operador atual por padrão. Se o cluster tiver autenticação LDAP ou Kerberos ativada, a tarefa falhará.

  • Se uma conta Alibaba Cloud executar a tarefa, a tarefa do DataWorks reportará um erro.

Pass Proxy User Information

Especifique se as informações de usuário proxy devem ser transmitidas.

Nota

Quando um método de autenticação como LDAP ou Kerberos está ativado, o cluster emite uma credencial para cada usuário. Para centralizar o gerenciamento de permissões, use um superusuário (usuário real) para atuar como proxy de um usuário comum (usuário proxy) na autenticação. Quando um usuário proxy acessa o cluster, as credenciais de identidade do superusuário são utilizadas. Basta adicionar o usuário como um usuário proxy.

  • Transmitir: Ao executar tarefas no cluster EMR, as permissões de acesso a dados são verificadas e controladas com base no usuário proxy.

    • Data Studio e Data Analysis: O nome da conta Alibaba Cloud do executor da tarefa é transmitido dinamicamente como informação de usuário proxy.

    • Operation Center: O nome da conta Alibaba Cloud da identidade de acesso padrão configurada durante o registro do cluster é transmitido como informação de usuário proxy.

  • Não transmitir: Ao executar tarefas no cluster EMR, as permissões de acesso a dados são verificadas e controladas com base no método de autenticação configurado durante o registro do cluster.

As informações de usuário proxy são transmitidas das seguintes formas para diferentes tipos de tarefas EMR:

  • Tarefas EMR Kyuubi: transmitidas usando o parâmetro hive.server2.proxy.user.

  • Tarefas EMR Spark e tarefas EMR Spark SQL em modo não JDBC: transmitidas usando o parâmetro -proxy-user.

Configuration File

Se selecionar HADOOP como Cluster Type, obtenha os arquivos de configuração no console do EMR. Para obter mais informações, consulte Exportar e importar configurações de serviço. Após exportar os arquivos, renomeie-os conforme necessário na interface.

Na aba Basic Information da página de detalhes do cluster, clique em All Operations no canto superior direito. Na seção Cluster Services do menu suspenso, selecione Export Service Configuration.

Também é possível fazer login no cluster EMR e obter os arquivos de configuração nos seguintes caminhos:

/etc/ecm/hadoop-conf/core-site.xml
/etc/ecm/hadoop-conf/hdfs-site.xml
/etc/ecm/hadoop-conf/mapred-site.xml
/etc/ecm/hadoop-conf/yarn-site.xml
/etc/ecm/hive-conf/hive-site.xml
/etc/ecm/spark-conf/spark-defaults.conf
/etc/ecm/spark-conf/spark-env.sh

Outra conta

Se o cluster pertence a Another Alibaba Cloud Account, configure os seguintes parâmetros:

Parâmetro

Descrição

UID of Alibaba Cloud Account

Insira o UID da conta Alibaba Cloud proprietária do cluster EMR.

RAM Role

A função RAM usada para acessar o cluster EMR. A função deve atender aos seguintes requisitos:

  • A função RAM foi criada na outra conta Alibaba Cloud.

  • A função RAM na outra conta Alibaba Cloud possui permissões concedidas para acessar o serviço DataWorks na conta atual.

Nota

Para obter mais informações sobre como registrar um cluster EMR pertencente a uma conta diferente, consulte Cenário: Registrar um cluster EMR pertencente a uma conta diferente.

EMR Cluster Type

Selecione o tipo de cluster EMR a ser registrado. Para registro entre contas, apenas EMR on ECS: DataLake cluster, EMR on ECS: Hadoop cluster e EMR on ECS: Custom cluster são suportados.

EMR Cluster

Selecione o cluster EMR nessa conta que deseja registrar no DataWorks.

Configuration File

Configure cada arquivo de configuração conforme solicitado na interface. Para detalhes sobre como obter arquivos de configuração, consulte Exportar e importar configurações de serviço. Após exportar os arquivos, renomeie-os conforme necessário na interface.

Na aba Basic Information da página de detalhes do cluster, clique em All Operations no canto superior direito. Na seção Cluster Services do menu suspenso, selecione Export Service Configuration.

Também é possível fazer login no cluster EMR e obter os arquivos de configuração nos seguintes caminhos:

/etc/ecm/hadoop-conf/core-site.xml
/etc/ecm/hadoop-conf/hdfs-site.xml
/etc/ecm/hadoop-conf/mapred-site.xml
/etc/ecm/hadoop-conf/yarn-site.xml
/etc/ecm/hive-conf/hive-site.xml
/etc/ecm/spark-conf/spark-defaults.conf
/etc/ecm/spark-conf/spark-env.sh

Default Access Identity

Especifique a identidade usada para acessar o cluster EMR no workspace atual.

  • Ambiente de desenvolvimento: Use a conta do cluster hadoop ou a conta do cluster mapeada para o proprietário da tarefa.

  • Ambiente de produção: Use a conta do cluster hadoop ou a conta do cluster mapeada para o proprietário da tarefa, conta Alibaba Cloud ou usuário RAM.

Nota

Ao selecionar uma identidade mapeada para uma conta de cluster (como proprietário da tarefa, conta Alibaba Cloud ou usuário RAM), configure manualmente os mapeamentos entre membros do DataWorks e contas específicas do cluster EMR. Para obter mais informações, consulte Configurar mapeamentos de identidade do cluster. Se uma identidade de acesso que exige mapeamento for usada para executar uma tarefa EMR no DataWorks, mas nenhum mapeamento específico estiver configurado, o DataWorks aplicará as seguintes políticas:

  • Se um usuário RAM executar a tarefa, o DataWorks executará a tarefa usando uma conta de sistema EMR com o mesmo nome do operador atual por padrão. Se o cluster tiver autenticação LDAP ou Kerberos ativada, a tarefa falhará.

  • Se uma conta Alibaba Cloud executar a tarefa, a tarefa do DataWorks reportará um erro.

Pass Proxy User Information

Especifique se as informações de usuário proxy devem ser transmitidas.

Nota

Quando um método de autenticação como LDAP ou Kerberos está ativado, o cluster emite uma credencial para cada usuário. Para centralizar o gerenciamento de permissões, use um superusuário (usuário real) para atuar como proxy de um usuário comum (usuário proxy) na autenticação. Quando um usuário proxy acessa o cluster, as credenciais de identidade do superusuário são utilizadas. Basta adicionar o usuário como um usuário proxy.

  • Transmitir: Ao executar tarefas no cluster EMR, as permissões de acesso a dados são verificadas e controladas com base no usuário proxy.

    • Data Studio e Data Analysis: O nome da conta Alibaba Cloud do executor da tarefa é transmitido dinamicamente como informação de usuário proxy.

    • Operation Center: O nome da conta Alibaba Cloud da identidade de acesso padrão configurada durante o registro do cluster é transmitido como informação de usuário proxy.

  • Não transmitir: Ao executar tarefas no cluster EMR, as permissões de acesso a dados são verificadas e controladas com base no método de autenticação configurado durante o registro do cluster.

As informações de usuário proxy são transmitidas das seguintes formas para diferentes tipos de tarefas EMR:

  • Tarefas EMR Kyuubi: transmitidas usando o parâmetro hive.server2.proxy.user.

  • Tarefas EMR Spark e tarefas EMR Spark SQL em modo não JDBC: transmitidas usando o parâmetro -proxy-user.

Etapa 3: Inicialize um grupo de recursos

Inicialize o grupo de recursos após registrar um cluster pela primeira vez, alterar configurações de serviço do cluster ou atualizar a versão de um componente (por exemplo, modificando core-site.xml). Isso garante que o grupo de recursos acesse o EMR e que as tarefas EMR sejam executadas com a configuração atual do ambiente.

  1. Na página Open Source Clusters, selecione a aba correspondente ao cluster EMR registrado e clique em Initialize Resource Group.

  2. Localize o grupo de recursos desejado e clique em Initialize na coluna Actions.

    É possível inicializar um grupo de recursos serverless ou um grupo de recursos exclusivo legado para agendamento.
  3. Aguarde de 1 a 2 minutos até que a inicialização seja concluída e clique em OK.

Importante
  • Se a inicialização falhar, utilize a ferramenta de diagnóstico de conectividade para solucionar a causa.

  • A inicialização pode causar falhas em tarefas em execução. A menos que uma reinicialização imediata seja necessária, por exemplo, para evitar falhas generalizadas de tarefas após uma alteração de configuração, recomendamos inicializar o grupo de recursos fora dos horários de pico.

Próximas etapas