Para desenvolver e gerenciar tarefas do E-MapReduce (EMR) no DataWorks, associe seu cluster EMR ao DataWorks como um recurso de computação EMR. Após a associação, use o recurso de computação no DataWorks para sincronização de dados, desenvolvimento e outras operações.
Pré-requisitos
Um workspace foi criado no DataWorks, e o usuário RAM que executa a operação foi adicionado ao workspace com a função de administrador do workspace.
-
-
Tipos de cluster suportados:
-
Associe este recurso de computação apenas a um workspace que utilize Use Data Studio (New Version).
NotaPara workspaces que não utilizam Use Use Data Studio (New Version), associe o recurso em Clusters. Para mais informações, consulte Associar um recurso de computação EMR (versão legada).
-
-
Um grupo de recursos está associado ao workspace e a conectividade de rede está estabelecida.
Se utilizar um grupo de recursos serverless, garanta que o recurso de computação EMR possa se conectar ao grupo de recursos serverless.
Se utilizar um grupo de recursos exclusivo legado, assegure-se de que o recurso de computação EMR tenha conectividade com o grupo de recursos exclusivo para agendamento correspondente ao caso de uso.
Limitações
-
Limitações do produto:
-
Em clusters EMR com autenticação Kerberos ativada, o grupo de segurança deve permitir tráfego UDP de entrada proveniente do bloco CIDR do vSwitch associado ao grupo de recursos.
NotaClique em
ao lado de Cluster Security Group na seção Basic information do cluster EMR para acessar a aba Security Group Details. Clique em Access Rule > Inbound, selecione Added Manually e defina Protocol Type como Custom UDP. No campo Port Range, verifique a porta KDC no arquivo /etc/krb5.confdo cluster EMR. Defina Authorized object como o bloco CIDR do vSwitch associado ao grupo de recursos. -
Para gerenciar metadados no DataWorks em clusters DataLake ou Personalizados, configure o EMR-HOOK no lado do cluster ou ao configurar parâmetros do Spark. Sem a configuração do EMR-HOOK, o DataWorks não exibe metadados em tempo real, não gera logs de auditoria nem linhagem de dados, impedindo a execução de tarefas de governança relacionadas ao EMR. Atualmente, apenas os serviços EMR Hive e EMR Spark SQL suportam a configuração do EMR-HOOK. Para mais detalhes, consulte Configurar EMR-HOOK para Hive e Configurar EMR-HOOK para Spark SQL.
NotaA configuração do EMR-HOOK para Hive pode ser concluída no console do E-MapReduce. Após concluir a configuração, não é necessário reinicializar o grupo de recursos.
-
Existem duas formas de configurar o EMR-HOOK para Spark SQL:
Configure diretamente no console do E-MapReduce. Este método exige a reinicialização do grupo de recursos.
Configure no recurso de computação ao definir parâmetros de propriedade do Spark. Esta opção não requer a reinicialização do grupo de recursos.
-
Limitações de região: China (Hangzhou), China (Shanghai), China (Beijing), China (Shenzhen), China (Chengdu), China (Hong Kong), Japão (Tóquio), Singapura, Malásia (Kuala Lumpur), Indonésia (Jacarta), Alemanha (Frankfurt), Reino Unido (Londres), EUA (Vale do Silício) e EUA (Virgínia).
-
Limitações de permissão:
Operador
Permissões necessárias
Conta Alibaba Cloud
Nenhuma autorização adicional é necessária.
Usuário RAM ou função RAM
Apenas membros do workspace com a função de operador ou administrador do workspace, ou que possuam a permissão
AliyunDataWorksFullAccess, podem criar recursos de computação. Para mais informações, consulte Conceder a função de administrador do workspace a um usuário.
Observações
-
O DataWorks suporta as seguintes versões de clusters Hadoop (data lake legado) do EMR:
EMR-3.38.2,EMR-3.38.3,EMR-4.9.0,EMR-5.6.0,EMR-3.26.3,EMR-3.27.2,EMR-3.29.0,EMR-3.32.0,EMR-3.35.0,EMR-4.3.0,EMR-4.4.1,EMR-4.5.0,EMR-4.5.1,EMR-4.6.0,EMR-4.8.0,EMR-5.2.1eEMR-5.4.3. Clusters Hadoop (data lake legado) não são mais recomendados. Migre para clusters DataLake o quanto antes. Para mais informações, consulte Migrar de um cluster Hadoop para um cluster DataLake.
Acessar a página da lista de recursos de computação
Faça login no console do DataWorks. No painel de navegação à esquerda, alterne para a região desejada e clique em . Selecione seu workspace na lista suspensa e clique em Go to Management Center.
No painel de navegação à esquerda, clique em Computing Resources para abrir a página da lista de recursos de computação.
Associar um recurso de computação EMR
Na página da lista de recursos de computação, configure e associe o recurso de computação EMR.
-
Selecione o tipo de recurso de computação a ser associado.
Clique em Associate Computing Resources para acessar a página Associate Computing Resources.
Na página Associate Computing Resources, defina o tipo de recurso de computação como EMR para ir à página de configuração Associate EMR Computing Resource.
-
Configure o recurso de computação EMR.
Na página de configuração Associate EMR Computing Resource, defina os seguintes parâmetros.
Parâmetro
Descrição
Alibaba Cloud Account to Which Cluster Belongs
Selecione Current Alibaba Cloud Account ou Another Alibaba Cloud Account.
NotaAo selecionar Another Alibaba Cloud Account, siga as instruções em Usar um cluster EMR entre contas Alibaba Cloud para autorizar as contas relevantes e, em seguida, configure os parâmetros necessários conforme solicitado.
Cluster Type
Escolha o tipo de cluster de acordo com seus requisitos de negócio.
NotaTipos de cluster suportados:
Cluster
Selecione o cluster EMR desejado dentro do tipo de cluster correspondente.
Default Access Identity
-
Ambiente de desenvolvimento: Use a conta do cluster
hadoopou a conta do cluster mapeada para o executor da tarefa. -
Ambiente de produção: Use a conta do cluster
hadoopou a conta do cluster mapeada para o proprietário da tarefa, conta Alibaba Cloud ou usuário RAM.NotaQuando a identidade de acesso padrão estiver definida como a conta do cluster mapeada para o proprietário da tarefa, conta Alibaba Cloud ou usuário RAM, consulte Configurar mapeamento de contas entre DataWorks e EMR para definir manualmente o mapeamento entre membros do tenant do DataWorks e contas do cluster EMR. As tarefas EMR são executadas no DataWorks usando a conta do cluster mapeada. Caso nenhum mapeamento esteja configurado entre os membros do tenant do DataWorks e as contas do cluster, o DataWorks procederá da seguinte forma:
-
Se um usuário RAM (subconta) executar a tarefa: O DataWorks usa, por padrão, a conta de sistema do cluster EMR com o mesmo nome do operador atual. Se a autenticação LDAP ou Kerberos estiver ativada no cluster, a tarefa falhará.
-
Se uma conta Alibaba Cloud executar a tarefa: A tarefa do DataWorks retornará um erro.
-
Pass Proxy User Information
Define se as informações do Usuário Proxy devem ser transmitidas.
NotaQuando LDAP, Kerberos ou outro método de autenticação está ativado, o cluster emite uma credencial de autenticação para cada usuário comum. Para gerenciar permissões de forma centralizada, use um superusuário (usuário real) para atuar como proxy dos usuários comuns (usuários proxy) durante a autenticação. Nesse cenário, quando um usuário proxy acessa o cluster, as informações de autenticação do superusuário são utilizadas. Basta adicionar o usuário como um usuário proxy.
-
Transmitir: Ao executar tarefas no cluster EMR, as permissões de acesso a dados são verificadas e controladas com base no Usuário Proxy.
-
Data Studio e Análise de Dados: O nome da conta Alibaba Cloud do executor da tarefa é transmitido dinamicamente como informação do Usuário Proxy.
-
Operation Center: O nome da conta Alibaba Cloud da identidade de acesso padrão configurada durante o registro do cluster é transmitido como informação fixa do Usuário Proxy.
-
-
Não transmitir: Ao executar tarefas no cluster EMR, as permissões de acesso a dados são verificadas e controladas com base no método de autenticação de conta configurado durante o registro do cluster.
A transmissão das informações do Usuário Proxy varia conforme o tipo de tarefa EMR:
-
Tarefas EMR Kyuubi: As informações são transmitidas por meio do item de configuração
hive.server2.proxy.user. -
Tarefas EMR Spark e tarefas EMR Spark SQL em modo não JDBC: As informações são transmitidas por meio do item de configuração
-proxy-user.
Arquivos de configuração
Quando o tipo de cluster for definido como HADOOP, obtenha os arquivos de configuração no console do EMR. Para mais informações, consulte Exportar arquivos de configuração do cluster EMR. Após exportar os arquivos, renomeie-os conforme instruído na página de configuração.
Alternativamente, faça login no cluster EMR e obtenha os arquivos de configuração nos seguintes caminhos:
/etc/ecm/hadoop-conf/core-site.xml /etc/ecm/hadoop-conf/hdfs-site.xml /etc/ecm/hadoop-conf/mapred-site.xml /etc/ecm/hadoop-conf/yarn-site.xml /etc/ecm/hive-conf/hive-site.xml /etc/ecm/spark-conf/spark-defaults.conf /etc/ecm/spark-conf/spark-env.shComputing Resource Instance Name
Personalize o nome da instância do recurso de computação. Durante a execução de uma tarefa, selecione o recurso de computação pelo nome.
-
Clique em Confirm para concluir a configuração do recurso de computação EMR.
Inicialização do grupo de recursos
Ao registrar um cluster pela primeira vez, modificar a configuração de serviço do cluster ou atualizar a versão de um componente (por exemplo, modificar core-site.xml), inicialize o grupo de recursos. Isso garante que o grupo de recursos acesse o cluster EMR corretamente por meio da configuração de conectividade de rede.
Na página de lista de Computing Resources, localize o recurso de computação EMR criado. Clique em Initialize Resource Group no canto superior direito.
Clique em Initialize ao lado do grupo de recursos desejado. Após a inicialização do grupo de recursos, clique em Determine.
(Opcional) Configurar filas de recursos YARN
Na página de lista de Computing Resources, localize o cluster EMR associado. Na aba YARN Resource Queue, clique em Edit YARN Resource Queue para configurar filas de recursos YARN para tarefas em diferentes módulos.
(Opcional) Configurar parâmetros do Spark
Defina parâmetros de propriedade do Spark específicos para tarefas em diferentes módulos.
Na página de lista de Computing Resources, localize o cluster EMR associado.
Clique em Spark-related Parameter e, em seguida, clique em Edit Spark Parameters para acessar a página de edição de parâmetros do Spark para o cluster EMR.
Clique em Add abaixo de um módulo, insira o Spark Property Name e o Spark Property Value correspondente para configurar parâmetros de propriedade do Spark para tarefas em diferentes módulos.
Próximos passos
Configurar informações de conexão do Kyuubi: Caso deseje usar uma conta e senha personalizadas para fazer login no Kyuubi e executar tarefas, consulte este documento para personalizar as informações de conexão do Kyuubi.
Após configurar o recurso de computação EMR, execute operações de desenvolvimento de dados usando nós relacionados ao EMR no Data Studio.