O DataWorks permite criar nós como Hive, MapReduce (MR), Presto e Spark SQL em um cluster E-MapReduce (EMR) para configurar fluxos de trabalho de tarefas, agendar jobs e gerenciar metadados. Este tópico descreve como registrar um cluster EMR pertencente à mesma conta Alibaba Cloud ou a uma conta diferente.
Contexto
A plataforma de desenvolvimento de big data open source E-MapReduce (EMR) é uma solução de processamento de big data executada na plataforma Alibaba Cloud.
Baseado no Apache Hadoop e Apache Spark open source, o EMR permite utilizar outros sistemas desses ecossistemas para analisar e processar dados. O EMR também transfere dados de e para outros serviços da Alibaba Cloud, como Object Storage Service (OSS) e RDS. O Alibaba Cloud EMR está disponível em vários formatos, incluindo on ECS, on ACK e serverless, para atender a diferentes necessidades dos usuários.
Ao executar tarefas do EMR no DataWorks, escolha entre diversos componentes do EMR. A configuração ideal varia conforme o componente. Ao configurar um cluster EMR, consulte as Recomendações de configuração de cluster EMR e selecione uma opção com base nos seus requisitos reais.
Tipos de cluster suportados
Limitações
-
Permissões: Apenas usuários RAM ou funções RAM com as identidades abaixo podem registrar um cluster EMR. Para conceder essas permissões, consulte Conceder permissões a um usuário RAM.
Uma conta Alibaba Cloud.
Um usuário RAM ou função RAM com a função DataWorks Workspace Administrator e a política AliyunEMRFullAccess.
Um usuário RAM ou função RAM com as políticas AliyunDataWorksFullAccess e AliyunEMRFullAccess.
Região: O EMR Serverless Spark está disponível apenas em China (Hangzhou), China (Shanghai), China (Beijing), China (Shenzhen), China (Chengdu), China (Hong Kong), Japão (Tóquio), Singapura, Indonésia (Jacarta), Alemanha (Frankfurt) e EUA (Virgínia).
Tipo de tarefa: O DataWorks não suporta tarefas EMR Flink.
Execução de tarefas: O DataWorks suporta a execução de tarefas EMR usando grupos de recursos serverless (recomendado) ou grupos de recursos exclusivos legados para agendamento.
-
Governança de dados:
-
Apenas tarefas SQL em nós EMR Hive, EMR Spark e EMR Spark SQL suportam geração de linhagem de dados. Para clusters versão 5.9.1 ou 3.43.1 e posteriores, esses nós suportam linhagem de dados tanto no nível de tabela quanto no nível de coluna.
NotaPara nós Spark, a linhagem de dados no nível de tabela e de coluna é suportada em clusters EMR versão 5.8.0 ou 3.42.0 e posteriores. Em versões anteriores, apenas o Spark 2.x suporta linhagem de dados no nível de tabela.
Para gerenciar metadados de um cluster DataLake ou personalizado no DataWorks, configure primeiro o EMR-HOOK no cluster. Sem a configuração do EMR-HOOK, o DataWorks não consegue exibir metadados em tempo real, gerar logs de auditoria ou mostrar linhagem de dados. Atualmente, o EMR-HOOK é suportado apenas para os serviços EMR Hive e EMR Spark SQL. Para obter mais informações, consulte Configurar EMR-HOOK para Hive e Configurar EMR-HOOK para Spark SQL.
-
-
Em clusters EMR com autenticação Kerberos ativada, adicione uma regra de entrada no grupo de segurança para permitir acesso UDP a partir do bloco CIDR do vSwitch associado ao grupo de recursos.
NotaClique em no ícone
referente ao Cluster Security Group na aba Basic information do cluster EMR. Essa ação leva à página Security Group Details. Na aba Access Rules, clique em Inbound e, em seguida, clique em Added Manually. Defina Protocol Type como Custom UDP. No campo Port Range, insira a porta KDC especificada no arquivo /etc/krb5.confdo cluster EMR. Defina o Authorized object como o bloco CIDR do vSwitch associado ao grupo de recursos.
Observações de uso
-
Para isolar os ambientes de desenvolvimento e produção de um workspace do DataWorks no modo padrão, registre dois clusters EMR separados: um para o ambiente de desenvolvimento e outro para o ambiente de produção. Armazene os metadados desses clusters por meio de um dos seguintes métodos:
Método 1 (recomendado para soluções de data lake): Armazene os metadados em dois catálogos diferentes no Data Lake Formation (DLF). Para obter mais informações, consulte Alternar o tipo de armazenamento de metadados.
Método 2: Armazene os metadados em dois bancos de dados diferentes no RDS. Para obter mais informações, consulte Configurar uma instância RDS autogerenciada.
É possível registrar um cluster EMR em múltiplos workspaces dentro da mesma conta Alibaba Cloud, mas não em contas diferentes.
Para garantir que um grupo de recursos do DataWorks acesse um cluster EMR, caso o grupo de recursos ainda não consiga se conectar após vinculá-lo à mesma VPC e vSwitch do cluster EMR, verifique as regras do grupo de segurança do cluster. Adicione regras de entrada para o bloco CIDR do vSwitch e para as portas de componentes open source comuns. Para obter mais informações, consulte Gerenciar grupos de segurança de um cluster EMR.
Etapa 1: Acesse a página de registro de cluster
-
Faça login no console do DataWorks. Na região desejada, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Management Center.
No painel de navegação à esquerda, clique em Clusters para abrir a página Clusters. Clique em Register Cluster e defina Select Cluster Type como E-MapReduce. A página Register EMR Cluster será exibida.
Etapa 2: Registre um cluster EMR
Na página Register EMR Cluster, configure as informações do cluster.
Para workspaces no modo padrão, configure as informações do cluster separadamente para os ambientes de desenvolvimento e produção. Para obter mais informações sobre os modos de workspace, consulte Diferenças entre modos de workspace.
Display Name of Cluster: Insira um nome de exibição exclusivo para o cluster.
-
Alibaba Cloud Account To Which Cluster Belongs: Selecione a conta proprietária do cluster EMR.
NotaClusters EMR Serverless Spark não podem ser registrados entre contas diferentes.
Configure os parâmetros com base no tipo de conta selecionado.
Conta atual
Se o cluster pertence à Current Alibaba Cloud Account, configure os seguintes parâmetros:
|
Parâmetro |
Descrição |
|
Cluster Type |
Selecione o tipo de cluster EMR a ser registrado. Para obter uma lista dos tipos de cluster suportados, consulte Limitações. |
|
Cluster |
Selecione o cluster EMR na conta atual que deseja registrar no DataWorks. Nota
Se selecionar EMR Serverless Spark, siga as instruções na tela e consulte as descrições para selecionar um Workspace Created in EMR Serverless Spark (o cluster a ser registrado), uma versão padrão do mecanismo e uma fila de recursos padrão. |
|
Default Access Identity |
Especifique a identidade usada para acessar o cluster EMR no workspace atual.
Nota
Ao selecionar uma identidade mapeada para uma conta de cluster (como proprietário da tarefa, conta Alibaba Cloud ou usuário RAM), configure manualmente os mapeamentos entre membros do DataWorks e contas específicas do cluster EMR. Para obter mais informações, consulte Configurar mapeamentos de identidade do cluster. Se uma identidade de acesso que exige mapeamento for usada para executar uma tarefa EMR no DataWorks, mas nenhum mapeamento específico estiver configurado, o DataWorks aplicará as seguintes políticas:
|
|
Pass Proxy User Information |
Especifique se as informações de usuário proxy devem ser transmitidas. Nota
Quando um método de autenticação como LDAP ou Kerberos está ativado, o cluster emite uma credencial para cada usuário. Para centralizar o gerenciamento de permissões, use um superusuário (usuário real) para atuar como proxy de um usuário comum (usuário proxy) na autenticação. Quando um usuário proxy acessa o cluster, as credenciais de identidade do superusuário são utilizadas. Basta adicionar o usuário como um usuário proxy.
As informações de usuário proxy são transmitidas das seguintes formas para diferentes tipos de tarefas EMR:
|
|
Configuration File |
Se selecionar HADOOP como Cluster Type, obtenha os arquivos de configuração no console do EMR. Para obter mais informações, consulte Exportar e importar configurações de serviço. Após exportar os arquivos, renomeie-os conforme necessário na interface. Na aba Basic Information da página de detalhes do cluster, clique em All Operations no canto superior direito. Na seção Cluster Services do menu suspenso, selecione Export Service Configuration. Também é possível fazer login no cluster EMR e obter os arquivos de configuração nos seguintes caminhos:
|
Outra conta
Se o cluster pertence a Another Alibaba Cloud Account, configure os seguintes parâmetros:
|
Parâmetro |
Descrição |
|
UID of Alibaba Cloud Account |
Insira o UID da conta Alibaba Cloud proprietária do cluster EMR. |
|
RAM Role |
A função RAM usada para acessar o cluster EMR. A função deve atender aos seguintes requisitos:
Nota
Para obter mais informações sobre como registrar um cluster EMR pertencente a uma conta diferente, consulte Cenário: Registrar um cluster EMR pertencente a uma conta diferente. |
|
EMR Cluster Type |
Selecione o tipo de cluster EMR a ser registrado. Para registro entre contas, apenas |
|
EMR Cluster |
Selecione o cluster EMR nessa conta que deseja registrar no DataWorks. |
|
Configuration File |
Configure cada arquivo de configuração conforme solicitado na interface. Para detalhes sobre como obter arquivos de configuração, consulte Exportar e importar configurações de serviço. Após exportar os arquivos, renomeie-os conforme necessário na interface. Na aba Basic Information da página de detalhes do cluster, clique em All Operations no canto superior direito. Na seção Cluster Services do menu suspenso, selecione Export Service Configuration. Também é possível fazer login no cluster EMR e obter os arquivos de configuração nos seguintes caminhos:
|
|
Default Access Identity |
Especifique a identidade usada para acessar o cluster EMR no workspace atual.
Nota
Ao selecionar uma identidade mapeada para uma conta de cluster (como proprietário da tarefa, conta Alibaba Cloud ou usuário RAM), configure manualmente os mapeamentos entre membros do DataWorks e contas específicas do cluster EMR. Para obter mais informações, consulte Configurar mapeamentos de identidade do cluster. Se uma identidade de acesso que exige mapeamento for usada para executar uma tarefa EMR no DataWorks, mas nenhum mapeamento específico estiver configurado, o DataWorks aplicará as seguintes políticas:
|
|
Pass Proxy User Information |
Especifique se as informações de usuário proxy devem ser transmitidas. Nota
Quando um método de autenticação como LDAP ou Kerberos está ativado, o cluster emite uma credencial para cada usuário. Para centralizar o gerenciamento de permissões, use um superusuário (usuário real) para atuar como proxy de um usuário comum (usuário proxy) na autenticação. Quando um usuário proxy acessa o cluster, as credenciais de identidade do superusuário são utilizadas. Basta adicionar o usuário como um usuário proxy.
As informações de usuário proxy são transmitidas das seguintes formas para diferentes tipos de tarefas EMR:
|
Etapa 3: Inicialize um grupo de recursos
Inicialize o grupo de recursos após registrar um cluster pela primeira vez, alterar configurações de serviço do cluster ou atualizar a versão de um componente (por exemplo, modificando core-site.xml). Isso garante que o grupo de recursos acesse o EMR e que as tarefas EMR sejam executadas com a configuração atual do ambiente.
Na página Open Source Clusters, selecione a aba correspondente ao cluster EMR registrado e clique em Initialize Resource Group.
-
Localize o grupo de recursos desejado e clique em Initialize na coluna Actions.
É possível inicializar um grupo de recursos serverless ou um grupo de recursos exclusivo legado para agendamento.
Aguarde de 1 a 2 minutos até que a inicialização seja concluída e clique em OK.
Se a inicialização falhar, utilize a ferramenta de diagnóstico de conectividade para solucionar a causa.
A inicialização pode causar falhas em tarefas em execução. A menos que uma reinicialização imediata seja necessária, por exemplo, para evitar falhas generalizadas de tarefas após uma alteração de configuração, recomendamos inicializar o grupo de recursos fora dos horários de pico.
Próximas etapas
Desenvolvimento de dados: Siga o guia de fluxo de trabalho de desenvolvimento de dados para configurar os ambientes dos componentes.
Configurar mapeamentos de identidade do cluster: Caso a identidade de acesso padrão do cluster EMR não seja a conta
hadoop, configure os mapeamentos de identidade para controlar quais recursos os usuários RAM podem acessar no DataWorks para fins de gerenciamento de permissões.Definir filas globais de recursos YARN: Utilize mapeamentos de filas de recursos YARN para especificar qual fila YARN cada módulo usa. Essas configurações também podem substituir as configurações individuais dos módulos.
Definir parâmetros globais do Spark: Personalize os parâmetros globais do Spark com base na documentação oficial do Spark. Também é possível especificar se as configurações no nível de workspace substituem as configurações específicas do módulo para parâmetros com o mesmo nome.
Definir informações de conexão do Kyuubi: Para usar uma conta e senha personalizadas nas tarefas Kyuubi, personalize as informações de conexão conforme descrito neste tópico.