Para desenvolver e gerenciar tarefas em um cluster Cloudera Distribution Including Apache Hadoop (CDH) no DataWorks, registre o cluster como recurso de computação. Após o registro, o recurso fica disponível para tarefas de sincronização e desenvolvimento de dados.
Regiões disponíveis: China (Beijing), China (Shanghai), China (Shenzhen), China (Hangzhou), China (Zhangjiakou), China (Chengdu) e Alemanha (Frankfurt).
Pré-requisitos
Antes de começar, verifique se você tem:
Um usuário RAM adicionado ao workspace com a função Workspace Administrator.
Um cluster CDH implantado. O DataWorks oferece suporte a clusters CDH implantados fora do Alibaba Cloud ECS, desde que o ambiente esteja conectado a uma Virtual Private Cloud (VPC) da Alibaba Cloud. Consulte Conectividade de rede para fontes de dados IDC.
-
Um grupo de recursos associado ao workspace com conectividade de rede confirmada:
Se usar um grupo de recursos serverless, verifique a conectividade entre os recursos de computação CDH e o grupo de recursos serverless.
Se usar grupos de recursos exclusivos legados, verifique a conectividade entre os recursos de computação CDH e o grupo de recursos exclusivo para agendamento.
Permissões
|
Operador |
Permissões necessárias |
|
Conta Alibaba Cloud |
Nenhuma |
|
Usuário RAM ou função RAM |
Funções O&M e Workspace administrator, ou a permissão |
Acessar a lista de recursos de computação
Faça login no console do DataWorks e selecione a região de destino.
No painel de navegação à esquerda, escolha More > Management Center. Selecione seu workspace e clique em Go To Management Center.
No painel de navegação à esquerda, clique em Computing Resource.
Associar um recurso de computação CDH
Na página Computing Resource, clique em Associate Computing Resource.
Na página Associate Computing Resource, defina o tipo de recurso de computação como CDH. Você será redirecionado para a página Associate CDH Computing Resource.
Configure os parâmetros descritos abaixo e clique em Confirm.
Versão e nome do cluster
|
Parâmetro |
Descrição |
|
Cluster version |
Versão do CDH ou CDP a ser registrada. Para versões compatíveis e suas respectivas versões fixas de componentes, consulte Informações de conexão do cluster. Selecione Custom version para especificar as versões dos componentes manualmente. |
|
Cluster name |
Selecione um cluster existente registrado em outro workspace para carregar sua configuração ou insira um nome para criar uma nova configuração. |
|
Computing resource instance name |
Nome de exibição deste recurso de computação. Durante a execução, as tarefas referenciam os recursos de computação por este nome. |
Clusters com versão personalizada oferecem suporte apenas a grupos de recursos exclusivos legados para agendamento. Após o registro, envie um ticket para inicializar o ambiente.
Informações de conexão do cluster
Configure os endpoints de conexão dos componentes Hadoop que suas tarefas utilizarão. O sistema detecta automaticamente as versões dos componentes para a versão do cluster selecionada.
|
Componente |
Formato de conexão |
Quando configurar |
|
Hive — HiveServer2 |
|
Enviar jobs do Hive |
|
Hive — Metastore |
|
Enviar jobs do Hive |
|
Impala |
|
Enviar jobs do Impala |
|
Spark |
Selecione uma versão padrão na lista |
Executar tarefas do Spark |
|
YARN — Endereço do ResourceManager |
|
Enviar tarefas Spark ou MapReduce |
|
YARN — Endereço webapp do JobHistory |
|
Visualizar detalhes históricos de tarefas na interface web do JobHistory Server |
|
MapReduce |
Selecione uma versão padrão na lista |
Executar tarefas MapReduce |
|
Presto |
|
Enviar jobs do Presto (não é um componente padrão do CDH) |
Para consultar os parâmetros de conexão do seu cluster, consulte Obter informações do cluster CDH ou CDP e configurar conectividade de rede.
Se usar um grupo de recursos serverless e acessar componentes CDH por nome de domínio, configure a resolução autoritativa para os nomes de domínio dos componentes CDH e defina seu escopo efetivo no Alibaba Cloud DNS PrivateZone.
Arquivos de configuração do cluster
Faça upload dos arquivos de configuração correspondentes às tarefas que você planeja executar.
|
Arquivo |
Descrição |
Fazer upload quando |
|
Arquivo Core-site |
Configurações globais de I/O do Hadoop Distributed File System (HDFS) e MapReduce |
Executar tarefas Spark ou MapReduce |
|
Arquivo Hdfs-site |
Configurações do HDFS: tamanho de bloco, fator de replicação e nomes de caminho |
— |
|
Arquivo Mapred-site |
Modo de execução e comportamento de agendamento do MapReduce |
Executar tarefas MapReduce |
|
Arquivo Yarn-site |
Configurações de runtime do gerenciador de recursos YARN, gerenciador de nós e aplicativos |
Executar tarefas Spark ou MapReduce, ou usar mapeamento de conta Kerberos |
|
Arquivo Hive-site |
Configurações de conexão de banco de dados Hive, metastore e mecanismo de execução |
Usar mapeamento de conta Kerberos |
|
Arquivo Spark-defaults |
Configurações padrão de jobs Spark ( |
Executar tarefas Spark |
|
Arquivo Config.properties |
Configurações de coordenador Presto e nós worker |
Usar Presto com autenticação OPEN LDAP ou Kerberos |
|
Arquivo Presto.jks |
Certificados SSL/TLS para comunicação criptografada do Presto |
— |
Identidade de acesso padrão
Defina a identidade do cluster usada durante a execução de tarefas no cluster CDH. Para configurar mapeamentos de identidade, acesse a aba Account Mapping na página Computing Resources. Consulte Definir o mapeamento de identidade do cluster.
|
Ambiente |
Opções disponíveis |
|
Ambiente de desenvolvimento |
Conta do cluster; Conta mapeada do cluster do executor da tarefa |
|
Ambiente de produção |
Conta do cluster; Conta mapeada do cluster do proprietário da tarefa; Conta mapeada do cluster da conta Alibaba Cloud; Conta mapeada do cluster do usuário RAM |
Inicializar o grupo de recursos
Inicialize o grupo de recursos ao registrar um cluster pela primeira vez ou após alterar configurações de serviço do cluster (por exemplo, ao modificar core-site.xml). A inicialização garante que o grupo de recursos consiga alcançar o cluster CDH após a configuração da conectividade de rede.
Na página Computing Resource, localize o recurso de computação CDH criado.
No canto superior direito, clique em Initialize Resource Group.
Clique em Initialize ao lado do grupo de recursos desejado e, em seguida, clique em OK.
Mais operações
Definir uma fila de recursos YARN (opcional)
Na página Computing Resource, localize o cluster CDH. Na aba YARN Resource Queue, clique em EditYARN Resource Queue para atribuir filas dedicadas de recursos YARN às tarefas em diferentes módulos.
Definir parâmetros do Spark (opcional)
Na página Computing Resource, localize o cluster CDH. Na aba Spark-related Parameter, clique em EditSpark-related Parameter. Clique em Add sob o módulo alvo, insira o Spark Property Name e o Spark Property Value. Para obter uma lista completa das propriedades do Spark, consulte Configuração do Spark.
Configurar mapeamentos de host para autenticação Kerberos (opcional)
Ao usar um grupo de recursos serverless com um cluster CDH com autenticação Kerberos habilitada, o envio de tarefas pode falhar se o DNS não conseguir resolver um endereço IP do cluster para o nome de host registrado no Kerberos.
O recurso Host Configuration permite definir uma tabela estática de mapeamento IP-para-hostname para o recurso de computação. O DataWorks usa esse mapeamento ao acessar seu cluster CDH, garantindo o sucesso da autenticação Kerberos.
Para configurar mapeamentos de host:
Na página Computing Resource, localize o recurso de computação CDH e clique em Host Configuration.
-
Na caixa de diálogo, insira os mapeamentos no seguinte formato. Cada linha representa um registro de mapeamento:
<IP address> <Hostname>Separe o endereço IP e o nome do host com um ou mais espaços. Configure mapeamentos para todos os nós principais envolvidos na autenticação Kerberos e na execução de tarefas, incluindo NameNode, ResourceManager e NodeManagers.
Clique em OK para salvar. Os nomes de host configurados aparecem no cartão do recurso de computação, confirmando que a configuração está ativa.
A configuração de host aplica-se apenas ao recurso de computação atual e não afeta outros recursos de computação no workspace.
Próximos passos
Após configurar os recursos de computação CDH, utilize nós relacionados ao CDH no Data Studio para desenvolvimento de dados.