O DataWorks conecta-se a clusters Cloudera’s Distribution Including Apache Hadoop (CDH) e Cloudera Data Platform (CDP). Registre clusters CDH e CDP no DataWorks para executar operações de desenvolvimento e governança de dados, como desenvolvimento de tarefas, agendamento, Data Map (gerenciamento de metadados) e Data Quality.
Informações básicas
O CDH é a distribuição de plataforma open source da Cloudera. Inclui recursos prontos para uso, como gerenciamento, monitoramento e diagnóstico de cluster, além de oferecer suporte a vários componentes para execução de fluxos de trabalho completos de big data.
O CDP é uma plataforma de dados pública que coleta e consolida dados de clientes provenientes de múltiplas fontes. Reúne dados em tempo real para criar perfis individuais de usuários.
Registre clusters CDH e CDP no DataWorks para desenvolver e agendar tarefas, gerenciar metadados no Data Map e realizar verificações do Data Quality.
Pré-requisitos
-
Para registrar um cluster CDH ou CDP, você deve ter uma das seguintes funções ou permissões no workspace atual:
Use uma conta Alibaba Cloud.
Seja membro do workspace com a função Workspace Administrator. Para mais informações, consulte Adicionar membros ao workspace e gerenciar suas funções e permissões.
Seja membro do workspace com a política AliyunDataWorksFullAccess. Para conceder essa política, consulte Conceder permissões a um usuário RAM e Conceder permissões a uma função RAM. Para adicionar um membro ao workspace, consulte Adicionar membros ao workspace e gerenciar suas funções e permissões.
Implante o cluster CDH ou CDP e obtenha as informações de configuração necessárias para o registro. Para mais detalhes, consulte Preparações: Obter informações do cluster CDH ou CDP e configurar a conectividade de rede.
Limites
-
Execute tarefas de cluster CDH ou CDP apenas com o novo grupo de recursos serverless (recomendado) ou com um grupo de recursos exclusivo legado para agendamento.
NotaO grupo de recursos serverless é de uso geral e adequado para diversos cenários, como sincronização de dados e agendamento de tarefas. Para saber como adquirir um grupo de recursos serverless, consulte Usar um grupo de recursos serverless. Caso já possua um grupo de recursos exclusivo legado para agendamento, utilize-o também para executar tarefas CDH ou CDP. Para mais informações, consulte Usar um grupo de recursos exclusivo para agendamento.
Novos usuários podem adquirir apenas os novos grupos de recursos serverless.
Ao utilizar um cluster de Custom Version para registro no DataWorks, somente o grupo de recursos exclusivo legado para agendamento estará disponível. Para detalhes sobre versões de cluster, consulte Etapa 2: Registrar um cluster CDH ou CDP.
Registre clusters CDH ou CDP apenas nas seguintes regiões: China (Pequim), China (Xangai), China (Hangzhou), China (Shenzhen), China (Zhangjiakou), China (Chengdu) e Alemanha (Frankfurt).
Etapa 1: Acessar a página de registro
-
Faça login no console do DataWorks. Na região desejada, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Management Center.
No painel de navegação à esquerda, clique em Clusters para acessar a página Clusters. Clique em Register Cluster, selecione CDH para Open Source Cluster Type e acesse a página de registro de cluster.
Etapa 2: Registrar um cluster CDH ou CDP
Se o seu workspace estiver no modo padrão, registre clusters separados para os ambientes de desenvolvimento e produção. Para mais informações sobre os modos de workspace, consulte Diferenças entre modos de workspace.
As operações de desenvolvimento para CDP e CDH no DataWorks são praticamente idênticas. Este tópico utiliza um cluster CDH como exemplo.
-
Configure as informações básicas do cluster.
Parâmetro
Descrição
Display Name of Cluster
Nome de exibição do cluster no DataWorks. O nome deve ser único.
Cluster Version
Selecione a versão do cluster que deseja registrar.
O DataWorks oferece as seguintes versões: CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2 e CDP 7.1.7. As versões dos componentes associadas a essas versões de cluster são fixas. Para mais detalhes, consulte Informações de conexão do cluster. Se essas versões não atenderem aos seus requisitos de negócio, selecione Custom Version e configure as versões dos componentes conforme necessário.
Nota-
Consulte a interface para obter as informações mais atualizadas.
-
Caso utilize um cluster de Custom Version para registro no DataWorks, apenas o grupo de recursos exclusivo legado para agendamento poderá ser usado. Após concluir o registro, abra um ticket para solicitar que o suporte técnico inicialize o ambiente.
Cluster Name
Define a origem das informações de configuração do cluster registrado. Selecione um cluster já registrado em outro workspace ou crie um novo.
-
Cluster registrado: Reutiliza a configuração de um cluster já existente em outro workspace.
-
Novo cluster: Configure as informações do cluster que será registrado.
-
-
Configure as informações de conexão do cluster.
De acordo com o seu caso de uso, selecione as versões dos componentes do cluster e insira as informações de endpoint obtidas. Para mais detalhes, consulte Preparações: Obter informações do cluster CDH ou CDP e configurar a conectividade de rede. No nó principal do cluster CDH, execute o comando
java -jar dw-tools.jar admin adminpara obter as informações de host e URL de cada componente. Em seguida, preencha os campos abaixo com os endereços de conexão retornados: HiveServer2 (formato:jdbc:hive2://<host>:<port>/<database>), Metastore (formato:thrift://<host>:<port>), Impala JDBC URL (formato:jdbc:impala://<host>:<port>/<schema>), Yarn.ResourceManager.Address (formato:http://<host>:<port>), Jobhistory.Webapp.Address (altere a porta do endereço Yarn ResourceManager para 8088) e Presto JDBC URL (formato:jdbc:presto://<host>:<port>/<catalog>/<schema>). O Presto não é um componente padrão do CDH; especifique o endereço de acesso conforme sua implantação.NotaPara acessar componentes CDH por nome de domínio a partir de um grupo de recursos serverless, configure a resolução DNS autoritativa para os nomes de domínio dos componentes no PrivateZone do Alibaba Cloud DNS. Para mais informações, consulte Adicionar um domínio autoritativo interno e Definir escopo para um nome de domínio.
-
Adicione os arquivos de configuração do cluster.
Faça upload dos arquivos de configuração dos componentes necessários. Para obter esses arquivos, consulte Preparações: Obter informações do cluster CDH ou CDP e configurar a conectividade de rede.
A tabela a seguir descreve os arquivos de configuração.
Arquivo de configuração
Descrição
Cenários
core-site.xml
Contém configurações globais da biblioteca Hadoop Core, como definições comuns de I/O para HDFS e MapReduce.
Este arquivo é obrigatório para executar tarefas Spark ou MapReduce.
hdfs-site.xml
Inclui configurações relacionadas ao HDFS, como tamanho de bloco de dados, número de réplicas e nomes de caminho.
mapred-site.xml
Define parâmetros do MapReduce, incluindo método de execução e comportamento de agendamento dos jobs.
Necessário para a execução de tarefas MapReduce.
yarn-site.xml
Abrange todas as configurações dos daemons YARN, como gerenciador de recursos, gerenciador de nós e ambiente de execução de aplicações.
Envie este arquivo para executar tarefas Spark ou MapReduce, ou quando Kerberos for escolhido como tipo de mapeamento de identidade.
hive-site.xml
Reúne diversos parâmetros de configuração do Hive, como conexão com banco de dados, definições do Hive Metastore e motor de execução.
Exigido quando o tipo de mapeamento de identidade selecionado for Kerberos.
spark-defaults.conf
Especifica as configurações padrão aplicadas durante a execução de jobs Spark. Use o arquivo
spark-defaults.confpara pré-definir propriedades como tamanho de memória e quantidade de núcleos CPU, utilizadas pelas aplicações Spark em tempo de execução.Indispensável para executar tarefas Spark.
config.properties
Armazena configurações do servidor Presto, incluindo propriedades globais para nós coordenadores e workers em um cluster Presto.
Obrigatório ao usar o componente Presto com OPEN LDAP ou Kerberos como tipo de mapeamento de identidade.
presto.jks
Arquivo Java KeyStore (JKS) que armazena certificados de segurança, incluindo chaves privadas e certificados de chave pública emitidos para aplicações. No Presto, o arquivo
presto.jkshabilita a comunicação criptografada SSL/TLS para processos do Presto e garante a transferência segura de dados. -
Configure a identidade de acesso padrão.
Esta definição determina qual conta acessará o cluster CDH durante a execução de tarefas no DataWorks. Os tipos de conta suportados variam conforme o ambiente.
NotaDurante o registro do cluster, se a Default Access Identity for definida como uma conta fora do cluster e nenhum mapeamento de identidade estiver configurado (ou se o tipo de mapeamento for sem autenticação), todas as tarefas falharão.
Ambiente
Identidade de acesso padrão
Informações relacionadas
Ambiente de desenvolvimento
-
Conta do cluster: Uma conta específica do cluster acessa o CDH, independentemente de quem executa a tarefa no DataWorks (como uma conta Alibaba Cloud ou usuário RAM com permissões apenas de desenvolvimento).
-
Conta mapeada: Configure um mapeamento de identidade entre a conta do usuário e uma conta do cluster. A conta mapeada será usada para acessar o cluster CDH durante a execução.
Para configurar o mapeamento de identidade, consulte Configurar mapeamentos de identidade do cluster.
Ambiente de produção
-
Conta do cluster: Utiliza uma conta específica para acessar o cluster CDH, não importando quem executa a tarefa no DataWorks (proprietário da tarefa, conta Alibaba Cloud ou usuário RAM).
-
Conta mapeada: Quando o proprietário da tarefa, uma conta Alibaba Cloud ou um usuário RAM executa uma tarefa CDH, configure o mapeamento entre a conta correspondente e uma conta do cluster. O acesso ao cluster CDH ocorrerá via conta mapeada.
-
Clique em Complete Registration para registrar o cluster no DataWorks.
Etapa 3: Inicializar o grupo de recursos
Inicialize o grupo de recursos ao registrar um cluster pela primeira vez, após alterar a configuração de serviço do cluster ou depois de atualizar a versão de um componente, por exemplo, modificando o arquivo core-site.xml. A inicialização garante que o grupo de recursos acesse o cluster CDH e esteja corretamente configurado para executar tarefas. Na página Clusters, localize o cluster CDH registrado e clique em Initialize Resource Group no canto superior direito. Selecione o grupo de recursos desejado e inicie a inicialização.
O DataWorks suporta a execução de tarefas de cluster CDH apenas com o novo grupo de recursos serverless (recomendado) ou com um grupo de recursos exclusivo legado para agendamento. Portanto, somente esses dois tipos podem ser inicializados. Se não houver grupos disponíveis, crie um conforme necessário. Para mais detalhes, consulte Usar um grupo de recursos serverless e Usar um grupo de recursos exclusivo para agendamento.
Se você registrou um cluster de Custom Version no DataWorks, apenas o grupo de recursos exclusivo legado para agendamento é suportado. Após o registro, abra um ticket para solicitar a inicialização do ambiente pelo suporte técnico.
(Opcional) Configurar fila de recursos YARN
A fila de recursos YARN tem como principal objetivo particionar e isolar recursos do cluster. Isso assegura que diferentes tipos de tarefas utilizem os recursos computacionais de forma justa e organizada, evitando interferências. Para configurar uma fila dedicada às tarefas de um módulo específico, encontre o cluster CDH registrado na página Clusters. Na aba YARN Resource Queue, clique em Edit YARN resource queue para ajustar as definições.
(Opcional) Configurar propriedades Spark
Defina propriedades Spark dedicadas para tarefas em diferentes módulos.
Na página Clusters, localize o cluster CDH registrado.
Na aba Spark-related Parameter, clique no botão Edit Spark properties para acessar a página de edição das propriedades Spark do cluster CDH.
Clique no botão Add abaixo de um módulo e insira o Spark Property Name e o respectivo Spark Property Value para definir as propriedades Spark.
Próximas etapas
Configurar mapeamentos de identidade do cluster: Se a identidade de acesso padrão do cluster CDH não for uma conta específica do cluster (ou seja, o acesso ocorre via sua conta Alibaba Cloud), configure um mapeamento de identidade entre a conta Alibaba Cloud e uma conta do cluster. Isso permite que a conta Alibaba Cloud acesse o cluster CDH usando a identidade mapeada, possibilitando o isolamento e controle de permissões de dados.
Após registrar o recurso de computação CDH, utilize os nós relacionados ao CDH no DataStudio para desenvolver dados.