Todos os produtos
Search
Central de documentação

DataWorks:DataStudio (legacy): Registrar um recurso de computação CDH

Última atualização: Jul 20, 2026

Registre clusters do Cloudera’s Distribution Including Apache Hadoop (CDH) ou do Cloudera Data Platform (CDP) no DataWorks para executar operações de desenvolvimento e governança de dados, como desenvolvimento de tarefas, agendamento, Data Map (gerenciamento de metadados) e Data Quality.

Informações básicas

  • O CDH é a distribuição de plataforma open source da Cloudera. Inclui recursos prontos para uso, como gerenciamento, monitoramento e diagnóstico de clusters, além de oferecer suporte a diversos componentes para execução de fluxos de trabalho completos de big data.

  • O CDP é uma plataforma de dados pública que coleta e consolida dados de clientes provenientes de múltiplas fontes. Reúne dados em tempo real para criar perfis individuais de usuários.

Registre clusters CDH e CDP no DataWorks para desenvolver e agendar tarefas, gerenciar metadados no Data Map e realizar verificações do Data Quality.

Pré-requisitos

Limites

  • Execute tarefas em clusters CDH ou CDP apenas com o novo grupo de recursos serverless (recomendado) ou com um grupo de recursos exclusivo legacy para agendamento.

    Nota
    • O grupo de recursos serverless é de uso geral e atende a diversos cenários, como sincronização de dados e agendamento de tarefas. Para saber como adquirir um grupo de recursos serverless, consulte Use a serverless resource group. Caso já possua um grupo de recursos exclusivo legacy para agendamento, utilize-o também para executar tarefas CDH ou CDP. Para mais informações, consulte Use an exclusive resource group for scheduling.

    • Novos usuários podem adquirir apenas grupos de recursos serverless.

    • Ao utilizar um cluster de Custom Version para registro no DataWorks, use somente o grupo de recursos exclusivo legacy para agendamento. Para detalhes sobre versões de clusters, consulte Step 2: Register a CDH or CDP cluster.

  • Registre clusters CDH ou CDP apenas nas seguintes regiões: China (Beijing), China (Shanghai), China (Hangzhou), China (Shenzhen), China (Zhangjiakou), China (Chengdu) e Germany (Frankfurt).

Etapa 1: Acessar a página de registro

  1. Faça login no console do DataWorks. Na região desejada, clique em More > Management Center no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Management Center.

  2. No painel de navegação à esquerda, clique em Clusters para acessar a página Clusters. Clique em Register Cluster, selecione CDH como Open Source Cluster Type e prossiga para a página de registro do cluster.

Etapa 2: Registrar um cluster CDH ou CDP

Nota
  • Se o seu workspace estiver no modo padrão, registre clusters separados para os ambientes de desenvolvimento e produção. Para mais informações sobre os modos de workspace, consulte Differences between workspace modes.

  • As operações de desenvolvimento para CDP e CDH no DataWorks são praticamente idênticas. Este tópico utiliza um cluster CDH como exemplo.

  1. Configure as informações básicas do cluster.

    Parâmetro

    Descrição

    Display Name of Cluster

    Nome de exibição do cluster no DataWorks. O nome deve ser único.

    Cluster Version

    Selecione a versão do cluster a ser registrada.

    O DataWorks oferece as seguintes versões: CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2 e CDP 7.1.7. As versões dos componentes associadas a essas versões de cluster são fixas. Para mais detalhes, consulte Cluster connection information. Caso essas versões não atendam aos seus requisitos de negócio, selecione Custom Version e configure as versões dos componentes conforme sua necessidade.

    Nota
    • Consulte a interface para obter as informações mais atualizadas.

    • Se você utilizar um cluster de Custom Version para registro no DataWorks, use apenas o grupo de recursos exclusivo legacy para agendamento. Após concluir o registro, envie um ticket para solicitar que o suporte técnico inicialize o ambiente.

    Cluster Name

    Origem das informações de configuração do cluster registrado. Selecione um cluster já registrado em outro workspace ou crie um novo.

    • Cluster registrado: Reutiliza a configuração de um cluster já existente em outro workspace.

    • Novo cluster: Configure as informações do cluster que está sendo registrado.

  2. Configure as informações de conexão do cluster.

    Selecione as versões dos componentes do seu cluster e insira as informações de endpoint obtidas. Para mais detalhes, consulte Preparations: Obtain CDH or CDP cluster information and configure network connectivity. No nó principal do cluster CDH, execute o comando java -jar dw-tools.jar admin admin para obter as informações de host e URL de cada componente. Em seguida, utilize os endereços de conexão retornados para preencher os seguintes campos: HiveServer2 (formato: jdbc:hive2://<host>:<port>/<database>), Metastore (formato: thrift://<host>:<port>), Impala JDBC URL (formato: jdbc:impala://<host>:<port>/<schema>), Yarn.ResourceManager.Address (formato: http://<host>:<port>), Jobhistory.Webapp.Address (altere a porta do endereço Yarn ResourceManager para 8088) e Presto JDBC URL (formato: jdbc:presto://<host>:<port>/<catalog>/<schema>). O Presto não é um componente padrão do CDH; especifique o endereço de acesso conforme sua implantação.

    Nota

    Caso acesse componentes do CDH por nome de domínio a partir de um grupo de recursos serverless, configure a resolução DNS autoritativa para os nomes de domínio dos componentes no PrivateZone do Alibaba Cloud DNS. Para mais informações, consulte Add a built-in authoritative domain e Set a scope for a domain name.

  3. Adicione os arquivos de configuração do cluster.

    Envie os arquivos de configuração dos componentes necessários. Para obter esses arquivos, consulte Preparations: Obtain CDH or CDP cluster information and configure network connectivity.

    A tabela a seguir descreve os arquivos de configuração.

    Arquivo de configuração

    Descrição

    Cenários

    core-site.xml

    Contém configurações globais da biblioteca Hadoop Core, como definições comuns de I/O para HDFS e MapReduce.

    Envie este arquivo para executar tarefas Spark ou MapReduce.

    hdfs-site.xml

    Inclui configurações relacionadas ao HDFS, como tamanho de bloco de dados, número de réplicas e nomes de caminhos.

    mapred-site.xml

    Define parâmetros do MapReduce, incluindo método de execução e comportamento de agendamento dos jobs.

    Envie este arquivo para executar tarefas MapReduce.

    yarn-site.xml

    Abrange todas as configurações dos daemons YARN, como resource manager, node manager e ambiente de execução de aplicações.

    Envie este arquivo para executar tarefas Spark ou MapReduce, ou quando Kerberos for selecionado como tipo de mapeamento de identidade.

    hive-site.xml

    Reúne diversos parâmetros de configuração do Hive, como conexão com banco de dados, definições do Hive Metastore e engine de execução.

    Envie este arquivo quando Kerberos for escolhido como tipo de mapeamento de identidade.

    spark-defaults.conf

    Estabelece configurações padrão para execução de jobs Spark. Utilize o arquivo spark-defaults.conf para pré-definir propriedades como tamanho de memória e quantidade de núcleos de CPU, aplicadas durante a execução das aplicações.

    Envie este arquivo para executar tarefas Spark.

    config.properties

    Armazena configurações do servidor Presto, incluindo propriedades globais para nós coordenadores e workers no cluster.

    Envie este arquivo ao usar o componente Presto com OPEN LDAP ou Kerberos como tipo de mapeamento de identidade.

    presto.jks

    Arquivo Java KeyStore (JKS) que guarda certificados de segurança, chaves privadas e certificados de chave pública. No Presto, o arquivo presto.jks habilita comunicação criptografada via SSL/TLS entre processos, garantindo transferência segura de dados.

  4. Configure a identidade de acesso padrão.

    Conta usada para acessar o cluster CDH durante a execução de tarefas pelo DataWorks. Os tipos de conta suportados variam conforme o ambiente.

    Nota

    Ao registrar um cluster, se a Default Access Identity for definida como uma conta fora do cluster e nenhum mapeamento de identidade estiver configurado (ou se o tipo de mapeamento for sem autenticação), todas as tarefas falharão.

    Ambiente

    Identidade de acesso padrão

    Informações relacionadas

    Ambiente de desenvolvimento

    • Conta do cluster: Uma conta específica acessa o cluster CDH, independentemente de quem executa a tarefa no DataWorks (como uma conta Alibaba Cloud ou usuário RAM com permissões restritas a desenvolvimento).

    • Conta mapeada: Exige mapeamento de identidade entre a conta do usuário e uma conta do cluster. Durante a execução, o acesso ocorre por meio da conta mapeada.

    Para configurar o mapeamento de identidade, consulte Configure cluster identity mappings.

    Ambiente de produção

    • Conta do cluster: Uma conta pré-definida acessa o cluster CDH, independentemente de quem aciona a tarefa no DataWorks (proprietário da tarefa, conta Alibaba Cloud ou usuário RAM).

    • Conta mapeada: Requer vínculo de identidade entre a conta correspondente (proprietário, conta Alibaba Cloud ou usuário RAM) e uma conta do cluster. A tarefa utiliza a conta mapeada para acessar o cluster.

  5. Clique em Complete Registration para finalizar o registro do cluster no DataWorks.

Etapa 3: Inicializar o grupo de recursos

Inicialize o grupo de recursos ao registrar um cluster pela primeira vez, após alterar a configuração de services do cluster ou depois de atualizar a versão de um componente (por exemplo, modificando o arquivo core-site.xml). Isso garante que o grupo de recursos tenha acesso ao cluster CDH e esteja corretamente configurado para executar tarefas. Na página Clusters, localize o cluster CDH registrado e clique em Initialize Resource Group no canto superior direito. Selecione o grupo de recursos desejado e inicie a inicialização.

Nota
  • O DataWorks suporta a execução de tarefas em clusters CDH apenas com o novo grupo de recursos serverless (recomendado) ou grupo de recursos exclusivo legacy para agendamento. Portanto, inicialize somente esses dois tipos. Se não houver grupos disponíveis, crie um conforme necessário. Para mais detalhes, consulte Use a serverless resource group e Use an exclusive resource group for scheduling.

  • Caso utilize um cluster de Custom Version no registro, use apenas o grupo de recursos exclusivo legacy para agendamento. Após o registro, envie um ticket para solicitar a inicialização do ambiente pelo suporte técnico.

(Opcional) Configurar fila de recursos YARN

As filas de recursos YARN particionam e isolam os recursos do cluster, assegurando que diferentes tipos de tarefas utilizem a capacidade computacional de forma justa e sem interferências. Para configurar uma fila dedicada a tarefas de um módulo específico, localize seu cluster CDH registrado na página Clusters. Na aba YARN Resource Queue, clique em Edit YARN resource queue para ajustar as definições.

(Opcional) Configurar propriedades Spark

Defina propriedades Spark específicas para tarefas em diferentes módulos.

  1. Na página Clusters, localize o cluster CDH registrado.

  2. Na aba Spark-related Parameter, clique no botão Edit Spark properties para acessar a página de edição das propriedades Spark do cluster.

  3. Clique no botão Add abaixo de um módulo e preencha o Spark Property Name e o respectivo Spark Property Value para definir as propriedades Spark.

Próximas etapas

  • Configure cluster identity mappings: Se a identidade de acesso padrão do cluster CDH não for uma conta específica do cluster, configure o mapeamento de identidade entre a conta Alibaba Cloud e uma conta do cluster. Esse mapeamento permite que a conta Alibaba Cloud acesse o cluster CDH com a identidade mapeada, possibilitando isolamento e controle de permissões de dados.

  • Após registrar o recurso de computação CDH, utilize os CDH-related nodes no DataStudio para desenvolver dados.