Todos os produtos
Search
Central de documentação

DataWorks:Data Studio: Associar um recurso de computação CDH

Última atualização: Jun 27, 2026

Para desenvolver e gerenciar tarefas em um cluster Cloudera Distribution Including Apache Hadoop (CDH) no DataWorks, registre o cluster como recurso de computação. Após o registro, o recurso fica disponível para tarefas de sincronização e desenvolvimento de dados.

Regiões disponíveis: China (Beijing), China (Shanghai), China (Shenzhen), China (Hangzhou), China (Zhangjiakou), China (Chengdu) e Alemanha (Frankfurt).

Pré-requisitos

Antes de começar, verifique se você tem:

  • Um usuário RAM adicionado ao workspace com a função Workspace Administrator.

  • Um cluster CDH implantado. O DataWorks oferece suporte a clusters CDH implantados fora do Alibaba Cloud ECS, desde que o ambiente esteja conectado a uma Virtual Private Cloud (VPC) da Alibaba Cloud. Consulte Conectividade de rede para fontes de dados IDC.

  • Um grupo de recursos associado ao workspace com conectividade de rede confirmada:

Permissões

Operador

Permissões necessárias

Conta Alibaba Cloud

Nenhuma

Usuário RAM ou função RAM

Funções O&M e Workspace administrator, ou a permissão AliyunDataWorksFullAccess. Consulte Conceder permissões de administrador de espaço aos usuários.

Acessar a lista de recursos de computação

  1. Faça login no console do DataWorks e selecione a região de destino.

  2. No painel de navegação à esquerda, escolha More > Management Center. Selecione seu workspace e clique em Go To Management Center.

  3. No painel de navegação à esquerda, clique em Computing Resource.

Associar um recurso de computação CDH

  1. Na página Computing Resource, clique em Associate Computing Resource.

  2. Na página Associate Computing Resource, defina o tipo de recurso de computação como CDH. Você será redirecionado para a página Associate CDH Computing Resource.

  3. Configure os parâmetros descritos abaixo e clique em Confirm.

Versão e nome do cluster

Parâmetro

Descrição

Cluster version

Versão do CDH ou CDP a ser registrada. Para versões compatíveis e suas respectivas versões fixas de componentes, consulte Informações de conexão do cluster. Selecione Custom version para especificar as versões dos componentes manualmente.

Cluster name

Selecione um cluster existente registrado em outro workspace para carregar sua configuração ou insira um nome para criar uma nova configuração.

Computing resource instance name

Nome de exibição deste recurso de computação. Durante a execução, as tarefas referenciam os recursos de computação por este nome.

Clusters com versão personalizada oferecem suporte apenas a grupos de recursos exclusivos legados para agendamento. Após o registro, envie um ticket para inicializar o ambiente.

Informações de conexão do cluster

Configure os endpoints de conexão dos componentes Hadoop que suas tarefas utilizarão. O sistema detecta automaticamente as versões dos componentes para a versão do cluster selecionada.

Componente

Formato de conexão

Quando configurar

Hive — HiveServer2

jdbc:hive2://<host>:<port>/<database>

Enviar jobs do Hive

Hive — Metastore

thrift://<host>:<port>

Enviar jobs do Hive

Impala

jdbc:impala://<host>:<port>/<schema>

Enviar jobs do Impala

Spark

Selecione uma versão padrão na lista

Executar tarefas do Spark

YARN — Endereço do ResourceManager

http://<host>:<port>

Enviar tarefas Spark ou MapReduce

YARN — Endereço webapp do JobHistory

http://<host>:<port2>

Visualizar detalhes históricos de tarefas na interface web do JobHistory Server

MapReduce

Selecione uma versão padrão na lista

Executar tarefas MapReduce

Presto

jdbc:presto://<host>:<port>/<catalog>/<schema>

Enviar jobs do Presto (não é um componente padrão do CDH)

Para consultar os parâmetros de conexão do seu cluster, consulte Obter informações do cluster CDH ou CDP e configurar conectividade de rede.

Se usar um grupo de recursos serverless e acessar componentes CDH por nome de domínio, configure a resolução autoritativa para os nomes de domínio dos componentes CDH e defina seu escopo efetivo no Alibaba Cloud DNS PrivateZone.

Arquivos de configuração do cluster

Faça upload dos arquivos de configuração correspondentes às tarefas que você planeja executar.

Arquivo

Descrição

Fazer upload quando

Arquivo Core-site

Configurações globais de I/O do Hadoop Distributed File System (HDFS) e MapReduce

Executar tarefas Spark ou MapReduce

Arquivo Hdfs-site

Configurações do HDFS: tamanho de bloco, fator de replicação e nomes de caminho

Arquivo Mapred-site

Modo de execução e comportamento de agendamento do MapReduce

Executar tarefas MapReduce

Arquivo Yarn-site

Configurações de runtime do gerenciador de recursos YARN, gerenciador de nós e aplicativos

Executar tarefas Spark ou MapReduce, ou usar mapeamento de conta Kerberos

Arquivo Hive-site

Configurações de conexão de banco de dados Hive, metastore e mecanismo de execução

Usar mapeamento de conta Kerberos

Arquivo Spark-defaults

Configurações padrão de jobs Spark (spark-defaults.conf): memória, núcleos de CPU e outros parâmetros de runtime

Executar tarefas Spark

Arquivo Config.properties

Configurações de coordenador Presto e nós worker

Usar Presto com autenticação OPEN LDAP ou Kerberos

Arquivo Presto.jks

Certificados SSL/TLS para comunicação criptografada do Presto

Identidade de acesso padrão

Defina a identidade do cluster usada durante a execução de tarefas no cluster CDH. Para configurar mapeamentos de identidade, acesse a aba Account Mapping na página Computing Resources. Consulte Definir o mapeamento de identidade do cluster.

Ambiente

Opções disponíveis

Ambiente de desenvolvimento

Conta do cluster; Conta mapeada do cluster do executor da tarefa

Ambiente de produção

Conta do cluster; Conta mapeada do cluster do proprietário da tarefa; Conta mapeada do cluster da conta Alibaba Cloud; Conta mapeada do cluster do usuário RAM

Inicializar o grupo de recursos

Inicialize o grupo de recursos ao registrar um cluster pela primeira vez ou após alterar configurações de serviço do cluster (por exemplo, ao modificar core-site.xml). A inicialização garante que o grupo de recursos consiga alcançar o cluster CDH após a configuração da conectividade de rede.

  1. Na página Computing Resource, localize o recurso de computação CDH criado.

  2. No canto superior direito, clique em Initialize Resource Group.

  3. Clique em Initialize ao lado do grupo de recursos desejado e, em seguida, clique em OK.

Mais operações

Definir uma fila de recursos YARN (opcional)

Na página Computing Resource, localize o cluster CDH. Na aba YARN Resource Queue, clique em EditYARN Resource Queue para atribuir filas dedicadas de recursos YARN às tarefas em diferentes módulos.

Definir parâmetros do Spark (opcional)

Na página Computing Resource, localize o cluster CDH. Na aba Spark-related Parameter, clique em EditSpark-related Parameter. Clique em Add sob o módulo alvo, insira o Spark Property Name e o Spark Property Value. Para obter uma lista completa das propriedades do Spark, consulte Configuração do Spark.

Configurar mapeamentos de host para autenticação Kerberos (opcional)

Ao usar um grupo de recursos serverless com um cluster CDH com autenticação Kerberos habilitada, o envio de tarefas pode falhar se o DNS não conseguir resolver um endereço IP do cluster para o nome de host registrado no Kerberos.

O recurso Host Configuration permite definir uma tabela estática de mapeamento IP-para-hostname para o recurso de computação. O DataWorks usa esse mapeamento ao acessar seu cluster CDH, garantindo o sucesso da autenticação Kerberos.

Para configurar mapeamentos de host:

  1. Na página Computing Resource, localize o recurso de computação CDH e clique em Host Configuration.

  2. Na caixa de diálogo, insira os mapeamentos no seguinte formato. Cada linha representa um registro de mapeamento:

    <IP address> <Hostname>

    Separe o endereço IP e o nome do host com um ou mais espaços. Configure mapeamentos para todos os nós principais envolvidos na autenticação Kerberos e na execução de tarefas, incluindo NameNode, ResourceManager e NodeManagers.

  3. Clique em OK para salvar. Os nomes de host configurados aparecem no cartão do recurso de computação, confirmando que a configuração está ativa.

Importante

A configuração de host aplica-se apenas ao recurso de computação atual e não afeta outros recursos de computação no workspace.

Próximos passos

Após configurar os recursos de computação CDH, utilize nós relacionados ao CDH no Data Studio para desenvolvimento de dados.