Todos os produtos
Search
Central de documentação

DataWorks:Nó CDH MR

Última atualização: Jun 27, 2026

No DataWorks, você pode criar um nó CDH MR (MapReduce) para processar grandes volumes de dados. Este tópico descreve como configurar e usar nós CDH MR no DataWorks.

Pré-requisitos

  • Crie um cluster CDH da Alibaba Cloud e associe-o a um workspace do DataWorks. Para mais informações, consulte Associar um mecanismo de computação CDH.

  • (Opcional, para usuários RAM) Adicione o usuário RAM responsável pelo desenvolvimento de tarefas ao workspace correspondente e conceda a função Development ou Workspace Administrator. A função Workspace Administrator concede permissões amplas; portanto, atribua-a com cautela. Para mais detalhes sobre como adicionar membros, consulte Adicionar membros a um workspace.

    Nota

    Se você utilizar uma conta Alibaba Cloud, ignore esta etapa.

  • Configure uma fonte de dados Hive no DataWorks e verifique se ela passou no teste de conectividade. Para mais informações, consulte Gerenciar fontes de dados.

Criar um recurso JAR CDH

Envie o pacote JAR da sua tarefa para o DataWorks e agende sua execução periódica como uma tarefa CDH Spark.

  1. Para mais informações, consulte Gerenciamento de recursos. Envie o pacote JAR da máquina local para o diretório de armazenamento de recursos JAR. Clique em Upload para carregar o recurso JAR.

  2. Selecione o caminho de armazenamento, a fonte de dados e o grupo de recursos.

  3. Clique em Save.

Criar um nó

Para obter instruções, consulte Criar um nó.

Desenvolver o nó

Na página do editor do nó CDH MR, execute as etapas a seguir.

  1. Abra o nó CDH MR criado e permaneça na página de edição de código.

  2. No painel de navegação à esquerda, localize o recurso desejado em Resource Management, clique com o botão direito sobre ele e selecione Reference Resource.

  3. Após referenciar o recurso, se uma instrução no formato ##@resource_reference{""} aparecer na página de edição de código do nó CDH, a referência foi bem-sucedida. Em seguida, execute o comando a seguir para executar a tarefa. O pacote de recursos, o nome do bucket e as informações de caminho no comando são apenas exemplos. Substitua-os pelos seus dados reais.

##@resource_reference{"onaliyun_mr_wordcount-1.0-SNAPSHOT.jar"}
onaliyun_mr_wordcount-1.0-SNAPSHOT.jar cn.apache.hadoop.onaliyun.examples.EmrWordCount oss://onaliyun-bucket-2/cdh/datas/wordcount02/inputs oss://onaliyun-bucket-2/cdh/datas/wordcount02/outputs

Depurar o nó

  1. Na seção Compute Resource de Run Configuration, configure o recurso de computação e o grupo de recursos.

    1. Em Compute Resource, selecione o cluster CDH registrado no DataWorks.

    2. Em Resource Group, selecione o grupo de recursos de agendamento que passou no teste de conectividade com a fonte de dados. Para mais informações, consulte Soluções de conectividade de rede.

  2. Na barra de ferramentas superior do editor de nós, clique em Run.

Próximas etapas

  • Configurar agendamento de nó: Se precisar executar um nó periodicamente, defina a Scheduling Policy no painel Scheduling Settings à direita.

  • Publicar um nó: Para executar uma tarefa no ambiente de produção, clique no ícone image para publicar o nó. O nó só executa conforme o agendamento após a publicação no ambiente de produção.

  • O&M de tarefas: Após publicar a tarefa, monitore o status das execuções periódicas no Operation Center. Para mais informações, consulte Introdução ao Operation Center.