Todos os produtos
Search
Central de documentação

DataWorks:Nó CDH Spark

Última atualização: Jul 09, 2026

O Spark é um mecanismo de análise de big data de uso geral, reconhecido pelo alto desempenho, facilidade de uso e versatilidade. Ele permite executar análises complexas em memória e criar aplicações de análise de dados em grande escala com baixa latência. O DataWorks oferece nós CDH Spark para auxiliar no desenvolvimento e no agendamento periódico de tarefas Spark. Este tópico descreve como configurar e usar um nó CDH Spark.

Pré-requisitos

  • Crie um cluster CDH da Alibaba Cloud e associe-o a um workspace do DataWorks. Para mais informações, consulte Associar um recurso de computação CDH.

    Importante

    Instale o componente Spark no cluster CDH e configure as informações relacionadas ao Spark durante a associação do cluster.

  • (Opcional, obrigatório para usuários RAM) Adicione o usuário RAM usado para o desenvolvimento de tarefas ao workspace correspondente e conceda a função Development ou Workspace Administrator (conceda esta última com cautela devido às suas amplas permissões). Para mais detalhes sobre como adicionar membros, consulte Adicionar membros a um workspace.

    Nota

    Se você usar uma conta Alibaba Cloud, ignore esta etapa.

  • Configure uma source de dados Hive no DataWorks e aprove-a no teste de conectividade. Para mais informações, consulte Gerenciamento de fontes de dados.

Preparação: desenvolver a tarefa Spark e obter o pacote JAR

Antes de usar o DataWorks para agendar uma tarefa CDH Spark, desenvolva o código da tarefa Spark no ambiente CDH, compile o código e gere um pacote JAR. Para mais informações sobre o desenvolvimento de tarefas CDH Spark, consulte Visão geral.

Criar um recurso JAR CDH

Envie o pacote JAR da tarefa para o DataWorks para permitir que a plataforma agende periodicamente a tarefa Spark no cluster CDH.

  1. Para mais informações, consulte Gerenciamento de recursos. Transfira o pacote JAR da máquina local para o diretório de armazenamento de recursos JAR. Clique em no botão de upload para enviar o recurso JAR.

  2. Selecione o caminho de armazenamento, a source de dados e o grupo de recursos.

  3. Clique em Salve.

Criar um nó

Para obter instruções sobre como crie um nó, consulte Criar um nó em um fluxo de trabalho agendado.

Desenvolver o nó

Na página de edição do nó CDH Spark, execute as operações a seguir.

Referenciar um recurso JAR CDH

  1. Abra o nó CDH Spark criado e permaneça na página do editor de código.

  2. Na seção de gerenciamento de recursos, no painel de navegação à esquerda, localize o recurso desejado, clique em com o botão direito sobre ele e selecione Reference Resource.

  3. Após referenciar o recurso, se uma instrução no formato ##@resource_reference{""} aparecer na página do editor de código do nó CDH Spark, a referência foi bem-sucedida. Em seguida, execute o comando abaixo. O pacote de recursos, o nome do bucket e as informações de caminho no comando são apenas exemplos. Substitua-os pelos seus dados reais.

##@resource_reference{"spark_examples_2.11_2.4.0.jar"}
spark_examples_2.11_2.4.0.jar

Edite o código do nó CDH Spark

Modifique o código do nó CDH Spark e adicione o comando Spark Submit. O código a seguir mostra um exemplo:

Importante

Não use instruções de comentário ao editar o código de um nó CDH Spark. Escreva o código da tarefa exatamente como mostrado no exemplo a seguir, sem adicionar comentários. Caso contrário, ocorrerá um erro durante a execução do nó.

##@resource_reference{"spark-examples_2.11-2.4.0.jar"}
spark-submit --class org.apache.spark.examples.SparkPi --master yarn  spark-examples_2.11-2.4.0.jar 100
Nota
  • org.apache.spark.examples.SparkPi: classe principal da tarefa no pacote JAR compilado.

  • spark-examples_2.11-2.4.0.jar: nome do recurso JAR CDH enviado.

Depurar o nó

  1. Na seção de recursos de computação da configuração de execução, configure o recurso de computação e o grupo de recursos.

    1. Em Compute Resource, selecione o nome do cluster CDH registrado no DataWorks.

    2. Em Resource Group, escolha um grupo de recursos de agendamento aprovado no teste de conectividade com a source de dados. Para mais informações, consulte Soluções de conectividade de rede.

    Nota

    Também é possível ajustar as CUs de agendamento conforme os recursos necessários para a execução da tarefa. O valor padrão é 0.5 CU.

  2. Na barra de ferramentas na parte superior da página de edição do nó, clique em Execute.

Próximas etapas

  • Configurar o agendamento do nó: Se um nó no diretório do projeto precisar de agendamento periódico, configure a Scheduling Policy e as propriedades de agendamento relacionadas nas Scheduling Settings, no lado direito do nó.

  • Implantar um nó ou fluxo de trabalho: Para implantar uma tarefa no ambiente de produção, clique em no ícone image na página e inicie o processo de implantação. Um nó no diretório do projeto só será agendado periodicamente após a implantação no ambiente de produção.

  • Operações de tarefas: Após a implantação, visualize o status de execução da tarefa agendada no Operation Center. Para mais informações, consulte Introdução ao Operation Center.