O Spark é um mecanismo de análise de big data de uso geral, reconhecido pelo alto desempenho, facilidade de uso e versatilidade. Ele permite executar análises complexas em memória e criar aplicações de análise de dados em grande escala com baixa latência. O DataWorks oferece nós CDH Spark para auxiliar no desenvolvimento e no agendamento periódico de tarefas Spark. Este tópico descreve como configurar e usar um nó CDH Spark.
Pré-requisitos
-
Crie um cluster CDH da Alibaba Cloud e associe-o a um workspace do DataWorks. Para mais informações, consulte Associar um recurso de computação CDH.
ImportanteInstale o componente Spark no cluster CDH e configure as informações relacionadas ao Spark durante a associação do cluster.
Configure uma source de dados Hive no DataWorks e aprove-a no teste de conectividade. Para mais informações, consulte Gerenciamento de fontes de dados.
(Opcional, obrigatório para usuários RAM) Adicione o usuário RAM usado para o desenvolvimento de tarefas ao workspace correspondente e conceda a função Development ou Workspace Administrator (conceda esta última com cautela devido às suas amplas permissões). Para mais detalhes sobre como adicionar membros, consulte Adicionar membros a um workspace.
Se você usar uma conta Alibaba Cloud, ignore esta etapa.
Preparação: desenvolver a tarefa Spark e obter o pacote JAR
Antes de usar o DataWorks para agendar uma tarefa CDH Spark, desenvolva o código da tarefa Spark no ambiente CDH, compile o código e gere um pacote JAR. Para mais informações sobre o desenvolvimento de tarefas CDH Spark, consulte Visão geral.
Criar um recurso JAR CDH
Envie o pacote JAR da tarefa para o DataWorks para permitir que a plataforma agende periodicamente a tarefa Spark no cluster CDH.
Para mais informações, consulte Gerenciamento de recursos. Transfira o pacote JAR da máquina local para o diretório de armazenamento de recursos JAR. Clique em no botão de upload para enviar o recurso JAR.
Selecione o caminho de armazenamento, a source de dados e o grupo de recursos.
Clique em Salve.
Criar um nó
Para obter instruções sobre como crie um nó, consulte Criar um nó em um fluxo de trabalho agendado.
Desenvolver o nó
Na página de edição do nó CDH Spark, execute as operações a seguir.
Referenciar um recurso JAR CDH
Abra o nó CDH Spark criado e permaneça na página do editor de código.
Na seção de gerenciamento de recursos, no painel de navegação à esquerda, localize o recurso desejado, clique em com o botão direito sobre ele e selecione Reference Resource.
Após referenciar o recurso, se uma instrução no formato
##@resource_reference{""}aparecer na página do editor de código do nó CDH Spark, a referência foi bem-sucedida. Em seguida, execute o comando abaixo. O pacote de recursos, o nome do bucket e as informações de caminho no comando são apenas exemplos. Substitua-os pelos seus dados reais.
##@resource_reference{"spark_examples_2.11_2.4.0.jar"}
spark_examples_2.11_2.4.0.jar
Edite o código do nó CDH Spark
Modifique o código do nó CDH Spark e adicione o comando Spark Submit. O código a seguir mostra um exemplo:
Não use instruções de comentário ao editar o código de um nó CDH Spark. Escreva o código da tarefa exatamente como mostrado no exemplo a seguir, sem adicionar comentários. Caso contrário, ocorrerá um erro durante a execução do nó.
##@resource_reference{"spark-examples_2.11-2.4.0.jar"}
spark-submit --class org.apache.spark.examples.SparkPi --master yarn spark-examples_2.11-2.4.0.jar 100
org.apache.spark.examples.SparkPi: classe principal da tarefa no pacote JAR compilado.spark-examples_2.11-2.4.0.jar: nome do recurso JAR CDH enviado.
Depurar o nó
-
Na seção de recursos de computação da configuração de execução, configure o recurso de computação e o grupo de recursos.
Em Compute Resource, selecione o nome do cluster CDH registrado no DataWorks.
Em Resource Group, escolha um grupo de recursos de agendamento aprovado no teste de conectividade com a source de dados. Para mais informações, consulte Soluções de conectividade de rede.
NotaTambém é possível ajustar as CUs de agendamento conforme os recursos necessários para a execução da tarefa. O valor padrão é
0.5CU. Na barra de ferramentas na parte superior da página de edição do nó, clique em Execute.
Próximas etapas
Configurar o agendamento do nó: Se um nó no diretório do projeto precisar de agendamento periódico, configure a Scheduling Policy e as propriedades de agendamento relacionadas nas Scheduling Settings, no lado direito do nó.
Implantar um nó ou fluxo de trabalho: Para implantar uma tarefa no ambiente de produção, clique em no ícone
na página e inicie o processo de implantação. Um nó no diretório do projeto só será agendado periodicamente após a implantação no ambiente de produção.Operações de tarefas: Após a implantação, visualize o status de execução da tarefa agendada no Operation Center. Para mais informações, consulte Introdução ao Operation Center.