O DataWorks oferece nós ADB Spark para desenvolver, agendar e integrar tarefas do AnalyticDB Spark a outros tipos de tarefa. Este tópico descreve como usar um nó ADB Spark no desenvolvimento de tarefas.
Contexto
O ADB Spark é um mecanismo de computação do AnalyticDB para execução de tarefas de processamento de dados em Apache Spark em grande escala. Ele suporta análise de dados em tempo real, consultas complexas e aplicações de machine learning. O recurso simplifica o desenvolvimento em linguagens como Java, Scala ou Python e realiza dimensionamento automático para otimizar o desempenho e reduzir custos. Para configurar as tarefas, faça upload de arquivos JAR ou .py. Essa funcionalidade é ideal para setores que exigem processamento eficiente de grandes volumes de dados e insights em tempo real, pois ajuda empresas a extrair informações valiosas para impulsionar o crescimento dos negócios.
Pré-requisitos
Atenda aos seguintes pré-requisitos do AnalyticDB for MySQL:
Crie um cluster do AnalyticDB for MySQL Basic Edition na mesma região do seu workspace do DataWorks. Para mais informações, consulte Criar um cluster.
-
Configure um grupo de recursos de job no cluster do AnalyticDB for MySQL. Para mais informações, consulte Criar um grupo de recursos de job.
NotaAo usar o DataWorks para desenvolver aplicações Spark, é obrigatório criar um grupo de recursos de job.
Se você usar o OSS como armazenamento em um nó ADB Spark, verifique se o bucket do OSS está na mesma região do cluster do AnalyticDB for MySQL.
Atenda aos seguintes pré-requisitos do DataWorks:
Crie um workspace, selecione a opção Use Data Studio (New Version) e vincule um grupo de recursos ao workspace. Para mais informações, consulte Criar um workspace.
Vincule o grupo de recursos à mesma VPC do cluster do AnalyticDB for MySQL. Configure uma lista de permissões de endereços IP para o grupo de recursos no cluster do AnalyticDB for MySQL. Para mais informações, consulte Lista de permissões.
Adicione a instância do cluster do AnalyticDB for MySQL ao DataWorks como mecanismo de computação do tipo AnalyticDB for Spark. Teste a conectividade entre o grupo de recursos e o mecanismo de computação. Para mais informações, consulte Vincular um mecanismo de computação.
Crie uma pasta de workflow. Para mais informações, consulte Criar uma pasta de workflow.
Crie um nó ADB Spark. Para mais informações, consulte Criar um nó para um workflow.
Etapa 1: Desenvolver o nó ADB Spark
Em um nó ADB Spark, configure o conteúdo do nó de acordo com a linguagem selecionada. Use o pacote JAR de exemplo spark-examples_2.12-3.2.0.jar ou o arquivo de exemplo spark_oss.py. Para mais detalhes sobre o desenvolvimento do conteúdo do nó, consulte Desenvolver uma aplicação Spark usando a ferramenta de linha de comando spark-submit.
Configurar o conteúdo do nó ADB Spark (Java/Scala)
Preparar o arquivo para execução (JAR)
Faça upload do pacote JAR de exemplo para o OSS para permitir a execução do arquivo JAR na configuração do nó.
-
Prepare um pacote JAR de exemplo.
Baixe o pacote JAR de exemplo spark-examples_2.12-3.2.0.jar para usar no nó ADB Spark.
-
Faça upload do código de exemplo para o OSS.
Faça login no console do OSS. No painel de navegação à esquerda, clique em Buckets.
-
Na página Buckets, clique em Create Bucket. No painel Create Bucket, crie um bucket na mesma região do cluster do AnalyticDB for MySQL.
NotaEste tópico usa como exemplo um bucket chamado
dw-1127. -
Crie uma pasta de armazenamento externo.
Após criar o bucket, clique em Go to Bucket. Na página Objects, clique em Create Directory para criar uma pasta de armazenamento externo para seu banco de dados. Defina o Directory Name como
db_home. Faça upload do arquivo de código de exemplo
spark-examples_2.12-3.2.0.jarpara a pastadb_home. Para mais informações, consulte Fazer upload de um arquivo pelo console.
Configurar o nó ADB Spark
Configure o conteúdo do nó ADB Spark com os parâmetros a seguir.
Linguagem | Parâmetro | Descrição |
Java/Scala | Main JAR Resource | Caminho de armazenamento do recurso do pacote JAR no OSS. Exemplo: |
Main Class | Classe principal da tarefa no pacote JAR compilado. No código de exemplo, o nome da classe principal é | |
Parameters | Insira as informações de parâmetro a serem passadas para o código. É possível configurar este campo como parâmetro dinâmico no formato Nota No exemplo, o parâmetro dinâmico | |
Configuration Items | Configure aqui os parâmetros de tempo de execução do programa Spark. Para mais informações, consulte Parâmetros de configuração de aplicação Spark. Exemplo: |
Configurar o conteúdo do nó ADB Spark (Python)
Preparar o arquivo para execução (Python)
Faça upload do arquivo de dados de teste e do código de exemplo para o OSS. Isso permite que o código de exemplo na configuração do nó leia o arquivo de dados de teste.
-
Prepare os dados de teste.
Crie um arquivo
data.txte adicione o seguinte conteúdo:Hello,Dataworks Hello,OSS -
Escreva o código de exemplo.
Crie um arquivo
spark_oss.pye adicione o seguinte conteúdo:import sys from pyspark.sql import SparkSession # Initialize Spark. spark = SparkSession.builder.appName('OSS Example').getOrCreate() # Read the specified file. The file path is specified by the value passed in by args. textFile = spark.sparkContext.textFile(sys.argv[1]) # Calculate and print the number of lines in the file. print("File total lines: " + str(textFile.count())) # Print the first line of the file. print("First line is: " + textFile.first()) -
Faça upload dos dados de teste e do código de exemplo para o OSS.
Faça login no console do OSS. No painel de navegação à esquerda, clique em Buckets.
-
Na página Buckets, clique em Create Bucket. No painel Create Bucket, crie um bucket na mesma região do cluster do AnalyticDB for MySQL.
NotaEste tópico usa como exemplo um bucket chamado
dw-1127. -
Crie uma pasta de armazenamento externo.
Após criar o bucket, clique em Go to Bucket. Na página Objects, clique em Create Directory para criar uma pasta de armazenamento externo para o banco de dados. Defina o Directory Name como
db_home. Faça upload do arquivo de dados de teste
data.txte do arquivo de código de exemplospark_oss.pypara a pastadb_home. Para mais informações, consulte Fazer upload de um arquivo pelo console.
Configurar o nó ADB Spark
Configure o conteúdo do nó ADB Spark com os parâmetros a seguir.
Linguagem | Parâmetro | Descrição |
Python | Main Package | Insira o local de armazenamento do arquivo de código de exemplo a ser executado. Exemplo: |
Parameters | Insira as informações de parâmetro a serem passadas. No exemplo, trata-se do local de armazenamento do arquivo de dados de teste a ser lido. Exemplo: | |
Configuration Items | Configure aqui os parâmetros de tempo de execução do programa Spark. Para mais informações, consulte Parâmetros de configuração de aplicação Spark. Exemplo: |
Etapa 2: Depurar o nó ADB Spark
-
Configure as propriedades de depuração do nó ADB Spark.
Na seção Run Configuration, à direita do nó, configure os campos Computing Resource, AnalyticDB Computing Resource Group, Resource Group e CUs for Computing conforme descrito a seguir.
Tipo de parâmetro
Parâmetro
Descrição
Computing Resource
Computing Resource
Selecione o mecanismo de computação AnalyticDB for Spark vinculado.
AnalyticDB Computing Resource Group
Selecione o grupo de recursos de job criado no cluster do AnalyticDB for MySQL. Para mais informações, consulte Introdução aos grupos de recursos.
Resource Group
Resource Group
Selecione o grupo de recursos aprovado no teste de conectividade realizado ao vincular o mecanismo de computação AnalyticDB for Spark.
CUs for Computing
O nó atual usa o valor padrão de CU. Não é necessário modificar esse valor.
-
Depure e execute o nó ADB Spark.
Para executar a tarefa do nó, clique em Salve e depois em Execute.
Etapa 3: Agendar o nó ADB Spark
-
Configure as propriedades de agendamento do nó ADB Spark.
Para executar periodicamente uma tarefa de nó, configure os seguintes parâmetros na seção Scheduling Policies, na aba Scheduling, localizada no lado direito do nó. Para mais detalhes sobre a configuração de parâmetros, consulte Configurar agendamento para um nó.
Parâmetro
Descrição
Compute Resource
Selecione o mecanismo de computação AnalyticDB for Spark vinculado.
AnalyticDB Computing Resource Group
Selecione o grupo de recursos de job criado no cluster do AnalyticDB for MySQL. Para mais informações, consulte Introdução aos grupos de recursos.
Resource Group
Selecione o grupo de recursos aprovado no teste de conectividade realizado ao vincular o mecanismo de computação AnalyticDB for Spark.
CUs for Computing
O nó atual usa o valor padrão de CU. Não é necessário modificar esse valor.
-
Publique o nó ADB Spark.
Após configurar a tarefa do nó, publique-o. Para mais informações, consulte Publicar um nó ou workflow.
Próximas etapas
Após publicar a tarefa, visualize o status de execução da tarefa acionada automaticamente no Operation Center. Para mais informações, consulte Primeiros passos com o Operation Center.