Todos os produtos
Search
Central de documentação

DataWorks:Nó ADB Spark

Última atualização: Jun 27, 2026

O DataWorks oferece nós ADB Spark para desenvolver, agendar e integrar tarefas do AnalyticDB Spark a outros tipos de tarefa. Este tópico descreve como usar um nó ADB Spark no desenvolvimento de tarefas.

Contexto

O ADB Spark é um mecanismo de computação do AnalyticDB para execução de tarefas de processamento de dados em Apache Spark em grande escala. Ele suporta análise de dados em tempo real, consultas complexas e aplicações de machine learning. O recurso simplifica o desenvolvimento em linguagens como Java, Scala ou Python e realiza dimensionamento automático para otimizar o desempenho e reduzir custos. Para configurar as tarefas, faça upload de arquivos JAR ou .py. Essa funcionalidade é ideal para setores que exigem processamento eficiente de grandes volumes de dados e insights em tempo real, pois ajuda empresas a extrair informações valiosas para impulsionar o crescimento dos negócios.

Pré-requisitos

Atenda aos seguintes pré-requisitos do AnalyticDB for MySQL:

  • Crie um cluster do AnalyticDB for MySQL Basic Edition na mesma região do seu workspace do DataWorks. Para mais informações, consulte Criar um cluster.

  • Configure um grupo de recursos de job no cluster do AnalyticDB for MySQL. Para mais informações, consulte Criar um grupo de recursos de job.

    Nota

    Ao usar o DataWorks para desenvolver aplicações Spark, é obrigatório criar um grupo de recursos de job.

  • Se você usar o OSS como armazenamento em um nó ADB Spark, verifique se o bucket do OSS está na mesma região do cluster do AnalyticDB for MySQL.

Atenda aos seguintes pré-requisitos do DataWorks:

  • Crie um workspace, selecione a opção Use Data Studio (New Version) e vincule um grupo de recursos ao workspace. Para mais informações, consulte Criar um workspace.

  • Vincule o grupo de recursos à mesma VPC do cluster do AnalyticDB for MySQL. Configure uma lista de permissões de endereços IP para o grupo de recursos no cluster do AnalyticDB for MySQL. Para mais informações, consulte Lista de permissões.

  • Adicione a instância do cluster do AnalyticDB for MySQL ao DataWorks como mecanismo de computação do tipo AnalyticDB for Spark. Teste a conectividade entre o grupo de recursos e o mecanismo de computação. Para mais informações, consulte Vincular um mecanismo de computação.

  • Crie uma pasta de workflow. Para mais informações, consulte Criar uma pasta de workflow.

  • Crie um nó ADB Spark. Para mais informações, consulte Criar um nó para um workflow.

Etapa 1: Desenvolver o nó ADB Spark

Em um nó ADB Spark, configure o conteúdo do nó de acordo com a linguagem selecionada. Use o pacote JAR de exemplo spark-examples_2.12-3.2.0.jar ou o arquivo de exemplo spark_oss.py. Para mais detalhes sobre o desenvolvimento do conteúdo do nó, consulte Desenvolver uma aplicação Spark usando a ferramenta de linha de comando spark-submit.

Configurar o conteúdo do nó ADB Spark (Java/Scala)

Preparar o arquivo para execução (JAR)

Faça upload do pacote JAR de exemplo para o OSS para permitir a execução do arquivo JAR na configuração do nó.

  1. Prepare um pacote JAR de exemplo.

    Baixe o pacote JAR de exemplo spark-examples_2.12-3.2.0.jar para usar no nó ADB Spark.

  2. Faça upload do código de exemplo para o OSS.

    1. Faça login no console do OSS. No painel de navegação à esquerda, clique em Buckets.

    2. Na página Buckets, clique em Create Bucket. No painel Create Bucket, crie um bucket na mesma região do cluster do AnalyticDB for MySQL.

      Nota

      Este tópico usa como exemplo um bucket chamado dw-1127.

    3. Crie uma pasta de armazenamento externo.

      Após criar o bucket, clique em Go to Bucket. Na página Objects, clique em Create Directory para criar uma pasta de armazenamento externo para seu banco de dados. Defina o Directory Name como db_home.

    4. Faça upload do arquivo de código de exemplo spark-examples_2.12-3.2.0.jar para a pasta db_home. Para mais informações, consulte Fazer upload de um arquivo pelo console.

Configurar o nó ADB Spark

Configure o conteúdo do nó ADB Spark com os parâmetros a seguir.

Linguagem

Parâmetro

Descrição

Java/Scala

Main JAR Resource

Caminho de armazenamento do recurso do pacote JAR no OSS. Exemplo: oss://dw-1127/db_home/spark-examples_2.12-3.2.0.jar.

Main Class

Classe principal da tarefa no pacote JAR compilado. No código de exemplo, o nome da classe principal é org.apache.spark.examples.SparkPi.

Parameters

Insira as informações de parâmetro a serem passadas para o código. É possível configurar este campo como parâmetro dinâmico no formato ${var}.

Nota

No exemplo, o parâmetro dinâmico ${var} pode ser definido como 1000.

Configuration Items

Configure aqui os parâmetros de tempo de execução do programa Spark. Para mais informações, consulte Parâmetros de configuração de aplicação Spark. Exemplo:

spark.driver.resourceSpec:medium

Configurar o conteúdo do nó ADB Spark (Python)

Preparar o arquivo para execução (Python)

Faça upload do arquivo de dados de teste e do código de exemplo para o OSS. Isso permite que o código de exemplo na configuração do nó leia o arquivo de dados de teste.

  1. Prepare os dados de teste.

    Crie um arquivo data.txt e adicione o seguinte conteúdo:

    Hello,Dataworks
    Hello,OSS
  2. Escreva o código de exemplo.

    Crie um arquivo spark_oss.py e adicione o seguinte conteúdo:

    import sys
    
    from pyspark.sql import SparkSession
    
    # Initialize Spark.
    spark = SparkSession.builder.appName('OSS Example').getOrCreate()
    # Read the specified file. The file path is specified by the value passed in by args.
    textFile = spark.sparkContext.textFile(sys.argv[1])
    # Calculate and print the number of lines in the file.
    print("File total lines: " + str(textFile.count()))
    # Print the first line of the file.
    print("First line is: " + textFile.first())
    
  3. Faça upload dos dados de teste e do código de exemplo para o OSS.

    1. Faça login no console do OSS. No painel de navegação à esquerda, clique em Buckets.

    2. Na página Buckets, clique em Create Bucket. No painel Create Bucket, crie um bucket na mesma região do cluster do AnalyticDB for MySQL.

      Nota

      Este tópico usa como exemplo um bucket chamado dw-1127.

    3. Crie uma pasta de armazenamento externo.

      Após criar o bucket, clique em Go to Bucket. Na página Objects, clique em Create Directory para criar uma pasta de armazenamento externo para o banco de dados. Defina o Directory Name como db_home.

    4. Faça upload do arquivo de dados de teste data.txt e do arquivo de código de exemplo spark_oss.py para a pasta db_home. Para mais informações, consulte Fazer upload de um arquivo pelo console.

Configurar o nó ADB Spark

Configure o conteúdo do nó ADB Spark com os parâmetros a seguir.

Linguagem

Parâmetro

Descrição

Python

Main Package

Insira o local de armazenamento do arquivo de código de exemplo a ser executado. Exemplo: oss://dw-1127/db_home/spark_oss.py.

Parameters

Insira as informações de parâmetro a serem passadas. No exemplo, trata-se do local de armazenamento do arquivo de dados de teste a ser lido. Exemplo: oss://dw-1127/db_home/data.txt.

Configuration Items

Configure aqui os parâmetros de tempo de execução do programa Spark. Para mais informações, consulte Parâmetros de configuração de aplicação Spark. Exemplo:

spark.driver.resourceSpec:medium

Etapa 2: Depurar o nó ADB Spark

  1. Configure as propriedades de depuração do nó ADB Spark.

    Na seção Run Configuration, à direita do nó, configure os campos Computing Resource, AnalyticDB Computing Resource Group, Resource Group e CUs for Computing conforme descrito a seguir.

    Tipo de parâmetro

    Parâmetro

    Descrição

    Computing Resource

    Computing Resource

    Selecione o mecanismo de computação AnalyticDB for Spark vinculado.

    AnalyticDB Computing Resource Group

    Selecione o grupo de recursos de job criado no cluster do AnalyticDB for MySQL. Para mais informações, consulte Introdução aos grupos de recursos.

    Resource Group

    Resource Group

    Selecione o grupo de recursos aprovado no teste de conectividade realizado ao vincular o mecanismo de computação AnalyticDB for Spark.

    CUs for Computing

    O nó atual usa o valor padrão de CU. Não é necessário modificar esse valor.

  2. Depure e execute o nó ADB Spark.

    Para executar a tarefa do nó, clique em Salve e depois em Execute.

Etapa 3: Agendar o nó ADB Spark

  1. Configure as propriedades de agendamento do nó ADB Spark.

    Para executar periodicamente uma tarefa de nó, configure os seguintes parâmetros na seção Scheduling Policies, na aba Scheduling, localizada no lado direito do nó. Para mais detalhes sobre a configuração de parâmetros, consulte Configurar agendamento para um nó.

    Parâmetro

    Descrição

    Compute Resource

    Selecione o mecanismo de computação AnalyticDB for Spark vinculado.

    AnalyticDB Computing Resource Group

    Selecione o grupo de recursos de job criado no cluster do AnalyticDB for MySQL. Para mais informações, consulte Introdução aos grupos de recursos.

    Resource Group

    Selecione o grupo de recursos aprovado no teste de conectividade realizado ao vincular o mecanismo de computação AnalyticDB for Spark.

    CUs for Computing

    O nó atual usa o valor padrão de CU. Não é necessário modificar esse valor.

  2. Publique o nó ADB Spark.

    Após configurar a tarefa do nó, publique-o. Para mais informações, consulte Publicar um nó ou workflow.

Próximas etapas

Após publicar a tarefa, visualize o status de execução da tarefa acionada automaticamente no Operation Center. Para mais informações, consulte Primeiros passos com o Operation Center.