Todos os produtos
Search
Central de documentação

AnalyticDB:Schedule Spark jobs with DolphinScheduler

Última atualização: Aug 21, 2026

O DolphinScheduler é um sistema de agendamento de workflows open source, distribuído e escalável, com interface visual de Grafo Acíclico Direcionado (DAG). Ele ajuda a executar e gerenciar processos de big data com eficiência. Use a interface web do DolphinScheduler para criar, editar e agendar jobs Spark no AnalyticDB for MySQL.

Pré-requisitos

Agende jobs Spark SQL

É possível executar jobs Spark SQL no AnalyticDB for MySQL em dois modos: batch e interactive. Os procedimentos estão detalhados nas seções a seguir.

Batch

  1. Install the spark-submit command-line tool e configure its parameters.

    Nota

    Configure apenas os parâmetros obrigatórios: keyId, secretId, regionId, clusterId e rgName.

  2. Crie um projeto.

    1. Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Project.

    2. Clique em Create Project.

    3. Na caixa de diálogo Create Project, configure parâmetros como Project Name e Owned Users.

  3. Crie um workflow.

    1. Clique no nome do projeto para acessar a página Process Definition.

    2. Clique em Create Workflow para abrir a página de workflow DAG edit.

    3. Na lista de componentes do painel à esquerda, arraste Shell para o canvas à direita.

    4. Na caixa de diálogo Current node settings, configure os seguintes parâmetros:

      Parâmetro

      Descrição

      Node Name

      Nome do nó do workflow.

      Script

      Caminho de instalação da ferramenta de linha de comando spark-submit e código do job Spark SQL. Exemplo: /root/adb-spark-toolkit-submit/bin/spark-submit --class com.aliyun.adb.spark.sql.OfflineSqlTemplate local:///opt/spark/jars/offline-sql.jar "show databases" "select 100"

      Importante

      Especifique o caminho completo de instalação do spark-submit no script. Caso contrário, a tarefa de agendamento não encontrará o comando.

      Nota

      Para obter mais informações sobre outros parâmetros, consulte Parâmetros de Tarefa do DolphinScheduler.

    5. Clique em OK.

    6. No canto superior direito da página, clique em Save. Na caixa de diálogo Basic Information, configure parâmetros como Workflow Name e clique em OK.

  4. Execute o workflow.

    1. Localize o workflow criado e clique no ícone image na coluna Operation para publicar o workflow.

    2. Clique no ícone image na coluna Operation.

    3. Na caixa de diálogo Please set the parameters before starting, configure os parâmetros.

    4. Clique em Confirm para executar o workflow.

  5. Visualize os detalhes do workflow.

    1. No painel de navegação à esquerda, escolha Task > Task Instance.

    2. Localize as tarefas do workflow e clique no ícone image na coluna Operation para visualizar os resultados da execução e os logs do workflow.

Interactive

  1. Obtenha a URL de conexão do grupo de recursos interativo Spark.

    1. Acesse o console do AnalyticDB for MySQL. No canto superior esquerdo do console, selecione uma região. No painel de navegação à esquerda, clique em Clusters. Localize o cluster que deseja gerenciar e clique no ID do cluster.

    2. No painel de navegação à esquerda, escolha Cluster Management > Resource Management. Na página exibida, clique na aba Resource Groups.

    3. Localize o grupo de recursos interativo Spark criado e clique em Details na coluna Actions para visualizar a URL de conexão interna ou pública do grupo de recursos. Clique no ícone image entre parênteses ao lado do número da porta correspondente para copiar a URL de conexão.

      Clique em Apply for Endpoint ao lado de Public Endpoint para solicitar manualmente um endpoint público nos seguintes cenários:

      • A ferramenta cliente usada para enviar um job Spark SQL está implantada on-premises.

      • A ferramenta cliente usada para enviar um job Spark SQL está implantada em uma instância do Elastic Compute Service (ECS) residente em uma Virtual Private Cloud (VPC) diferente daquela do cluster AnalyticDB for MySQL.

  2. Crie uma fonte de dados.

    1. Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Datasource.

    2. Clique em Add Data Source e selecione Spark como tipo de fonte de dados.

    3. Na caixa de diálogo Add Data Source, configure os seguintes parâmetros:

      Parâmetro

      Descrição

      Data Source

      Selecione Spark.

      Datasource name

      Nome da fonte de dados.

      IPHost Name

      Insira a URL de conexão obtida na Etapa 1. Na URL, substitua default

      pelo nome real do banco de dados e remova o sufixo resource_group=<resource_group_name>.

      Exemplo: jdbc:hive2://amv-t4naxpqk****sparkwho.ads.aliyuncs.com:10000/adb_demo.

      Port

      O número da porta do grupo de recursos interativo Spark é fixo em 10000.

      Username

      Conta de banco de dados do AnalyticDB for MySQL.

      Database Name

      Nome do banco de dados do cluster AnalyticDB for MySQL.

      Nota

      Os demais parâmetros são opcionais. Para mais informações, consulte Fonte de Dados MySQL.

    4. Clique em Test Connection. Após o teste bem-sucedido, clique em OK.

  3. Crie um projeto.

    1. Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Project.

    2. Clique em Create Project.

    3. Na caixa de diálogo Create Project, configure parâmetros como Project Name e Owned Users.

  4. Crie um workflow.

    1. Clique no nome do projeto para acessar a página Process Definition.

    2. Clique em Create Workflow para abrir a página de workflow DAG edit.

    3. Na lista de componentes do painel à esquerda, arraste SQL para o canvas à direita.

    4. Na caixa de diálogo Current node settings, configure os seguintes parâmetros:

      Parâmetro

      Descrição

      Data Source Type

      Selecione Spark.

      Datasource instance

      Selecione a fonte de dados criada na Etapa 2.

      SQLType

      Tipo do job SQL, como Queries ou Non Query.

      SQL statement

      Instrução SQL a ser executada.

    5. Clique em OK.

    6. No canto superior direito da página, clique em Save. Na caixa de diálogo Basic Information, configure parâmetros como Workflow Name e clique em OK.

  5. Execute o workflow.

    1. Localize o workflow criado e clique no ícone image na coluna Operation para publicar o workflow.

    2. Clique no ícone image na coluna Operation.

    3. Na caixa de diálogo Please set the parameters before starting, configure os parâmetros.

    4. Clique em Confirm para executar o workflow.

  6. Visualize os detalhes do workflow.

    1. No painel de navegação à esquerda, escolha Task > Task Instance.

    2. Localize as tarefas do workflow e clique no ícone image na coluna Operation para visualizar os resultados da execução e os logs do workflow.

Agende jobs Spark JAR

  1. Install the spark-submit command-line tool e configure its parameters.

    Nota

    Configure apenas os parâmetros obrigatórios: keyId, secretId, regionId, clusterId e rgName. Se o pacote Spark JAR estiver armazenado localmente, também será necessário configurar parâmetros relacionados ao Object Storage Service (OSS), como ossUploadPath.

  2. Crie um projeto.

    1. Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Project.

    2. Clique em Create Project.

    3. Na caixa de diálogo Create Project, configure parâmetros como Project Name e Owned Users.

  3. Crie um workflow.

    1. Clique no nome do projeto para acessar a página Process Definition.

    2. Clique em Create Workflow para abrir a página de workflow DAG edit.

    3. Na lista de componentes do painel à esquerda, arraste Shell para o canvas à direita.

    4. Na caixa de diálogo Current node settings, configure os seguintes parâmetros:

      Parâmetro

      Descrição

      Node Name

      Nome do nó do workflow.

      Script

      Caminho de instalação da ferramenta de linha de comando spark-submit e código do job Spark. Exemplo:

      /root/adb-spark-toolkit-submit/bin/spark-submit --class org.apache.spark.examples.SparkPi --name SparkPi --conf spark.driver.resourceSpec=medium --conf spark.executor.instances=2 --conf spark.executor.resourceSpec=medium local:///tmp/spark-examples.jar 1000.

      Importante

      Especifique o caminho completo de instalação do spark-submit no script. Caso contrário, a tarefa de agendamento não encontrará o comando.

      Nota

      Para obter mais informações sobre outros parâmetros, consulte Parâmetros de Tarefa do DolphinScheduler.

    5. Clique em OK.

    6. No canto superior direito da página, clique em Save. Na caixa de diálogo Basic Information, configure parâmetros como Workflow Name e clique em OK.

  4. Execute o workflow.

    1. Localize o workflow criado e clique no ícone image na coluna Operation para publicar o workflow.

    2. Clique no ícone image na coluna Operation.

    3. Na caixa de diálogo Please set the parameters before starting, configure os parâmetros.

    4. Clique em Confirm para executar o workflow.

  5. Visualize os detalhes do workflow.

    1. No painel de navegação à esquerda, escolha Task > Task Instance.

    2. Localize as tarefas do workflow e clique no ícone image na coluna Operation para visualizar os resultados da execução e os logs do workflow.