O DolphinScheduler é um sistema de agendamento de workflows open source, distribuído e escalável, com interface visual de Grafo Acíclico Direcionado (DAG). Ele ajuda a executar e gerenciar processos de big data com eficiência. Use a interface web do DolphinScheduler para criar, editar e agendar jobs Spark no AnalyticDB for MySQL.
Pré-requisitos
Cluster do AnalyticDB for MySQL Enterprise Edition, Basic Edition ou Data Lakehouse Edition criado.
job-type resource group or an interactive resource group for the Spark engine criado no cluster do AnalyticDB for MySQL.
Java Development Kit (JDK) 1.8 ou posterior instalado.
Endereço IP do servidor DolphinScheduler adicionado à IP address whitelist do cluster do AnalyticDB for MySQL.
Agende jobs Spark SQL
É possível executar jobs Spark SQL no AnalyticDB for MySQL em dois modos: batch e interactive. Os procedimentos estão detalhados nas seções a seguir.
Batch
-
Install the spark-submit command-line tool e configure its parameters.
NotaConfigure apenas os parâmetros obrigatórios:
keyId,secretId,regionId,clusterIdergName. -
Crie um projeto.
Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Project.
Clique em Create Project.
Na caixa de diálogo Create Project, configure parâmetros como Project Name e Owned Users.
-
Crie um workflow.
Clique no nome do projeto para acessar a página Process Definition.
Clique em Create Workflow para abrir a página de workflow DAG edit.
Na lista de componentes do painel à esquerda, arraste Shell para o canvas à direita.
-
Na caixa de diálogo Current node settings, configure os seguintes parâmetros:
Parâmetro
Descrição
Node Name
Nome do nó do workflow.
Script
Caminho de instalação da ferramenta de linha de comando spark-submit e código do job Spark SQL. Exemplo:
/root/adb-spark-toolkit-submit/bin/spark-submit --class com.aliyun.adb.spark.sql.OfflineSqlTemplate local:///opt/spark/jars/offline-sql.jar "show databases" "select 100"ImportanteEspecifique o caminho completo de instalação do spark-submit no script. Caso contrário, a tarefa de agendamento não encontrará o comando.
NotaPara obter mais informações sobre outros parâmetros, consulte Parâmetros de Tarefa do DolphinScheduler.
Clique em OK.
No canto superior direito da página, clique em Save. Na caixa de diálogo Basic Information, configure parâmetros como Workflow Name e clique em OK.
-
Execute o workflow.
Localize o workflow criado e clique no ícone
na coluna Operation para publicar o workflow.Clique no ícone
na coluna Operation.Na caixa de diálogo Please set the parameters before starting, configure os parâmetros.
Clique em Confirm para executar o workflow.
-
Visualize os detalhes do workflow.
No painel de navegação à esquerda, escolha Task > Task Instance.
Localize as tarefas do workflow e clique no ícone
na coluna Operation para visualizar os resultados da execução e os logs do workflow.
Interactive
-
Obtenha a URL de conexão do grupo de recursos interativo Spark.
Acesse o console do AnalyticDB for MySQL. No canto superior esquerdo do console, selecione uma região. No painel de navegação à esquerda, clique em Clusters. Localize o cluster que deseja gerenciar e clique no ID do cluster.
No painel de navegação à esquerda, escolha . Na página exibida, clique na aba Resource Groups.
-
Localize o grupo de recursos interativo Spark criado e clique em Details na coluna Actions para visualizar a URL de conexão interna ou pública do grupo de recursos. Clique no ícone
entre parênteses ao lado do número da porta correspondente para copiar a URL de conexão.Clique em Apply for Endpoint ao lado de Public Endpoint para solicitar manualmente um endpoint público nos seguintes cenários:
A ferramenta cliente usada para enviar um job Spark SQL está implantada on-premises.
A ferramenta cliente usada para enviar um job Spark SQL está implantada em uma instância do Elastic Compute Service (ECS) residente em uma Virtual Private Cloud (VPC) diferente daquela do cluster AnalyticDB for MySQL.
-
Crie uma fonte de dados.
Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Datasource.
Clique em Add Data Source e selecione Spark como tipo de fonte de dados.
-
Na caixa de diálogo Add Data Source, configure os seguintes parâmetros:
Parâmetro
Descrição
Data Source
Selecione Spark.
Datasource name
Nome da fonte de dados.
IPHost Name
Insira a URL de conexão obtida na Etapa 1. Na URL, substitua
defaultpelo nome real do banco de dados e remova o sufixo
resource_group=<resource_group_name>.Exemplo:
jdbc:hive2://amv-t4naxpqk****sparkwho.ads.aliyuncs.com:10000/adb_demo.Port
O número da porta do grupo de recursos interativo Spark é fixo em 10000.
Username
Conta de banco de dados do AnalyticDB for MySQL.
Database Name
Nome do banco de dados do cluster AnalyticDB for MySQL.
NotaOs demais parâmetros são opcionais. Para mais informações, consulte Fonte de Dados MySQL.
Clique em Test Connection. Após o teste bem-sucedido, clique em OK.
-
Crie um projeto.
Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Project.
Clique em Create Project.
Na caixa de diálogo Create Project, configure parâmetros como Project Name e Owned Users.
-
Crie um workflow.
Clique no nome do projeto para acessar a página Process Definition.
Clique em Create Workflow para abrir a página de workflow DAG edit.
Na lista de componentes do painel à esquerda, arraste SQL para o canvas à direita.
-
Na caixa de diálogo Current node settings, configure os seguintes parâmetros:
Parâmetro
Descrição
Data Source Type
Selecione Spark.
Datasource instance
Selecione a fonte de dados criada na Etapa 2.
SQLType
Tipo do job SQL, como Queries ou Non Query.
SQL statement
Instrução SQL a ser executada.
Clique em OK.
No canto superior direito da página, clique em Save. Na caixa de diálogo Basic Information, configure parâmetros como Workflow Name e clique em OK.
-
Execute o workflow.
Localize o workflow criado e clique no ícone
na coluna Operation para publicar o workflow.Clique no ícone
na coluna Operation.Na caixa de diálogo Please set the parameters before starting, configure os parâmetros.
Clique em Confirm para executar o workflow.
-
Visualize os detalhes do workflow.
No painel de navegação à esquerda, escolha Task > Task Instance.
Localize as tarefas do workflow e clique no ícone
na coluna Operation para visualizar os resultados da execução e os logs do workflow.
Agende jobs Spark JAR
-
Install the spark-submit command-line tool e configure its parameters.
NotaConfigure apenas os parâmetros obrigatórios:
keyId,secretId,regionId,clusterIdergName. Se o pacote Spark JAR estiver armazenado localmente, também será necessário configurar parâmetros relacionados ao Object Storage Service (OSS), comoossUploadPath. -
Crie um projeto.
Faça login na interface web do DolphinScheduler. Na barra de navegação superior, clique em Project.
Clique em Create Project.
Na caixa de diálogo Create Project, configure parâmetros como Project Name e Owned Users.
-
Crie um workflow.
Clique no nome do projeto para acessar a página Process Definition.
Clique em Create Workflow para abrir a página de workflow DAG edit.
Na lista de componentes do painel à esquerda, arraste Shell para o canvas à direita.
-
Na caixa de diálogo Current node settings, configure os seguintes parâmetros:
Parâmetro
Descrição
Node Name
Nome do nó do workflow.
Script
Caminho de instalação da ferramenta de linha de comando spark-submit e código do job Spark. Exemplo:
/root/adb-spark-toolkit-submit/bin/spark-submit --class org.apache.spark.examples.SparkPi --name SparkPi --conf spark.driver.resourceSpec=medium --conf spark.executor.instances=2 --conf spark.executor.resourceSpec=medium local:///tmp/spark-examples.jar 1000.ImportanteEspecifique o caminho completo de instalação do spark-submit no script. Caso contrário, a tarefa de agendamento não encontrará o comando.
NotaPara obter mais informações sobre outros parâmetros, consulte Parâmetros de Tarefa do DolphinScheduler.
Clique em OK.
No canto superior direito da página, clique em Save. Na caixa de diálogo Basic Information, configure parâmetros como Workflow Name e clique em OK.
-
Execute o workflow.
Localize o workflow criado e clique no ícone
na coluna Operation para publicar o workflow.Clique no ícone
na coluna Operation.Na caixa de diálogo Please set the parameters before starting, configure os parâmetros.
Clique em Confirm para executar o workflow.
-
Visualize os detalhes do workflow.
No painel de navegação à esquerda, escolha Task > Task Instance.
Localize as tarefas do workflow e clique no ícone
na coluna Operation para visualizar os resultados da execução e os logs do workflow.