O nó ADB Spark SQL no DataWorks permite desenvolver, agendar periodicamente e integrar tarefas do AnalyticDB Spark SQL a outras tarefas. Este tópico descreve o fluxo de trabalho para desenvolver tarefas com um nó ADB Spark SQL.
Informações básicas
Desenvolvedores de dados podem enviar instruções Spark SQL diretamente no console do AnalyticDB for MySQL para análise de dados. Após adicionar uma instância do AnalyticDB for MySQL Serverless Spark ao DataWorks como recurso de computação, use o nó ADB Spark SQL para executar tarefas Spark SQL. Para mais informações, consulte Introdução ao desenvolvimento com Spark SQL.
Pré-requisitos
Pré-requisitos para o AnalyticDB for MySQL:
Crie um cluster do AnalyticDB for MySQL da Basic Edition na mesma região do seu workspace do DataWorks. Para mais informações, consulte Criar um cluster.
Configure um grupo de recursos interativo com o tipo de mecanismo definido como Spark no cluster do AnalyticDB for MySQL para executar tarefas Spark SQL a partir do DataWorks. Para mais informações, consulte Criar um grupo de recursos interativo.
Se precisar usar o Object Storage Service (OSS) em um nó ADB Spark SQL, verifique se o bucket do OSS está na mesma região do cluster do AnalyticDB for MySQL.
Pré-requisitos para o DataWorks:
Tenha um workspace com a opção Use Data Studio (New Version) ativada e um grupo de recursos vinculado. Para mais informações, consulte Criar um workspace.
Implante o grupo de recursos na mesma virtual private cloud (VPC) do cluster do AnalyticDB for MySQL e adicione os endereços IP do grupo de recursos à lista de permissões do cluster do AnalyticDB for MySQL. Para mais informações, consulte Configurar uma lista de permissões.
Adicione a instância do cluster do AnalyticDB for MySQL ao DataWorks como recurso de computação AnalyticDB for Spark e verifique a conectividade por meio do grupo de recursos. Para mais informações, consulte Vincular um recurso de computação.
Crie um nó ADB Spark SQL. Para mais informações, consulte Criar um nó para um fluxo de trabalho de agendamento.
Etapa 1: Desenvolver o nó ADB Spark SQL
-
Crie um banco de dados externo.
No editor de nós, escreva o código SQL. O exemplo a seguir mostra como criar um banco de dados externo em um nó ADB Spark SQL. Para criar uma tabela interna, consulte Criar uma tabela interna usando Spark SQL.
CREATE DATABASE IF NOT EXISTS `adb_spark_db` location 'oss://dw-1127/db_home'; -
Desenvolva o nó ADB Spark SQL.
No editor SQL, escreva o código da tarefa. Defina variáveis no formato ${variable_name} e atribua valores na seção Scheduling Parameters do painel Scheduling Settings à direita. Essa configuração permite a passagem dinâmica de parâmetros durante execuções agendadas. Para mais informações sobre parâmetros de agendamento, consulte Fontes e expressões de parâmetros de agendamento. O código a seguir apresenta um exemplo.
CREATE TABLE IF NOT EXISTS adb_spark_db.tb_order_${var}(id int, name string, age int) USING parquet location 'oss://dw-1127/db_home/tb1' tblproperties ('parquet.compress'='SNAPPY'); CREATE TABLE IF NOT EXISTS adb_spark_db.tb_order_result_${var}(id int, name string, age int) USING parquet location 'oss://dw-1127/db_home/tb2' tblproperties ('parquet.compress'='SNAPPY'); INSERT INTO adb_spark_db.tb_order_result_${var} SELECT * FROM adb_spark_db.tb_order_${var};NotaA variável
${var}no exemplo pode ser definida como$[yyyymmdd]. Isso permite processar dados incrementais diários em lotes.
Etapa 2: Depurar o nó ADB Spark SQL
-
Configure as propriedades de execução do nó ADB Spark SQL.
No painel Run Configuration à direita, configure os parâmetros Compute Resource, ADB Computing Resource Group, Resource Group e Compute CU. Para mais detalhes, consulte a tabela a seguir.
Tipo de parâmetro
Parâmetro
Descrição
Compute Resource
Compute Resource
Selecione o recurso de computação AnalyticDB for Spark vinculado ao workspace.
ADB Computing Resource Group
Selecione o grupo de recursos interativo criado no cluster do AnalyticDB for MySQL. Para mais informações, consulte Criar e gerenciar um grupo de recursos - [Este documento está offline e foi substituído por uma nova versão. Nenhuma revisão é necessária.].
NotaO tipo de mecanismo do grupo de recursos interativo deve ser Spark.
Resource Group
Resource Group
Selecione o grupo de recursos aprovado no teste de conectividade ao vincular o recurso de computação AnalyticDB for Spark.
Compute CU
O nó usa o número padrão de unidades de computação (CUs). Não é necessário alterar esse valor.
-
Depure e execute o nó ADB Spark SQL.
Para executar a tarefa, clique em Save e depois em Run.
Etapa 3: Agendar o nó ADB Spark SQL
-
Defina as propriedades de agendamento do nó ADB Spark SQL.
Para executar o nó periodicamente, acesse o painel Scheduling Settings à direita. Na seção Scheduling Policy, configure os parâmetros abaixo conforme suas necessidades de negócio. Para mais informações sobre outros parâmetros, consulte Configurar o agendamento de um nó.
Parâmetro
Descrição
Compute Resource
Selecione o recurso de computação AnalyticDB for Spark vinculado ao workspace.
ADB Computing Resource Group
Selecione o grupo de recursos interativo criado no cluster do AnalyticDB for MySQL. Para mais informações, consulte Criar e gerenciar um grupo de recursos - [Este documento está offline e foi substituído por uma nova versão. Nenhuma revisão é necessária.].
NotaO tipo de mecanismo do grupo de recursos interativo deve ser Spark.
Resource Group
Selecione o grupo de recursos aprovado no teste de conectividade ao vincular o recurso de computação AnalyticDB for Spark.
Compute CU
O nó usa o número padrão de unidades de computação (CUs). Não é necessário alterar esse valor.
-
Implante o nó ADB Spark SQL.
Após configurar o nó, implante-o. Para mais informações, consulte Implantar um nó ou fluxo de trabalho.
Próximas etapas
Após implantar a tarefa, visualize o status de execução da tarefa periódica no Operation Center. Para mais informações, consulte Primeiros passos com o Operation Center.