Todos os produtos
Search
Central de documentação

DataWorks:Nó Serverless Spark SQL

Última atualização: Jun 30, 2026

Crie um nó Serverless Spark SQL para processar dados estruturados com um mecanismo de consulta SQL distribuído baseado em um recurso de computação EMR Serverless Spark. Essa abordagem aumenta a eficiência na execução de jobs.

Observações de uso

  • Limitações de recursos de computação: O sistema oferece suporte apenas a recursos de computação EMR Serverless Spark vinculados. Garanta que o grupo de recursos e o recurso de computação tenham comunicação via rede.

  • Restrições de grupos de recursos: Esta tarefa é executada exclusivamente em um grupo de recursos Serverless.

  • (Opcional, para usuários RAM) Adicione o usuário do Resource Access Management (RAM) responsável pelo desenvolvimento da tarefa ao workspace e atribua a função Development ou Workspace Administrator (esta função possui permissões amplas e deve ser concedida com cautela). Para mais informações, consulte Adicionar membros ao workspace.

    Caso esteja utilizando uma conta raiz, ignore esta etapa.

Criar um nó

Para obter instruções, consulte Criar um nó.

Desenvolver o nó

Desenvolva o código da tarefa no editor SQL. A sintaxe aceita o formato catalog.database.tablename. Se você omitir catalog, o sistema usará o Data Catalog padrão do cluster. Se omitir catalog.database, o sistema usará o banco de dados padrão do Data Catalog padrão do cluster.

Para mais informações sobre o Data Catalog, consulte Gerenciar um Data Catalog no EMR Serverless Spark .

-- Substitua <catalog.database.tablename> pelos seus identificadores reais. SELECT * FROM <catalog.database.tablename>

Defina variáveis no código usando o formato ${variable_name}. Em seguida, atribua valores a essas variáveis na seção Scheduling Parameters do painel Scheduling Settings. Isso permite a passagem dinâmica de parâmetros em cenários agendados. Para mais detalhes sobre parâmetros de agendamento, consulte Fontes e expressões de parâmetros de agendamento. O código abaixo apresenta um exemplo.

SHOW TABLES; -- Use ${var} para definir uma variável chamada var. Se você atribuir o valor ${yyyymmdd} a essa variável, poderá usar uma tarefa agendada para criar uma tabela com a data comercial como sufixo. CREATE TABLE IF NOT EXISTS userinfo_new_${var} ( ip STRING COMMENT'IP address', uid STRING COMMENT'User ID' )PARTITIONED BY( dt STRING ); --Isso pode ser usado com parâmetros de agendamento.

Nota

Uma instrução SQL não pode exceder 130 KB.

Depurar o nó

  1. Na seção Run Configuration, selecione um Compute Resource e um Resource Group.

    Parâmetro

    Descrição

    Compute Resource

    Selecione um recurso de computação EMR Serverless Spark vinculado. Se nenhum recurso de computação estiver disponível, selecione Create Compute Resource na lista suspensa.

    Resource Group

    Selecione um grupo de recursos associado ao workspace.

    Script Parameters

    Ao configurar o conteúdo do nó, defina variáveis usando o formato ${parameter_name}. Depois, configure o Parameter name e o Parameter Value na seção Script Parameters. Essas variáveis são substituídas dinamicamente pelos valores reais durante a execução. Para mais informações, consulte Fontes e expressões de parâmetros de agendamento.

    ServerlessSpark Node Parameters

    Parâmetros de runtime do Spark. Os seguintes tipos são suportados:

  2. Na barra de ferramentas na parte superior do editor de nós, clique em Run para executar a tarefa SQL.

    Importante

    Antes da implantação, sincronize os Serverlessspark Node Parameters da Run Configuration para os Serverlessspark Node Parameters nas Scheduling Settings.

Modos de execução SQL

O DataWorks oferece dois modos de execução SQL: execução dentro do nó e execução a partir do painel de workflow. Esses dois modos possuem contextos de execução diferentes e podem produzir resultados distintos.

  • Executar dentro do nó: Selecione todas as instruções SQL no editor SQL e clique em Run. Apenas as instruções SQL selecionadas serão executadas. Este modo utiliza o recurso de computação e os parâmetros configurados para o nó, sem acionar relações de dependência com nós upstream ou downstream.

  • Executar a partir do painel de workflow: Clique com o botão direito no nó atual no painel de workflow e execute o nó atual juntamente com seus nós downstream. O nó atual e todos os seus nós downstream são executados sequencialmente com base nas dependências de agendamento. Este modo usa o recurso de computação e os parâmetros especificados nas configurações de agendamento, que podem diferir do ambiente de runtime da execução dentro do nó.

As causas comuns para diferenças entre os dois modos incluem valores distintos de parâmetros de agendamento, configurações inconsistentes de recursos de computação e a saída de nós upstream afetando o contexto de execução do nó atual. Para solucionar problemas, compare os parâmetros de agendamento e as configurações de recursos de computação utilizados pelos dois modos.

Próximas etapas

  • Configurar o agendamento do nó: Se precisar executar um nó periodicamente, configure sua Scheduling Policy no painel Scheduling Settings à direita.

  • Publicar um nó: Para executar uma tarefa no ambiente de produção, clique no ícone image para publicar o nó. Um nó só é executado conforme o agendamento após ser publicado no ambiente de produção.

  • O&M de tarefas: Após a publicação de uma tarefa, monitore o status de suas execuções periódicas no Operation Center. Para mais informações, consulte Introdução ao Operation Center.

Apêndice: Parâmetros do DataWorks

Parâmetro avançado

Descrição

FLOW_SKIP_SQL_ANALYZE

O modo de execução de instruções SQL. Valores válidos:

  • true: Várias instruções SQL são executadas simultaneamente.

  • false (padrão): Uma única instrução SQL é executada por vez.

Nota

Este parâmetro é suportado apenas para execuções de teste no ambiente de desenvolvimento de dados.

DATAWORKS_SESSION_DISABLE

O método de envio de tarefas. Durante o desenvolvimento de dados, as tarefas são enviadas ao SQL Compute para execução por padrão. Use este parâmetro para especificar se a tarefa é executada através do SQL Compute ou enviada para uma fila de execução.

  • true: A tarefa é enviada para uma fila de execução. Por padrão, a fila padrão especificada quando o recurso de computação foi associado é utilizada. Quando DATAWORKS_SESSION_DISABLE está definido como true, configure o parâmetro SERVERLESS_QUEUE_NAME para especificar a fila para a qual as tarefas são enviadas durante o desenvolvimento de dados.

  • false (padrão): A tarefa é enviada ao SQL Compute para execução.

    Nota

    Este parâmetro tem efeito apenas durante a execução no desenvolvimento de dados, não durante execuções agendadas.

SERVERLESS_RELEASE_VERSION

A versão do mecanismo Spark. Por padrão, a Default Engine Version configurada nas definições do cluster em Compute Resource no Management Center é utilizada. Para definir uma versão diferente do mecanismo para uma tarefa específica, configure este parâmetro.

Nota

O parâmetro SERVERLESS_RELEASE_VERSION nas configurações avançadas só tem efeito quando o SQL Compute (sessão) especificado para o cluster registrado está no estado parado no console EMR Serverless Spark.

SERVERLESS_QUEUE_NAME

A fila de recursos para a qual as tarefas são enviadas. Quando uma tarefa é configurada para ser enviada a uma fila para execução, a Default Resource Queue configurada nas definições do cluster em Clusters no Management Center é usada por padrão. Se você tiver requisitos de isolamento e gerenciamento de recursos, poderá adicionar filas. Para mais informações, consulte Gerenciar filas de recursos.

Métodos de configuração:

  • Especifique a fila de recursos para envio de tarefas configurando os parâmetros do nó.

  • Especifique a fila de recursos para envio de tarefas configurando parâmetros globais do Spark.

Nota
  • O parâmetro SERVERLESS_QUEUE_NAME nas configurações avançadas só tem efeito quando o SQL Compute (sessão) especificado para o cluster registrado está no estado parado no console EMR Serverless Spark.

  • Durante a execução no desenvolvimento de dados: Primeiro, defina DATAWORKS_SESSION_DISABLE como true para que as tarefas sejam enviadas a uma fila para execução. Somente então o parâmetro SERVERLESS_QUEUE_NAME terá efeito para especificar a fila de tarefas.

  • Durante a execução agendada no Operation Center: As tarefas são obrigatoriamente enviadas para uma fila para execução e não podem ser submetidas ao SQL Compute.

SERVERLESS_SQL_COMPUTE

O SQL Compute (sessão SQL) a ser utilizado. Por padrão, o Default SQL Compute configurado nas definições do cluster em Compute Resource no Management Center é usado. Para definir uma sessão SQL diferente para uma tarefa específica, configure este parâmetro. Para obter informações sobre como criar e gerenciar sessões SQL, consulte Gerenciar sessões do SQL Compute.

Outros

Parâmetros personalizados de Configuração do Spark. Adicione parâmetros de propriedade específicos do Spark.

Formato de configuração: "spark.eventLog.enabled": false. O DataWorks anexa automaticamente os parâmetros ao código enviado ao cluster EMR no formato: --conf key=value.

Nota

O DataWorks permite configurar parâmetros globais do Spark no nível do workspace para cada módulo do DataWorks. Especifique se a prioridade dos parâmetros globais do Spark deve ser superior à dos parâmetros do Spark configurados dentro de um módulo específico. Para mais informações sobre a configuração de parâmetros globais do Spark, consulte Configurar parâmetros globais do Spark.