Todos os produtos
Search
Central de documentação

DataWorks:Create an EMR Kyuubi node

Última atualização: Jun 27, 2026

O Apache Kyuubi é um gateway distribuído e multilocatário que permite executar consultas SQL em mecanismos de data lake, como Spark, Flink e Trino. Os nós EMR Kyuubi no DataWorks integram o Kyuubi ao DataStudio para que você possa criar, testar e agendar tarefas Kyuubi junto com outros tipos de nó em um fluxo de trabalho unificado.

Pré-requisitos

Antes de começar, verifique se você possui:

  • Um cluster do Alibaba Cloud E-MapReduce (EMR) criado e registrado no DataWorks. Para mais informações, consulte DataStudio (versão antiga): Associar um recurso de computação EMR.

  • Um grupo de recursos serverless adquirido e configurado com associação de workspace e definições de rede. Os nós EMR Kyuubi só podem ser executados em um grupo de recursos serverless ou em um grupo de recursos exclusivo para agendamento; recomenda-se o uso do grupo de recursos serverless. Para mais informações, consulte Criar e usar um grupo de recursos serverless.

  • Um fluxo de trabalho criado no DataStudio. Todo o desenvolvimento de nós no DataStudio é organizado em torno de fluxos de trabalho, portanto, crie um antes de adicionar um nó. Para mais informações, consulte Criar um fluxo de trabalho.

  • (Obrigatório ao usar um usuário RAM) O usuário RAM adicionado ao workspace como membro com a função Develop ou Workspace Administrator atribuída. A função Workspace Administrator concede permissões mais amplas do que a maioria das tarefas exige — atribua-a apenas quando necessário. Para mais informações, consulte Adicionar membros ao workspace e atribuir funções.

Etapa 1: Criar um nó EMR Kyuubi

  1. Acesse a página do DataStudio. Faça login no console do DataWorks. Na barra de navegação superior, selecione a região. No painel de navegação à esquerda, escolha Data Development and O&M > Data Development. Selecione o workspace na lista suspensa e clique em Go to Data Development.

  2. Crie um nó EMR Kyuubi.

    1. Localize o fluxo de trabalho desejado, clique com o botão direito no nome do fluxo e escolha Create Node > EMR > EMR Kyuubi.

      Nota

      Como alternativa, passe o mouse sobre o ícone Create e escolha Create Node > EMR > EMR Kyuubi.

    2. Na caixa de diálogo Create Node, configure Name, Engine Instance, Node Type e Path e clique em Confirm. A aba de configuração do nó EMR Kyuubi será aberta.

      Nota

      O nome do nó pode conter apenas letras, dígitos, sublinhados (_) e pontos (.).

Etapa 2: Desenvolver uma tarefa EMR Kyuubi

Escrever código SQL

No editor SQL, escreva o código do nó. Defina variáveis usando a sintaxe ${Variable} e vincule valores de parâmetros de agendamento a essas variáveis na seção Scheduling Parameter da aba Properties. Quando o nó for executado conforme o agendamento, o DataWorks substituirá automaticamente os valores dos parâmetros de agendamento no código. Para detalhes sobre os formatos suportados, consulte Formatos suportados de parâmetros de agendamento.

Código de exemplo:

show tables;
select * from kyuubi040702 where age >= '${a}'; -- Assign a scheduling parameter to variable a.
O código SQL para uma única tarefa não pode exceder 130 KB.
Se houver vários recursos de computação EMR associados ao seu workspace, selecione um no seletor de source de dados. Caso haja apenas um associado, nenhuma seleção é necessária.

Configurar parâmetros avançados (opcional)

Na aba Advanced Settings, defina qualquer um dos parâmetros a seguir. Para a lista completa de propriedades Spark suportadas, consulte Configuração do Spark.

Parâmetro

Padrão

Descrição

queue

default

Fila de agendamento YARN para jobs enviados. Se uma YARN queue no nível do workspace for configurada durante o registro do cluster EMR, aplicam-se as seguintes regras de precedência: se Whether global configuration takes precedence estiver definido como Yes, a fila do registro do cluster será usada; caso contrário, a fila definida no nó EMR Kyuubi será utilizada. Consulte Agendadores YARN e Configurar uma fila YARN global.

priority

1

Prioridade de agendamento para o job.

FLOW_SKIP_SQL_ANALYZE[Apenas Dev]

false

Controla a execução de instruções SQL. Defina como true para executar várias instruções SQL simultaneamente; defina como false para executar uma instrução por vez.

DATAWORKS_SESSION_DISABLE[Apenas Dev]

false

Gerencia a reutilização de conexões JDBC. Defina como true para abrir uma nova conexão JDBC para cada instrução SQL. Defina como false para reutilizar a mesma conexão entre instruções no mesmo nó. Quando definido como false, o yarn applicationId do nó EMR Hive não aparece nos logs; defina como true se precisar dessa informação.

Executar a tarefa

  1. Na barra de ferramentas, clique no ícone 高级运行. Na caixa de diálogo Parameters, selecione um grupo de recursos na lista suspensa Resource Group Name e clique em Run.

    Nota
    • Para acessar um recurso de computação pela Internet ou por uma virtual private cloud (VPC), utilize o grupo de recursos para agendamento conectado a esse recurso. Para mais informações, consulte Soluções de conectividade de rede.

    • Para alterar o grupo de recursos posteriormente, clique novamente no ícone 高级运行 (Run with Parameters) e selecione um grupo diferente na caixa de diálogo Parameters.

  2. Clique no ícone 保存 na barra de ferramentas para salvar o código SQL.

  3. (Opcional) Execute testes de fumaça (smoke testing) no nó no ambiente de desenvolvimento antes ou depois do commit. Para mais informações, consulte Realizar testes de fumaça.

Etapa 3: Configurar propriedades de agendamento

Para agendar a execução periódica da tarefa, clique em Properties no painel de navegação à direita e configure as definições de agendamento.

Configure os parâmetros Rerun e Parent Nodes antes de fazer o commit da tarefa.

Para obter uma referência completa sobre as opções de agendamento, consulte Visão geral.

Etapa 4: Implantar a tarefa

Após configurar o nó, faça o commit e implante a tarefa para que o DataWorks a execute conforme o cronograma definido.

  1. Clique no ícone Save na barra de ferramentas para salvar a tarefa.

  2. Clique no ícone Commit na barra de ferramentas para fazer o commit da tarefa. Na caixa de diálogo Submit, preencha o campo Change description e escolha se deseja exigir uma revisão de código.

    Nota
    • Configure Rerun e Parent Nodes na aba Properties antes de fazer o commit.

    • Quando a revisão de código está ativada, o código submetido só pode ser implantado após aprovação. Para mais informações, consulte Revisão de código.

  3. (Apenas para workspaces no modo Standard) Clique em Deploy no canto superior direito da aba de configuração do nó para implantar a tarefa no ambiente de produção. Para mais informações, consulte Implantar nós.

Próximos passos

Depois que a tarefa recebe o commit e é implantada, ela é executada automaticamente conforme o agendamento configurado. Para monitorar o status da execução, clique em Operation Center no canto superior direito da aba de configuração do nó. Para mais informações, consulte Visualizar e gerenciar tarefas acionadas automaticamente.