O Apache Kyuubi é um gateway distribuído e multilocatário que permite executar consultas SQL em mecanismos de data lake, como Spark, Flink e Trino. Os nós EMR Kyuubi no DataWorks integram o Kyuubi ao DataStudio para que você possa criar, testar e agendar tarefas Kyuubi junto com outros tipos de nó em um fluxo de trabalho unificado.
Pré-requisitos
Antes de começar, verifique se você possui:
Um cluster do Alibaba Cloud E-MapReduce (EMR) criado e registrado no DataWorks. Para mais informações, consulte DataStudio (versão antiga): Associar um recurso de computação EMR.
Um grupo de recursos serverless adquirido e configurado com associação de workspace e definições de rede. Os nós EMR Kyuubi só podem ser executados em um grupo de recursos serverless ou em um grupo de recursos exclusivo para agendamento; recomenda-se o uso do grupo de recursos serverless. Para mais informações, consulte Criar e usar um grupo de recursos serverless.
Um fluxo de trabalho criado no DataStudio. Todo o desenvolvimento de nós no DataStudio é organizado em torno de fluxos de trabalho, portanto, crie um antes de adicionar um nó. Para mais informações, consulte Criar um fluxo de trabalho.
(Obrigatório ao usar um usuário RAM) O usuário RAM adicionado ao workspace como membro com a função Develop ou Workspace Administrator atribuída. A função Workspace Administrator concede permissões mais amplas do que a maioria das tarefas exige — atribua-a apenas quando necessário. Para mais informações, consulte Adicionar membros ao workspace e atribuir funções.
Etapa 1: Criar um nó EMR Kyuubi
Acesse a página do DataStudio. Faça login no console do DataWorks. Na barra de navegação superior, selecione a região. No painel de navegação à esquerda, escolha Data Development and O&M > Data Development. Selecione o workspace na lista suspensa e clique em Go to Data Development.
-
Crie um nó EMR Kyuubi.
-
Localize o fluxo de trabalho desejado, clique com o botão direito no nome do fluxo e escolha Create Node > EMR > EMR Kyuubi.
NotaComo alternativa, passe o mouse sobre o ícone Create e escolha Create Node > EMR > EMR Kyuubi.
-
Na caixa de diálogo Create Node, configure Name, Engine Instance, Node Type e Path e clique em Confirm. A aba de configuração do nó EMR Kyuubi será aberta.
NotaO nome do nó pode conter apenas letras, dígitos, sublinhados (
_) e pontos (.).
-
Etapa 2: Desenvolver uma tarefa EMR Kyuubi
Escrever código SQL
No editor SQL, escreva o código do nó. Defina variáveis usando a sintaxe ${Variable} e vincule valores de parâmetros de agendamento a essas variáveis na seção Scheduling Parameter da aba Properties. Quando o nó for executado conforme o agendamento, o DataWorks substituirá automaticamente os valores dos parâmetros de agendamento no código. Para detalhes sobre os formatos suportados, consulte Formatos suportados de parâmetros de agendamento.
Código de exemplo:
show tables;
select * from kyuubi040702 where age >= '${a}'; -- Assign a scheduling parameter to variable a.
O código SQL para uma única tarefa não pode exceder 130 KB.
Se houver vários recursos de computação EMR associados ao seu workspace, selecione um no seletor de source de dados. Caso haja apenas um associado, nenhuma seleção é necessária.
Configurar parâmetros avançados (opcional)
Na aba Advanced Settings, defina qualquer um dos parâmetros a seguir. Para a lista completa de propriedades Spark suportadas, consulte Configuração do Spark.
|
Parâmetro |
Padrão |
Descrição |
|
|
|
Fila de agendamento YARN para jobs enviados. Se uma YARN queue no nível do workspace for configurada durante o registro do cluster EMR, aplicam-se as seguintes regras de precedência: se Whether global configuration takes precedence estiver definido como Yes, a fila do registro do cluster será usada; caso contrário, a fila definida no nó EMR Kyuubi será utilizada. Consulte Agendadores YARN e Configurar uma fila YARN global. |
|
|
|
Prioridade de agendamento para o job. |
|
|
|
Controla a execução de instruções SQL. Defina como |
|
|
|
Gerencia a reutilização de conexões JDBC. Defina como |
Executar a tarefa
-
Na barra de ferramentas, clique no ícone
. Na caixa de diálogo Parameters, selecione um grupo de recursos na lista suspensa Resource Group Name e clique em Run.NotaPara acessar um recurso de computação pela Internet ou por uma virtual private cloud (VPC), utilize o grupo de recursos para agendamento conectado a esse recurso. Para mais informações, consulte Soluções de conectividade de rede.
Para alterar o grupo de recursos posteriormente, clique novamente no ícone
(Run with Parameters) e selecione um grupo diferente na caixa de diálogo Parameters.
Clique no ícone
na barra de ferramentas para salvar o código SQL.(Opcional) Execute testes de fumaça (smoke testing) no nó no ambiente de desenvolvimento antes ou depois do commit. Para mais informações, consulte Realizar testes de fumaça.
Etapa 3: Configurar propriedades de agendamento
Para agendar a execução periódica da tarefa, clique em Properties no painel de navegação à direita e configure as definições de agendamento.
Configure os parâmetros Rerun e Parent Nodes antes de fazer o commit da tarefa.
Para obter uma referência completa sobre as opções de agendamento, consulte Visão geral.
Etapa 4: Implantar a tarefa
Após configurar o nó, faça o commit e implante a tarefa para que o DataWorks a execute conforme o cronograma definido.
Clique no ícone
na barra de ferramentas para salvar a tarefa.-
Clique no ícone
na barra de ferramentas para fazer o commit da tarefa. Na caixa de diálogo Submit, preencha o campo Change description e escolha se deseja exigir uma revisão de código.NotaConfigure Rerun e Parent Nodes na aba Properties antes de fazer o commit.
Quando a revisão de código está ativada, o código submetido só pode ser implantado após aprovação. Para mais informações, consulte Revisão de código.
(Apenas para workspaces no modo Standard) Clique em Deploy no canto superior direito da aba de configuração do nó para implantar a tarefa no ambiente de produção. Para mais informações, consulte Implantar nós.
Próximos passos
Depois que a tarefa recebe o commit e é implantada, ela é executada automaticamente conforme o agendamento configurado. Para monitorar o status da execução, clique em Operation Center no canto superior direito da aba de configuração do nó. Para mais informações, consulte Visualizar e gerenciar tarefas acionadas automaticamente.