O ClickHouse SQL permite executar consultas SQL distribuídas em dados estruturados para aumentar a eficiência dos jobs. No DataWorks, use um nó ClickHouse SQL para desenvolver tarefas, agendar execuções periódicas e integrá-las a outros jobs. Este tópico descreve o fluxo principal de desenvolvimento de tarefas com um nó ClickHouse SQL.
Pré-requisitos
-
Os tipos de mecanismo do EMR incluem DataLake e Hadoop. Cada tipo exige preparações diferentes antes da criação de um nó. Conforme o seu cenário, conclua os preparativos necessários no EMR e no DataWorks.
DataLake: Para mais informações, consulte Configurar um cluster DataLake e Configurar o DataWorks.
Hadoop: Para mais informações, consulte Preparar um cluster Hadoop para desenvolvimento.
-
Crie uma fonte de dados ClickHouse e vincule-a a um workspace.
Para acessar dados do ClickHouse durante o desenvolvimento, crie uma fonte de dados ClickHouse no DataWorks e vincule-a ao Data Studio. Para mais informações, consulte Vincular um recurso de computação ClickHouse.
Crie um nó ClickHouse SQL. Para mais informações, consulte Criar um nó de workflow agendado.
Procedimento
-
Na página de edição do nó ClickHouse SQL, siga estas etapas:
Desenvolver código SQL
No editor SQL, escreva o código da tarefa. Defina variáveis no código usando o formato ${variable_name}. Atribua valores a essas variáveis em Scheduling Parameters, no painel Scheduling Settings à direita. Isso permite a passagem dinâmica de parâmetros nas execuções agendadas do job. Para mais detalhes sobre parâmetros de agendamento, consulte Fontes e expressões para parâmetros de agendamento. Exemplo:
CREATE DATABASE IF NOT EXISTS ck_test; CREATE TABLE IF NOT EXISTS ck_test.first_table ( `product_code` String, `package_name` String ) ENGINE = MergeTree ORDER BY package_name SETTINGS index_granularity = 8192; INSERT INTO ck_test.first_table (product_code, package_name) VALUES ('1', ${var}); SELECT * FROM ck_test.first_table;NotaNeste exemplo, defina o parâmetro
${var}como1.Executar tarefa SQL
-
No painel Run Configuration, configure o Compute Resource e o Resource Group.
Em Computing Resource, selecione o nome do cluster CDH registrado no DataWorks.
Em Resource Group, selecione um grupo de recursos de agendamento com conexão confirmada à fonte de dados. Para mais informações, consulte Soluções de conectividade de rede.
Na barra de ferramentas, clique em no menu suspenso Select a data source. Na caixa de diálogo, selecione a fonte de dados ClickHouse criada e clique em Run para executar a tarefa SQL.
-
Para executar o nó periodicamente, configure as propriedades de agendamento conforme os requisitos do negócio. Para detalhes de configuração, consulte Configuração de agendamento de nó.
Após configurar o nó, faça o deploy. Para mais informações, consulte Deploy de nós e workflows.
Após o deploy da tarefa, visualize o status de execução no Operation Center. Para mais informações, consulte Introdução ao Operation Center.