O EMR-HOOK vem integrado ao Hive por padrão em clusters do E-MapReduce (EMR). Ele captura informações de jobs SQL — especificamente a linhagem de dados e a frequência de acesso a tabelas ou partições — com base nos metadados gerenciados no Data Lake Formation (DLF). Após ativar o EMR-HOOK, visualize os dados de linhagem no DataWorks e as informações de frequência de acesso no console do DLF.
Compatibilidade de versões
|
Versão do EMR |
Estado padrão do EMR-HOOK |
Sincronização de parâmetros do gateway |
|
Anterior à V5.14.0 ou V3.48.0 |
Ativado |
Sem suporte |
|
V5.14.0, V3.48.0 ou posterior |
Desativado — ativação manual obrigatória |
Sem suporte |
|
V5.16.0, V3.50.0 ou posterior |
Desativado — ativação manual obrigatória |
Com suporte; |
Pré-requisitos
Antes de começar, verifique se você possui:
Um cluster DataLake ou personalizado com o serviço Hive selecionado. Consulte Criar um cluster.
Limitações
O EMR-HOOK não coleta informações de jobs SQL de um gateway implantado via EMR-CLI.
Nas versões do EMR anteriores à V5.16.0 ou V3.50.0, não é possível sincronizar as configurações
hive.exec.post.hooks(Hive) espark.sql.queryExecutionListeners(Spark) com um gateway. A partir da V5.16.0 ou V3.50.0, há suporte à sincronização, e o parâmetrohive_aux_jars_path_gateway_onlypermite carregar um arquivo JAR personalizado exclusivamente no gateway.
Ativar o EMR-HOOK para o Hive
Etapa 1: Abrir a configuração do Hive
Faça login no console do EMR. No painel de navegação à esquerda, clique em EMR on ECS.
Na barra de navegação superior, selecione uma região e um grupo de recursos.
Na página EMR on ECS, localize o cluster e clique em Services na coluna Actions.
Na aba Services, localize o serviço Hive e clique em Configure.
Etapa 2: Definir os parâmetros de configuração
Na aba Configure, atualize os seguintes parâmetros, organizados por subaba.
hive-site.xml
| Parâmetro | Valor |
|---|---|
hive.exec.post.hooks |
|
dlf.emrhook.webtracking | true para ativar o relatório de frequência de acesso; false para desativar |
hivemetastore-site.xml
| Parâmetro | Valor |
|---|---|
hive.metastore.event.listeners |
|
hive.metastore.pre.event.listeners |
|
Se o EMR-HOOK estiver desativado, a aba Data Overview de uma tabela no console do DLF deixará de exibir dados nas colunas File Visits within Last Day, File Visits within Last Seven Days e File Visits within Last 30 Days.
Etapa 3: Salvar a configuração
Na aba Configure, clique em Save.
Na caixa de diálogo, preencha o campo Execution Reason e clique em Save.
Etapa 4: Reiniciar o Hive
No canto superior direito da aba Configure, escolha More > Restart.
Na caixa de diálogo, preencha o campo Execution Reason e clique em OK.
Na mensagem Confirm, clique em OK.
Visualizar resultados
Após a reinicialização do Hive, o EMR-HOOK começa a capturar dados.
Frequência de acesso: No console do DLF, abra uma tabela e clique em Data Overview. Consulte Visão geral de dados das tabelas.
Linhagem de dados: No console do DataWorks, abra a visualização de linhagem. Consulte Visualizar linhagens.
Perguntas frequentes
Como ativo o EMR-HOOK em um cluster personalizado executando o EMR V3.44?
Na aba Configure do serviço Hive, adicione o caminho do arquivo JAR ao parâmetro hive_aux_jars_path em ambas as subabas e aplique as alterações conforme solicitado.
|
Subaba |
Parâmetro |
Alteração |
|
hive-site.xml |
|
Acrescente |
|
hive-env.sh |
|
Acrescente |
Próximos passos
Para capturar linhagem e histórico de acesso de jobs Spark, consulte Usar o recurso de extensão do Spark SQL para registrar linhagem de dados e informações históricas de acesso.