Todos os produtos
Search
Central de documentação

E-MapReduce:Use Hive extensions to record data lineage and access history

Última atualização: Jun 27, 2026

O EMR-HOOK vem integrado ao Hive por padrão em clusters do E-MapReduce (EMR). Ele captura informações de jobs SQL — especificamente a linhagem de dados e a frequência de acesso a tabelas ou partições — com base nos metadados gerenciados no Data Lake Formation (DLF). Após ativar o EMR-HOOK, visualize os dados de linhagem no DataWorks e as informações de frequência de acesso no console do DLF.

Compatibilidade de versões

Versão do EMR

Estado padrão do EMR-HOOK

Sincronização de parâmetros do gateway

Anterior à V5.14.0 ou V3.48.0

Ativado

Sem suporte

V5.14.0, V3.48.0 ou posterior

Desativado — ativação manual obrigatória

Sem suporte

V5.16.0, V3.50.0 ou posterior

Desativado — ativação manual obrigatória

Com suporte; hive_aux_jars_path_gateway_only disponível

Pré-requisitos

Antes de começar, verifique se você possui:

  • Um cluster DataLake ou personalizado com o serviço Hive selecionado. Consulte Criar um cluster.

Limitações

  • O EMR-HOOK não coleta informações de jobs SQL de um gateway implantado via EMR-CLI.

  • Nas versões do EMR anteriores à V5.16.0 ou V3.50.0, não é possível sincronizar as configurações hive.exec.post.hooks (Hive) e spark.sql.queryExecutionListeners (Spark) com um gateway. A partir da V5.16.0 ou V3.50.0, há suporte à sincronização, e o parâmetro hive_aux_jars_path_gateway_only permite carregar um arquivo JAR personalizado exclusivamente no gateway.

Ativar o EMR-HOOK para o Hive

Etapa 1: Abrir a configuração do Hive

  1. Faça login no console do EMR. No painel de navegação à esquerda, clique em EMR on ECS.

  2. Na barra de navegação superior, selecione uma região e um grupo de recursos.

  3. Na página EMR on ECS, localize o cluster e clique em Services na coluna Actions.

  4. Na aba Services, localize o serviço Hive e clique em Configure.

Etapa 2: Definir os parâmetros de configuração

Na aba Configure, atualize os seguintes parâmetros, organizados por subaba.

hive-site.xml

ParâmetroValor
hive.exec.post.hooks
  • Para ativar o EMR-HOOK, defina este parâmetro como com.aliyun.emr.meta.hive.hook.LineageLoggerHook.

  • Para desativar o EMR-HOOK, deixe este parâmetro vazio.

dlf.emrhook.webtrackingtrue para ativar o relatório de frequência de acesso; false para desativar

hivemetastore-site.xml

ParâmetroValor
hive.metastore.event.listeners
  • Para ativar o EMR-HOOK, defina este parâmetro como com.aliyun.emr.meta.hive.listener.MetaStoreListener.

  • Para desativar o EMR-HOOK, deixe este parâmetro vazio.

hive.metastore.pre.event.listeners
  • Para ativar o EMR-HOOK, defina este parâmetro como com.aliyun.emr.meta.hive.listener.MetaStorePreAuditListener.

  • Para desativar o EMR-HOOK, deixe este parâmetro vazio.

Nota

Se o EMR-HOOK estiver desativado, a aba Data Overview de uma tabela no console do DLF deixará de exibir dados nas colunas File Visits within Last Day, File Visits within Last Seven Days e File Visits within Last 30 Days.

Etapa 3: Salvar a configuração

  1. Na aba Configure, clique em Save.

  2. Na caixa de diálogo, preencha o campo Execution Reason e clique em Save.

Etapa 4: Reiniciar o Hive

  1. No canto superior direito da aba Configure, escolha More > Restart.

  2. Na caixa de diálogo, preencha o campo Execution Reason e clique em OK.

  3. Na mensagem Confirm, clique em OK.

Visualizar resultados

Após a reinicialização do Hive, o EMR-HOOK começa a capturar dados.

Perguntas frequentes

Como ativo o EMR-HOOK em um cluster personalizado executando o EMR V3.44?

Na aba Configure do serviço Hive, adicione o caminho do arquivo JAR ao parâmetro hive_aux_jars_path em ambas as subabas e aplique as alterações conforme solicitado.

Subaba

Parâmetro

Alteração

hive-site.xml

hive_aux_jars_path

Acrescente ,/opt/apps/EMRHOOK/emrhook-1.1.5/hive-hook-1.1.5-hive23.jar

hive-env.sh

hive_aux_jars_path

Acrescente ,/opt/apps/EMRHOOK/emrhook-1.1.5/hive-hook-1.1.5-hive23.jar

Próximos passos