Todos os produtos
Search
Central de documentação

E-MapReduce:Hive

Última atualização: Jun 27, 2026

O Hive é um framework de data warehouse baseado no Hadoop que oferece suporte a operações de extração, transformação e carga (ETL) e ao gerenciamento de metadados em cenários de big data.

Componentes do Hive

Nome

Descrição

HiveServer2

Servidor de consultas HiveQL que recebe solicitações SQL de um cliente Java Database Connectivity (JDBC) pelos protocolos Thrift ou HTTP. Oferece suporte a acesso simultâneo de vários clientes e à autenticação de identidade.

Hive MetaStore

Componente de gerenciamento de metadados. Armazena metadados, como bancos de dados e tabelas, para outros mecanismos. Tanto o Spark quanto o Presto utilizam este componente para gerenciar metadados.

Hive Client

Cliente do Hive. Envia jobs SQL e os converte em jobs MapReduce, Tez ou Spark conforme o mecanismo de execução configurado. Este componente está instalado em todos os nós de um cluster EMR.

Melhorias de recursos

Para obter mais informações sobre a compatibilidade entre as versões do EMR, Hadoop e Hive, consulte Versões de lançamento. As tabelas a seguir descrevem os recursos aprimorados para o Hive em diferentes versões do EMR.

Série EMR 5.x

Versão do EMR

Versão do componente

Melhoria de recurso

EMR-5.20.0

Hive 3.1.3

Desempenho otimizado na adição de campos a tabelas particionadas.

EMR-5.17.4

Hive 3.1.3

Suporte à implantação de grupos de nós Master-Extend.

EMR-5.12.1

Hive 3.1.3

Por padrão, o OSS-HDFS armazena dados nos arquivos de warehouse do Hive.

EMR-5.9.0

Hive 3.1.3

Suporte à autenticação Kerberos.

EMR-5.8.0

Hive 3.1.2

Ativação da autenticação LDAP com um clique em.

EMR-5.6.0

Hive 3.1.2

Correção do seguinte problema: após ativar a execução especulativa para Hive no Tez, tanto a tarefa original quanto a tarefa especulativa eram confirmadas.

EMR-5.5.0

Hive 3.1.2

  • Resolução do problema de exclusão em lote no Hive Jindo.

  • Correção do erro de falta de memória (OOM) no HiveServer2.

  • Otimizações aplicadas ao Hive on Spark.

  • Adaptação do Hive para o JindoSDK.

EMR-5.4.0

Hive 3.1.2

No JindoFS em modo de armazenamento em bloco, é possível otimizar simultaneamente os metadados de várias tabelas do Hive. Esse recurso vem desativado por padrão.

EMR-5.3.0

Hive 3.1.2

No JindoFS em modo de armazenamento em bloco, os metadados de múltiplas tabelas Hive podem ser otimizados simultaneamente.

EMR-5.2.1

Hive 3.1.2

  • Correção da imprecisão na saída do comando show crie table quando baseada em metadados do Data Lake Formation (DLF).

  • Ajuste nos parâmetros padrão do Hive para melhorar o desempenho dos jobs.

  • No console do EMR, os nomes dos parâmetros na aba hive-env da guia Configure do serviço Hive foram alterados para letras maiúsculas, facilitando sua utilização.

  • Solução para vazamento de memória no HiveServer2 causado por funções definidas pelo usuário (UDFs).

  • Melhoria nas mensagens de erro exibidas devido à incompatibilidade entre o sistema de arquivos e o metastore do Hive durante a gravação de dados em uma tabela Hive.

Série EMR 3.x

Versão do EMR

Versão do componente

Melhoria de recurso

MR-3.51.4

Hive 2.3.9

Compatibilidade com a implantação de grupos de nós Master-Extend.

EMR-3.46.1

Hive 2.3.9

Uso padrão do OSS-HDFS para armazenamento de dados nos arquivos de warehouse do Hive.

EMR-3.40.0

Hive 2.3.8

  • Problema corrigido: com a execução especulativa ativada para Hive no Tez, a tarefa original e a especulativa eram ambas confirmadas indevidamente.

  • Falha resolvida: funções definidas pelo usuário (UDFs) só podiam ser chamadas após recarregar as funções.

EMR-3.39.1

Hive 2.3.8

Integração do Hive com o JindoSDK.

EMR-3.36.1

Hive 2.3.8

  • Atualização do Hive para a versão 2.3.8.

  • Correção de imprecisões na saída do comando show crie table baseado em metadados do Data Lake Formation (DLF).

  • Parâmetros padrão ajustados para aumentar o desempenho dos jobs Hive.

  • Os nomes dos parâmetros na aba hive-env dentro da guia Configure do serviço Hive no console EMR passaram a usar caixa alta, simplificando o uso.

  • Refinamento das mensagens de erro geradas por incompatibilidade entre o sistema de arquivos e o metastore do Hive ao gravar dados em tabelas Hive.

EMR-3.35.0

Hive 2.3.7

Correção de problemas relatados pela comunidade relacionados a tarefas de busca (fetch tasks).

EMR-3.34.0

Hive 2.3.7

  • Diversas configurações padrão receberam melhorias.
  • Desempenho aprimorado com reforço no recurso de otimização baseada em custo (CBO).
  • Ativação ou desativação da autenticação LDAP com apenas um clique em.
  • Atualização do Calcite para a versão 1.12.0.
  • Inclusão do parâmetro hive.security.authorization.sqlstd.confwhitelist.append.

EMR-3.33.0

Hive 2.3.7

  • Atualização do Hive para 2.3.7.
  • Suporte a metadados do Alibaba Cloud Data Lake Formation (DLF) em tabelas HCatalog.
  • Envio de metadados do Hive e informações de execução de jobs para o DataWorks.

EMR-3.32.0

Hive 2.3.5

  • Solução para vazamento de conexões no pool de conexões do HiveServer.
  • Possibilidade de ativar ou desativar o recurso de coleta de dados do JindoTable.
  • Melhoria de desempenho para o comando ADD COLUMN.
  • Correção de falha que invalidava a leitura de dados de tabelas Hudi.
  • Ajuste automático das configurações padrão conforme o tamanho dos nós do cluster.

EMR-3.30.0

Hive 2.3.5

  • Integração com metadados do Alibaba Cloud DLF.
  • Resolução de erro ao ler diretórios vazios de tabelas Delta e gravar dados em arquivos fictícios.
  • Atualização das dependências Has para 2.0.1.

EMR-3.29.0

Hive 2.3.5

  • Atualização para Hive 2.3.5.6.0.

  • Suporte a metastore de terceiros.

  • Adição do parâmetro datalake metastore-client.

EMR-3.28.0

Hive 2.3.5

Compatibilidade com Delta Lake 0.6.0.

EMR-3.27.2

Hive 2.3.5

  • Suporte ao magic committer em tabelas HCatalog.
  • Remoção de configurações padrão obsoletas.

EMR-3.26.3

Hive 2.3.5

Tabelas HCatalog agora suportam o direct committer.

EMR-3.25.0

Hive 2.3.5

Correção de falha em jobs MapReduce no modo LOCAL automático.

EMR-3.24.0

Hive 2.3.5

  • Verificação de compatibilidade de instruções SQL.
  • Lançamento conjunto do Hive 2.3.5 com Hadoop 2.8.5.
  • Ao reiniciar o Hive, o conteúdo de hiveserver2-site.xml não é mais sincronizado incorretamente com hive-site.xml na pasta spark-conf.
  • Uso do comando MSCK para adicionar diretórios incrementais.
  • Correção de bug relacionado à reutilização de contêineres Tez no Hive.
  • Otimização de diretórios de colunas via comando MSCK.

EMR-3.23.0

Hive 2.3.5

  • Remoção de hooks do Hive configurados em versões anteriores.
  • Suporte a múltiplos COUNT(DISTINCT) para hive.groupby.skew na otimização de dados.
  • Correção de perda de dados ao unir tabelas com versões diferentes de buckets.

Versões anteriores ao EMR-3.23.0

Hive 2.x

O banco de dados unificado externo é salvo no metastore do Hive. Todos os clusters que usam o metastore externo do Hive compartilham os mesmos metadados.

Série EMR 4.x

Versão do EMR

Versão do componente

Melhoria de recurso

EMR-4.10.0

Hive 3.1.2

  • Correção de caracteres ilegíveis ao consultar registros históricos pelo Hue.

  • Resolução de anomalias na interface ao utilizar Hue em conjunto com Oozie.

  • Solução para falhas intermitentes do YARN Job Browser na exibição ou finalização de jobs.

  • Acesso liberado por padrão ao YARN Job Browser.

  • Protocolo Presto habilitado nativamente.

EMR-4.8.0

Hive 3.1.2

  • Refinamento de configurações padrão.

  • Ganhos de desempenho e aprimoramento da otimização baseada em custo (CBO).

  • Controle simplificado da autenticação LDAP com ativação/desativação em um clique em.

EMR-4.6.0

Hive 3.1.2

  • Leitura de metadados do Alibaba Cloud Data Lake Formation (DLF) em tabelas HCatalog.

  • Encaminhamento de metadados do Hive e detalhes de execução de jobs para o DataWorks.

EMR-4.5.0

Hive 3.1.2

  • Suporte a metadados armazenados no Alibaba Cloud DLF.

  • Implementação de permissões de propriedade (ownership) do Ranger.

EMR-4.4.1

Hive 3.1.2

Ajustes nas configurações de parâmetros padrão.

EMR-4.4.0

Hive 3.1.2

  • Atualização para Hive 3.1.2.
  • Melhorias no JindoFS.
  • Otimização na verificação de consistência do metastore (MSCK).
  • Suporte ao Jindo Job Committer em tabelas HCatalog.
  • Atualização de dependências Has.

EMR-4.3.0

Hive 3.1.1

Permite implantações personalizadas.

Sintaxe do Hive

Para garantir uma experiência consistente, o EMR preserva ao máximo a sintaxe dos componentes open source. O Hive do EMR é totalmente compatível com a sintaxe do Apache Hive.

Para mais detalhes sobre o Apache Hive, visite o site oficial do Apache Hive.

Referências