O Hive é um framework de data warehouse baseado no Hadoop que oferece suporte a operações de extração, transformação e carga (ETL) e ao gerenciamento de metadados em cenários de big data.
Componentes do Hive
|
Nome |
Descrição |
|
HiveServer2 |
Servidor de consultas HiveQL que recebe solicitações SQL de um cliente Java Database Connectivity (JDBC) pelos protocolos Thrift ou HTTP. Oferece suporte a acesso simultâneo de vários clientes e à autenticação de identidade. |
|
Hive MetaStore |
Componente de gerenciamento de metadados. Armazena metadados, como bancos de dados e tabelas, para outros mecanismos. Tanto o Spark quanto o Presto utilizam este componente para gerenciar metadados. |
|
Hive Client |
Cliente do Hive. Envia jobs SQL e os converte em jobs MapReduce, Tez ou Spark conforme o mecanismo de execução configurado. Este componente está instalado em todos os nós de um cluster EMR. |
Melhorias de recursos
Para obter mais informações sobre a compatibilidade entre as versões do EMR, Hadoop e Hive, consulte Versões de lançamento. As tabelas a seguir descrevem os recursos aprimorados para o Hive em diferentes versões do EMR.
Série EMR 5.x
Versão do EMR | Versão do componente | Melhoria de recurso |
EMR-5.20.0 | Hive 3.1.3 | Desempenho otimizado na adição de campos a tabelas particionadas. |
EMR-5.17.4 | Hive 3.1.3 | Suporte à implantação de grupos de nós Master-Extend. |
EMR-5.12.1 | Hive 3.1.3 | Por padrão, o OSS-HDFS armazena dados nos arquivos de warehouse do Hive. |
EMR-5.9.0 | Hive 3.1.3 | Suporte à autenticação Kerberos. |
EMR-5.8.0 | Hive 3.1.2 | Ativação da autenticação LDAP com um clique em. |
EMR-5.6.0 | Hive 3.1.2 | Correção do seguinte problema: após ativar a execução especulativa para Hive no Tez, tanto a tarefa original quanto a tarefa especulativa eram confirmadas. |
EMR-5.5.0 | Hive 3.1.2 |
|
EMR-5.4.0 | Hive 3.1.2 | No JindoFS em modo de armazenamento em bloco, é possível otimizar simultaneamente os metadados de várias tabelas do Hive. Esse recurso vem desativado por padrão. |
EMR-5.3.0 | Hive 3.1.2 | No JindoFS em modo de armazenamento em bloco, os metadados de múltiplas tabelas Hive podem ser otimizados simultaneamente. |
EMR-5.2.1 | Hive 3.1.2 |
|
Série EMR 3.x
Versão do EMR | Versão do componente | Melhoria de recurso |
MR-3.51.4 | Hive 2.3.9 | Compatibilidade com a implantação de grupos de nós Master-Extend. |
EMR-3.46.1 | Hive 2.3.9 | Uso padrão do OSS-HDFS para armazenamento de dados nos arquivos de warehouse do Hive. |
EMR-3.40.0 | Hive 2.3.8 |
|
EMR-3.39.1 | Hive 2.3.8 | Integração do Hive com o JindoSDK. |
EMR-3.36.1 | Hive 2.3.8 |
|
EMR-3.35.0 | Hive 2.3.7 | Correção de problemas relatados pela comunidade relacionados a tarefas de busca (fetch tasks). |
EMR-3.34.0 | Hive 2.3.7 |
|
EMR-3.33.0 | Hive 2.3.7 |
|
EMR-3.32.0 | Hive 2.3.5 |
|
EMR-3.30.0 | Hive 2.3.5 |
|
EMR-3.29.0 | Hive 2.3.5 |
|
EMR-3.28.0 | Hive 2.3.5 | Compatibilidade com Delta Lake 0.6.0. |
EMR-3.27.2 | Hive 2.3.5 |
|
EMR-3.26.3 | Hive 2.3.5 | Tabelas HCatalog agora suportam o direct committer. |
EMR-3.25.0 | Hive 2.3.5 | Correção de falha em jobs MapReduce no modo LOCAL automático. |
EMR-3.24.0 | Hive 2.3.5 |
|
EMR-3.23.0 | Hive 2.3.5 |
|
Versões anteriores ao EMR-3.23.0 | Hive 2.x | O banco de dados unificado externo é salvo no metastore do Hive. Todos os clusters que usam o metastore externo do Hive compartilham os mesmos metadados. |
Série EMR 4.x
Versão do EMR | Versão do componente | Melhoria de recurso |
EMR-4.10.0 | Hive 3.1.2 |
|
EMR-4.8.0 | Hive 3.1.2 |
|
EMR-4.6.0 | Hive 3.1.2 |
|
EMR-4.5.0 | Hive 3.1.2 |
|
EMR-4.4.1 | Hive 3.1.2 | Ajustes nas configurações de parâmetros padrão. |
EMR-4.4.0 | Hive 3.1.2 |
|
EMR-4.3.0 | Hive 3.1.1 | Permite implantações personalizadas. |
Sintaxe do Hive
Para garantir uma experiência consistente, o EMR preserva ao máximo a sintaxe dos componentes open source. O Hive do EMR é totalmente compatível com a sintaxe do Apache Hive.
Para mais detalhes sobre o Apache Hive, visite o site oficial do Apache Hive.
Referências
Para saber como se conectar ao Hive usando um cliente Hive, consulte Métodos de conexão do Hive.
Para entender a autenticação de identidade no serviço Hive, veja Usar autenticação Kerberos e Usar autenticação LDAP.
Para acessar dados de data lake com o Hive, leia Usar o Hive para acessar dados do Delta Lake e Hudi.
Para conhecer métodos comuns de otimização de jobs Hive, acesse Otimização de jobs Hive.
Para solucionar problemas frequentes em jobs Hive, consulte Solucionar exceções em jobs Hive.