Tous les produits
Search
Centre de documentation

E-MapReduce:Hive

Dernière mise à jour :Aug 09, 2026

Hive est un framework d’entrepôt de données basé sur Hadoop qui prend en charge les opérations ETL (extraction, transformation et chargement) ainsi que la gestion des métadonnées dans les environnements Big Data.

Composants de Hive

Nom

Description

HiveServer2

Serveur de requêtes HiveQL qui reçoit les demandes SQL provenant d’un client JDBC via le protocole Thrift ou HTTP. Il prend en charge l’accès simultané de plusieurs clients et l’authentification des identités.

Hive MetaStore

Composant de gestion des métadonnées. Il stocke les métadonnées, telles que les bases de données et les tables, pour d’autres moteurs. Par exemple, Spark et Presto utilisent ce composant pour la gestion des métadonnées.

Hive Client

Client Hive. Il soumet les tâches SQL et les convertit en tâches MapReduce, Tez ou Spark selon le moteur d’exécution configuré. Ce composant est installé sur tous les nœuds d’un cluster EMR.

Améliorations des fonctionnalités

Pour plus d’informations sur la compatibilité entre les versions d’EMR, de Hadoop et de Hive, consultez la rubrique Versions publiées. Les tableaux suivants décrivent les fonctionnalités améliorées pour Hive dans différentes versions d’EMR.

Série EMR 5.x

Version EMR

Version du composant

Amélioration des fonctionnalités

EMR-5.20.0

Hive 3.1.3

Optimisation des performances lors de l’ajout de champs aux tables partitionnées.

EMR-5.17.4

Hive 3.1.3

Prise en charge du déploiement de groupes de nœuds Master-Extend.

EMR-5.12.1

Hive 3.1.3

Par défaut, OSS-HDFS sert à stocker les données dans les fichiers de l’entrepôt Hive.

EMR-5.9.0

Hive 3.1.3

Prise en charge de l’authentification Kerberos.

EMR-5.8.0

Hive 3.1.2

Activation de l’authentification LDAP en un clic.

EMR-5.6.0

Hive 3.1.2

Correction du problème suivant : après l’activation de l’exécution spéculative pour Hive sur Tez, la tâche d’origine et la tâche spéculative sont toutes deux validées.

EMR-5.5.0

Hive 3.1.2

  • Correction du problème de suppression par lots sur Hive Jindo.

  • Correction du problème de dépassement de mémoire (OOM) sur HiveServer2.

  • Optimisation de Hive sur Spark.

  • Adaptation de Hive à JindoSDK.

EMR-5.4.0

Hive 3.1.2

Dans JindoFS en mode de stockage par blocs, optimisation simultanée des métadonnées de plusieurs tables Hive. Cette fonctionnalité est désactivée par défaut.

EMR-5.3.0

Hive 3.1.2

Dans JindoFS en mode de stockage par blocs, optimisation simultanée des métadonnées de plusieurs tables Hive.

EMR-5.2.1

Hive 3.1.2

  • Correction de l’inexactitude de la sortie de la commande show create table basée sur les métadonnées de Data Lake Formation (DLF).

  • Optimisation des paramètres par défaut de Hive pour améliorer les performances des tâches Hive.

  • Dans la console EMR, les noms des paramètres de l’onglet hive-env sous l’onglet Configure du service Hive ont été convertis en majuscules afin de faciliter leur utilisation.

  • Correction de la fuite de mémoire de HiveServer2 provoquée par les fonctions définies par l’utilisateur (UDF).

  • Optimisation du message d’erreur signalé en raison de l’incompatibilité entre le système de fichiers et le metastore Hive lors de l’écriture de données dans une table Hive.

Série EMR 3.x

Version EMR

Version du composant

Amélioration des fonctionnalités

MR-3.51.4

Hive 2.3.9

Prise en charge du déploiement de groupes de nœuds Master-Extend.

EMR-3.46.1

Hive 2.3.9

Par défaut, OSS-HDFS sert à stocker les données dans les fichiers de l’entrepôt Hive.

EMR-3.40.0

Hive 2.3.8

  • Correction du problème suivant : après l’activation de l’exécution spéculative pour Hive sur Tez, la tâche d’origine et la tâche spéculative sont toutes deux validées.

  • Correction du problème suivant : les fonctions définies par l’utilisateur (UDF) ne peuvent être appelées qu’après rechargement des fonctions.

EMR-3.39.1

Hive 2.3.8

Adaptation de Hive à JindoSDK.

EMR-3.36.1

Hive 2.3.8

  • Mise à jour de Hive vers la version 2.3.8.

  • Correction de l’inexactitude de la sortie de la commande show create table basée sur les métadonnées de Data Lake Formation (DLF).

  • Optimisation des paramètres par défaut de Hive pour améliorer les performances des tâches Hive.

  • Dans la console EMR, les noms des paramètres de l’onglet hive-env sous l’onglet Configure du service Hive ont été convertis en majuscules afin de faciliter leur utilisation.

  • Optimisation du message d’erreur signalé en raison de l’incompatibilité entre le système de fichiers et le metastore Hive lors de l’écriture de données dans une table Hive.

EMR-3.35.0

Hive 2.3.7

Correction des problèmes signalés par la communauté liés aux tâches de récupération (fetch tasks).

EMR-3.34.0

Hive 2.3.7

  • Optimisation de certaines configurations par défaut.
  • Optimisation des performances. Amélioration de la fonctionnalité d’optimisation basée sur les coûts (CBO).
  • Activation ou désactivation de l’authentification LDAP en un clic.
  • Mise à jour de Calcite vers la version 1.12.0.
  • Ajout du paramètre hive.security.authorization.sqlstd.confwhitelist.append.

EMR-3.33.0

Hive 2.3.7

  • Mise à jour de Hive vers la version 2.3.7.
  • Prise en charge des métadonnées issues de Data Lake Formation (DLF) d’Alibaba Cloud dans une table HCatalog.
  • Envoi des métadonnées Hive et des informations d’exécution des tâches à DataWorks.

EMR-3.32.0

Hive 2.3.5

  • Correction de la fuite de connexion dans le pool de connexions HiveServer.
  • Activation ou désactivation de la fonctionnalité de collecte de données de JindoTable.
  • Optimisation des performances de ADD COLUMN.
  • Correction du problème entraînant l’invalidité des données lues à partir des tables Hudi.
  • Ajustement des configurations par défaut en fonction de la taille des nœuds du cluster.

EMR-3.30.0

Hive 2.3.5

  • Prise en charge des métadonnées issues de DLF d’Alibaba Cloud.
  • Correction du problème survenant lors de la lecture d’un répertoire de table Delta vide et de l’écriture de données dans un fichier fictif.
  • Mise à jour des dépendances Has vers la version 2.0.1.

EMR-3.29.0

Hive 2.3.5

  • Mise à jour de Hive vers la version 2.3.5.6.0.

  • Prise en charge d’un metastore tiers.

  • Ajout du paramètre datalake metastore-client.

EMR-3.28.0

Hive 2.3.5

Prise en charge de Delta Lake 0.6.0.

EMR-3.27.2

Hive 2.3.5

  • Prise en charge du « magic committer » dans une table HCatalog.
  • Suppression de certaines configurations par défaut obsolètes.

EMR-3.26.3

Hive 2.3.5

Les tables HCatalog prennent en charge le « direct committer ».

EMR-3.25.0

Hive 2.3.5

Correction d’un problème entraînant l’échec des tâches MapReduce en mode LOCAL automatique.

EMR-3.24.0

Hive 2.3.5

  • Vérification de la compatibilité des instructions SQL.
  • Publication conjointe de Hive 2.3.5 et de Hadoop 2.8.5.
  • Lors du redémarrage de Hive, le contenu de hiveserver2-site.xml n’est pas synchronisé avec hive-site.xml dans le dossier spark-conf.
  • La commande MSCK permet d’ajouter des répertoires incrémentiels.
  • Correction du bogue déclenché par la réutilisation d’un conteneur Tez dans Hive.
  • La commande MSCK permet d’optimiser les répertoires de colonnes.

EMR-3.23.0

Hive 2.3.5

  • Suppression des hooks Hive configurés dans les versions antérieures de Hive.
  • Prise en charge de l’utilisation de plusieurs COUNT(DISTINCT) pour hive.groupby.skew dans l’optimisation des données.
  • Correction du problème de perte de données lors de la jointure de tables avec différentes versions de bucketing.

Versions antérieures à EMR-3.23.0

Hive 2.x

La base de données unifiée externe est enregistrée dans le metastore Hive. Tous les clusters utilisant le metastore Hive externe partagent les mêmes métadonnées.

Série EMR 4.x

Version EMR

Version du composant

Amélioration des fonctionnalités

EMR-4.10.0

Hive 3.1.2

  • Correction du problème d’affichage de caractères incorrects lors de l’interrogation des historiques avec Hue.

  • Correction de l’anomalie d’affichage de l’interface utilisateur survenant lors de l’utilisation conjointe de Hue et d’Oozie.

  • Correction du problème empêchant parfois YARN Job Browser d’afficher ou de terminer des tâches.

  • YARN Job Browser est accessible par défaut.

  • Le protocole Presto est pris en charge par défaut.

EMR-4.8.0

Hive 3.1.2

  • Optimisation de certaines configurations par défaut.

  • Optimisation des performances. Amélioration de la fonctionnalité d’optimisation basée sur les coûts (CBO).

  • Activation ou désactivation de l’authentification LDAP en un clic.

EMR-4.6.0

Hive 3.1.2

  • Prise en charge des métadonnées issues de Data Lake Formation (DLF) d’Alibaba Cloud dans une table HCatalog.

  • Envoi des métadonnées Hive et des informations d’exécution des tâches à DataWorks.

EMR-4.5.0

Hive 3.1.2

  • Prise en charge des métadonnées stockées dans DLF d’Alibaba Cloud.

  • Prise en charge des autorisations liées à la propriété dans Ranger.

EMR-4.4.1

Hive 3.1.2

Optimisation des configurations de paramètres par défaut.

EMR-4.4.0

Hive 3.1.2

  • Mise à jour de Hive vers la version 3.1.2.
  • Optimisation de JindoFS.
  • Optimisation de la vérification de cohérence du metastore (MSCK).
  • Prise en charge de Jindo Job Committer dans une table HCatalog.
  • Mise à jour des dépendances Has.

EMR-4.3.0

Hive 3.1.1

Prise en charge des déploiements personnalisés.

Syntaxe Hive

Afin de garantir une expérience utilisateur cohérente, EMR conserve autant que possible la syntaxe des composants open source. EMR Hive est entièrement compatible avec la syntaxe d’Apache Hive.

Pour plus d’informations sur Apache Hive, consultez le site officiel d’Apache Hive.

Références