Hive est un framework d’entrepôt de données basé sur Hadoop qui prend en charge les opérations ETL (extraction, transformation et chargement) ainsi que la gestion des métadonnées dans les environnements Big Data.
Composants de Hive
|
Nom |
Description |
|
HiveServer2 |
Serveur de requêtes HiveQL qui reçoit les demandes SQL provenant d’un client JDBC via le protocole Thrift ou HTTP. Il prend en charge l’accès simultané de plusieurs clients et l’authentification des identités. |
|
Hive MetaStore |
Composant de gestion des métadonnées. Il stocke les métadonnées, telles que les bases de données et les tables, pour d’autres moteurs. Par exemple, Spark et Presto utilisent ce composant pour la gestion des métadonnées. |
|
Hive Client |
Client Hive. Il soumet les tâches SQL et les convertit en tâches MapReduce, Tez ou Spark selon le moteur d’exécution configuré. Ce composant est installé sur tous les nœuds d’un cluster EMR. |
Améliorations des fonctionnalités
Pour plus d’informations sur la compatibilité entre les versions d’EMR, de Hadoop et de Hive, consultez la rubrique Versions publiées. Les tableaux suivants décrivent les fonctionnalités améliorées pour Hive dans différentes versions d’EMR.
Série EMR 5.x
Version EMR | Version du composant | Amélioration des fonctionnalités |
EMR-5.20.0 | Hive 3.1.3 | Optimisation des performances lors de l’ajout de champs aux tables partitionnées. |
EMR-5.17.4 | Hive 3.1.3 | Prise en charge du déploiement de groupes de nœuds Master-Extend. |
EMR-5.12.1 | Hive 3.1.3 | Par défaut, OSS-HDFS sert à stocker les données dans les fichiers de l’entrepôt Hive. |
EMR-5.9.0 | Hive 3.1.3 | Prise en charge de l’authentification Kerberos. |
EMR-5.8.0 | Hive 3.1.2 | Activation de l’authentification LDAP en un clic. |
EMR-5.6.0 | Hive 3.1.2 | Correction du problème suivant : après l’activation de l’exécution spéculative pour Hive sur Tez, la tâche d’origine et la tâche spéculative sont toutes deux validées. |
EMR-5.5.0 | Hive 3.1.2 |
|
EMR-5.4.0 | Hive 3.1.2 | Dans JindoFS en mode de stockage par blocs, optimisation simultanée des métadonnées de plusieurs tables Hive. Cette fonctionnalité est désactivée par défaut. |
EMR-5.3.0 | Hive 3.1.2 | Dans JindoFS en mode de stockage par blocs, optimisation simultanée des métadonnées de plusieurs tables Hive. |
EMR-5.2.1 | Hive 3.1.2 |
|
Série EMR 3.x
Version EMR | Version du composant | Amélioration des fonctionnalités |
MR-3.51.4 | Hive 2.3.9 | Prise en charge du déploiement de groupes de nœuds Master-Extend. |
EMR-3.46.1 | Hive 2.3.9 | Par défaut, OSS-HDFS sert à stocker les données dans les fichiers de l’entrepôt Hive. |
EMR-3.40.0 | Hive 2.3.8 |
|
EMR-3.39.1 | Hive 2.3.8 | Adaptation de Hive à JindoSDK. |
EMR-3.36.1 | Hive 2.3.8 |
|
EMR-3.35.0 | Hive 2.3.7 | Correction des problèmes signalés par la communauté liés aux tâches de récupération (fetch tasks). |
EMR-3.34.0 | Hive 2.3.7 |
|
EMR-3.33.0 | Hive 2.3.7 |
|
EMR-3.32.0 | Hive 2.3.5 |
|
EMR-3.30.0 | Hive 2.3.5 |
|
EMR-3.29.0 | Hive 2.3.5 |
|
EMR-3.28.0 | Hive 2.3.5 | Prise en charge de Delta Lake 0.6.0. |
EMR-3.27.2 | Hive 2.3.5 |
|
EMR-3.26.3 | Hive 2.3.5 | Les tables HCatalog prennent en charge le « direct committer ». |
EMR-3.25.0 | Hive 2.3.5 | Correction d’un problème entraînant l’échec des tâches MapReduce en mode LOCAL automatique. |
EMR-3.24.0 | Hive 2.3.5 |
|
EMR-3.23.0 | Hive 2.3.5 |
|
Versions antérieures à EMR-3.23.0 | Hive 2.x | La base de données unifiée externe est enregistrée dans le metastore Hive. Tous les clusters utilisant le metastore Hive externe partagent les mêmes métadonnées. |
Série EMR 4.x
Version EMR | Version du composant | Amélioration des fonctionnalités |
EMR-4.10.0 | Hive 3.1.2 |
|
EMR-4.8.0 | Hive 3.1.2 |
|
EMR-4.6.0 | Hive 3.1.2 |
|
EMR-4.5.0 | Hive 3.1.2 |
|
EMR-4.4.1 | Hive 3.1.2 | Optimisation des configurations de paramètres par défaut. |
EMR-4.4.0 | Hive 3.1.2 |
|
EMR-4.3.0 | Hive 3.1.1 | Prise en charge des déploiements personnalisés. |
Syntaxe Hive
Afin de garantir une expérience utilisateur cohérente, EMR conserve autant que possible la syntaxe des composants open source. EMR Hive est entièrement compatible avec la syntaxe d’Apache Hive.
Pour plus d’informations sur Apache Hive, consultez le site officiel d’Apache Hive.
Références
Pour plus d’informations sur la connexion à Hive avec un client Hive, consultez la rubrique Méthodes de connexion à Hive.
Pour plus d’informations sur l’authentification des identités pour le service Hive, consultez les rubriques Utiliser l’authentification Kerberos et Utiliser l’authentification LDAP.
Pour savoir comment accéder aux données du data lake avec Hive, consultez la rubrique Utiliser Hive pour accéder aux données Delta Lake et Hudi.
Pour plus d’informations sur les méthodes d’optimisation courantes des tâches Hive, consultez la rubrique Optimisation des tâches Hive.
Pour savoir comment résoudre les problèmes courants liés aux tâches Hive, consultez la rubrique Résoudre les exceptions des tâches Hive.