Configurez les connecteurs et les métadonnées du data lake avant d'utiliser un cluster Trino autonome.
Informations générales
Dans la console E-MapReduce, vous pouvez ajouter le service Trino lors de la création d'un cluster DataLake, personnalisé ou Hadoop. Vous pouvez également créer un cluster Trino autonome.
Ressources de cluster dédiées avec une interférence minimale des autres composants.
Prise en charge de l'Auto Scaling.
Prise en charge de l'analytique du data lake et de l'entrepôt de données en temps réel.
Aucun stockage de données.
Hudi et Iceberg ne sont pas des processus réels et ne consomment pas de ressources du cluster.
Si vous n'utilisez pas les services Hue et JindoData (ou SmartData), arrêtez-les.
Pour utiliser un cluster Trino autonome, créez ou utilisez un cluster DataLake, personnalisé ou Hadoop existant qui servira de cluster de données.
Après avoir créé un cluster Trino autonome, effectuez les configurations suivantes :
-
Facultatif :Configurer les métadonnées du data lake
Ignorer cette étape si votre cluster de données n'utilise pas DLF Unified Metadata.
Configurer un connecteur
Configurez les objets de requête dans le connecteur souhaité. La procédure suivante utilise le connecteur Hive à titre d'exemple.
-
Accédez à la page Services du cluster.
Connectez-vous à la console EMR on ECS.
Dans la barre de navigation supérieure, sélectionnez la région requise et le groupe de ressources.
Sur la page EMR on ECS, localisez le cluster cible et cliquez sur Services dans la colonne Actions.
Sur la page Services, cliquez sur Configure dans la section du service Trino.
-
Modifiez les éléments de configuration.
Sur la page Configure, cliquez sur l'onglet hive.properties.
Définissez la valeur du paramètre hive.metastore.uri pour qu'elle corresponde à la valeur hive.metastore.uri du service Trino de votre cluster de données.
-
Enregistrez la configuration.
Dans le coin supérieur droit, cliquez sur Save.
Dans la boîte de dialogue Confirm, configurez les paramètres et cliquez sur OK.
-
Déployez la configuration du client.
Dans le coin supérieur droit, cliquez sur Deploy Client Configuration.
Dans la boîte de dialogue Execute Cluster Operation, configurez les paramètres et cliquez sur OK.
Dans la boîte de dialogue Confirm, cliquez sur OK.
Redémarrez le service Trino. Pour plus d'informations, consultez la section Procédure.
-
Configurez les hôtes.
ImportantIgnorer cette étape si toutes les données à interroger sont stockées dans Object Storage Service (OSS) ou si un emplacement est spécifié dans l'instruction de création de la table.
Pour permettre à Trino de lire les données des tables sur le cluster de données, configurez les informations d'hôte sur chaque nœud du cluster Trino.
Méthode 1 (recommandée) : Dans la console EMR, ajoutez un script de cluster ou une action d'amorçage pour configurer l'hôte. Pour plus d'informations, consultez les sections Exécuter manuellement un script ou Gérer les actions d'amorçage.
-
Méthode 2 : Modifiez directement le fichier hosts en suivant les étapes ci-dessous :
Obtenez l'adresse IP interne du nœud maître dans le cluster de données. Dans la console E-MapReduce, accédez à la page Nodes. Dans la ligne du groupe de nœuds maîtres, cliquez sur l'icône
pour afficher l'adresse IP interne du nœud.Connectez-vous au cluster de données. Pour plus d'informations, consultez la section Se connecter à un cluster.
-
Exécutez la commande
hostnamepour obtenir le nom d'hôte.Exemples de formats de nom d'hôte :
Cluster Hadoop : emr-header-1.cluster-26****.
Autres types de clusters : master-1-1.c-f613970e8c****.
Connectez-vous au cluster Trino. Pour plus d'informations, consultez la section Se connecter à un cluster.
-
Exécutez la commande suivante pour modifier le fichier hosts :
vim /etc/hosts -
Ajoutez le contenu suivant à la dernière ligne du fichier hosts.
Ajoutez l'adresse IP interne et le nom d'hôte du nœud maître du cluster de données au fichier /etc/hosts sur chaque hôte du cluster Trino.
-
Cluster Hadoop
192.168.**.** emr-header-1.cluster-26**** -
Autres types de clusters
192.168.**.** master-1-1.c-f613970e8c****
-
Configurer les métadonnées du data lake
Les versions EMR 3.45.0 et ultérieures ainsi que 5.11.0 et ultérieures prennent en charge la configuration automatique lors de la création du cluster.
Si les métadonnées de la table utilisent DLF Unified Metadata, une configuration supplémentaire est requise pour les connecteurs tels que Hive, Iceberg et Hudi. Dans ce scénario, Trino accède directement aux métadonnées DLF sous le même compte, de sorte que les requêtes ne dépendent plus du cluster de données et la valeur hive.metastore.uri est ignorée.
Le tableau suivant répertorie les paramètres de configuration des métadonnées du data lake.
|
Paramètre |
Description |
Remarques |
|
hive.metastore |
Le type de metastore. |
La valeur doit être |
|
dlf.catalog.id |
L'espace de noms du catalogue de données. |
L'ID du catalogue DLF à lier. Ce paramètre correspond par défaut à l'ID de votre compte Alibaba Cloud. |
|
dlf.catalog.region |
La région du service DLF. |
Pour plus d'informations, consultez la section Régions et endpoints pris en charge. Remarque
Assurez-vous que cette région est identique à celle spécifiée pour dlf.catalog.endpoint. |
|
dlf.catalog.endpoint |
L'endpoint du service DLF. |
Pour plus d'informations, consultez la section Régions et endpoints pris en charge. Définissez le paramètre dlf.catalog.endpoint sur l'endpoint VPC pour DLF. Par exemple, si votre région sélectionnée est Chine (Hangzhou), définissez le paramètre dlf.catalog.endpoint sur dlf-vpc.cn-hangzhou.aliyuncs.com. Remarque
Vous pouvez également utiliser un endpoint public pour DLF. Par exemple, si votre région sélectionnée est Chine (Hangzhou), définissez le paramètre dlf.catalog.endpoint sur dlf.cn-hangzhou.aliyuncs.com. |
|
dlf.catalog.akMode |
Le mode AccessKey pour le service DLF. |
Définissez ce paramètre sur |
|
dlf.catalog.proxyMode |
Le mode proxy pour le service DLF. |
Définissez ce paramètre sur |
|
dlf.catalog.uid |
Votre ID de compte Alibaba Cloud. |
Consultez les informations de votre compte sur la page Informations utilisateur, ou connectez-vous à la console Alibaba Cloud pour afficher votre Account ID sur la page Gestion du compte. |
Exemple : Interrogation des données d'une table
Connectez-vous à Trino à l'aide de commandes. Pour plus d'informations, consultez la section Accéder à Trino à l'aide de commandes.
-
Exécutez la commande suivante pour interroger la table test_hive :
select * from hive.default.test_hive;