Ce tutoriel vous guide dans la configuration de l'environnement E-MapReduce (EMR) et DataWorks nécessaire pour la série de tutoriels sur l'analyse des profils utilisateurs. À l'issue de ce guide, vous disposerez des éléments suivants :
Un cluster EMR configuré pour l'intégration avec DataWorks.
Un espace de travail DataWorks dans la région Chine (Shanghai).
Un groupe de ressources serverless avec accès au réseau public.
Le cluster EMR enregistré dans DataWorks et prêt à exécuter des tâches.
Les ressources que vous créez dans ce tutoriel s'exécutent dans un environnement réel et engendrent des frais. Pour éviter des coûts inutiles, supprimez les ressources une fois la série de tutoriels terminée.
Prérequis
Avant de commencer, assurez-vous de disposer des éléments suivants :
Un compte Alibaba Cloud disposant des permissions nécessaires pour créer des clusters EMR, des espaces de travail DataWorks et des ressources VPC.
DataWorks activé. Pour les étapes d'activation, consultez Préparer un environnement.
Avoir consulté l'introduction du tutoriel d'analyse des profils utilisateurs afin de comprendre le flux de travail global.
Notes
Les informations de base sur les utilisateurs et les journaux d'accès au site web utilisés dans ce tutoriel sont fournis en tant que données de test.
Toutes les données présentées dans ce tutoriel sont des données simulées manuellement et ne peuvent être utilisées que pour des opérations expérimentales dans DataWorks.
Pour la manipulation des données, ce tutoriel utilise Développement des données (DataStudio) (Ancienne version).
Configurer le cluster EMR
Créez un cluster EMR auquel DataWorks peut se connecter pour exécuter des tâches de traitement des données.
-
Suivez les étapes décrites dans Créer un cluster pour créer un nouveau cluster. Utilisez la configuration suivante :
ImportantAvant de créer le cluster, consultez Bonnes pratiques pour la configuration de DataWorks sur les clusters EMR afin de confirmer quelles configurations de cluster sont prises en charge par DataWorks.
Paramètre Valeur Region China (Shanghai) Business Scenario Data Lake Product Version Latest version Optional Services Sélectionnez au minimum : composant Hive, composant OSS-HDFS (tous deux requis) Metadata DLF Unified Metadata Cluster Storage Root Path Sélectionnez une instance OSS-HDFS. Si la liste est vide, cliquez sur Create OSS-HDFS Instance pour en créer une.
Configurer l'environnement DataWorks
Étape 1 : Créer un espace de travail
Ignorez cette étape si vous disposez déjà d'un espace de travail dans la région Chine (Shanghai).
Connectez-vous à la console DataWorks. Dans le coin supérieur gauche, basculez la région vers China (Shanghai).
Dans le volet de navigation de gauche, cliquez sur Workspace, puis cliquez sur Create Workspace. Créez un espace de travail en mode standard, qui isole les environnements de production et de développement. Pour plus de détails, consultez Créer un espace de travail.
Étape 2 : Créer un groupe de ressources serverless
Le tutoriel utilise un groupe de ressources serverless pour la synchronisation et la planification des données. Les groupes de ressources serverless ne prennent pas en charge les opérations inter-régions ; créez-en donc un dans la région Chine (Shanghai).
Acheter le groupe de ressources
Connectez-vous à la console DataWorks. Dans la barre de navigation supérieure, sélectionnez la région China (Shanghai). Dans le volet de navigation de gauche, cliquez sur Resource Group.
Cliquez sur Create Resource Group. Sur la page d'achat, définissez Region And Zone sur China (Shanghai), saisissez un nom pour le groupe de ressources et finalisez l'achat en suivant les instructions. Pour les détails de facturation, consultez Facturation du groupe de ressources serverless.
Configurer le groupe de ressources
Sur la page Resource Group, localisez le groupe de ressources que vous avez créé et cliquez sur Associate Workspace dans la colonne Actions. Associez-le à l'espace de travail créé à l'étape 1.
-
Activez l'accès au réseau public pour le groupe de ressources. Les données de test de ce tutoriel sont récupérées via Internet public. Par défaut, le groupe de ressources n'a pas d'accès au réseau public. Configurez une passerelle NAT Internet pour le Virtual Private Cloud (VPC) associé au groupe de ressources et attribuez une adresse IP élastique (EIP) pour permettre la connectivité Internet.
Connectez-vous à la console VPC et accédez à la page Passerelle NAT Internet. Sélectionnez la région China (Shanghai).
-
Cliquez sur Create Internet NAT Gateway et configurez les paramètres suivants :
Paramètre Valeur Region China (Shanghai) VPC Le VPC associé à votre groupe de ressources. Pour le trouver : dans la console DataWorks, accédez à Resource Group > localisez votre groupe de ressources > Network Settings dans la colonne Actions > onglet VPC Binding > section Data Scheduling & Data Integration. Associate vSwitch Le vSwitch associé à votre groupe de ressources (au même emplacement que le VPC ci-dessus) Access Mode SNAT-enabled Mode EIP Purchase EIP Create Service-Linked Role Cliquez sur Create Service-Linked Role. Requis lors de la première création d'une passerelle NAT Internet. Laissez tous les autres paramètres à leurs valeurs par défaut.
Cliquez sur Buy Now. Sur la page de confirmation, acceptez les conditions d'utilisation et cliquez sur Activate Now.
Pour plus de détails, consultez Créer et utiliser un groupe de ressources serverless.
Étape 3 : Enregistrer le cluster EMR et initialiser le groupe de ressources
Enregistrez le cluster EMR dans DataWorks afin qu'il puisse exécuter des tâches sur le cluster.
Accéder à la page d'enregistrement du cluster EMR
Connectez-vous à la console DataWorks. Basculez vers la région China (Shanghai). Dans le volet de navigation de gauche, cliquez sur More > Management Center. Sélectionnez votre espace de travail dans la liste déroulante et cliquez sur Go To Management Center.
Dans le volet de navigation de gauche de la page SettingCenter, cliquez sur Cluster Management. Sur la page Cluster Management, cliquez sur Register Cluster. Dans la boîte de dialogue, cliquez sur E-MapReduce. La page Register EMR Cluster s'affiche.
Enregistrer le cluster
-
Sur la page Register EMR Cluster, saisissez les détails du cluster. Définissez les paramètres suivants :
Paramètre Valeur Cluster Alibaba Cloud Account Current Alibaba Cloud Account Cluster Type Data Lake (datalake) Default Access Identity Cluster Account: Hadoop Pass Proxy User Information Pass
Initialiser le groupe de ressources
Sur la page Cluster Management, localisez le cluster enregistré et cliquez sur Resource Group Initialization dans le coin supérieur droit.
Cliquez sur Initialize à côté du groupe de ressources nécessitant une initialisation.
-
Une fois l'initialisation terminée, cliquez sur Confirm.
ImportantAssurez-vous que l'initialisation réussit avant de poursuivre. En cas d'échec, vérifiez le message d'erreur et exécutez les diagnostics de connectivité réseau suggérés. Un échec d'initialisation entraîne l'échec des tâches ultérieures.
Pour des instructions détaillées sur l'enregistrement, consultez Enregistrer un cluster EMR dans DataWorks.
Étapes suivantes
L'environnement étant prêt, passez au tutoriel suivant pour synchroniser les données de profil utilisateur et les journaux d'accès au site web vers Object Storage Service (OSS), créer des tables Apache Hive et interroger les données à l'aide des nœuds EMR Hive. Consultez Synchroniser les données.