E-MapReduce (EMR) propose quatre types de clusters prédéfinis — Data Lake, Data Analytics, Real-time Data Streaming et Data Service — chacun préconfiguré pour une charge de travail spécifique. Si aucun ne correspond à vos besoins, utilisez un Custom Cluster pour déployer la combinaison de services souhaitée.
Choisir un type de cluster
Le tableau ci-dessous vous aide à associer votre charge de travail au type de cluster approprié.
| Type de cluster | Services inclus | Fonctionnalités principales | Charges de travail typiques |
|---|---|---|---|
| Data Lake (cluster DataLake) |
Calcul : Spark, Hive, Tez, Trino, Kyuubi, Presto Stockage : Hadoop Distributed File System (HDFS), OSS-HDFS, Celeborn, JindoCache Intégration des données : Flume, Sqoop Formats de lac de données : Hudi, Iceberg, Paimon Gestion des ressources : YARN Coordination : ZooKeeper Sécurité : OpenLDAP, Ranger, DLF-Auth, Knox |
Stockage unifié, plusieurs moteurs de calcul compatibles, prise en charge des formats Hudi/Iceberg/Paimon | Extraction, transformation et chargement (ETL) hors ligne — ETL d'entrepôt de données, analyse ad hoc |
| Data Analytics (cluster OLAP) |
Traitement analytique en ligne (OLAP) : StarRocks, ClickHouse, Doris Coordination : ZooKeeper |
Temps de réponse des requêtes inférieur à la seconde, optimisation du stockage orienté colonnes, requêtes fédérées | Analyse d'agrégation complexe — analyse de profil utilisateur, identification de groupes d'utilisateurs, business intelligence (BI) |
| Real-time Data Streaming (cluster Dataflow) |
Calcul de flux : Flink Stockage : HDFS, OSS-HDFS Format de lac de données : Paimon Gestion des ressources : YARN Coordination : ZooKeeper Sécurité : OpenLDAP, Knox |
Traitement par lots et en flux unifié, faible latence, garantie de cohérence des états | ETL en temps réel — ETL d'entrepôt de données en flux continu |
| Data Service (cluster DataServing) |
Calcul : Phoenix Stockage orienté colonnes : HBase Stockage : HDFS, OSS-HDFS, JindoCache Coordination : ZooKeeper Sécurité : OpenLDAP, Ranger, Knox |
Requêtes ponctuelles en quelques millisecondes, optimisation de l'interface SQL, séparation lecture/écriture | Requêtes à forte concurrence — analyse du comportement, marketing de précision |
| Custom Cluster |
Calcul : Spark, Hive, Tez, Trino, Kyuubi, Presto, Flink, Phoenix OLAP : StarRocks Stockage orienté colonnes : HBase Stockage : HDFS, OSS-HDFS, Celeborn, JindoCache Intégration des données : Flume, Sqoop Formats de lac de données : Hudi, Iceberg, Paimon Gestion des ressources : YARN Coordination : ZooKeeper Sécurité : OpenLDAP, Ranger, DLF-Auth, Knox |
Déploiement flexible des services, charges de travail mixtes (temps réel, hors ligne et analytique) | ETL hors ligne, ETL en temps réel, analyse d'agrégation complexe et requêtes à forte concurrence |
Les versions de service disponibles dans un cluster dépendent de la version EMR. Utilisez la dernière version EMR pour bénéficier des fonctionnalités les plus récentes, de meilleures performances et des améliorations de sécurité. Pour obtenir la liste complète des versions disponibles, consultez Versions publiées.
Quand utiliser un Custom Cluster
Un Custom Cluster vous offre un contrôle total sur les services à déployer. Utilisez-le lorsque votre charge de travail s'étend sur plusieurs types de clusters, par exemple pour exécuter Spark, Flink et HBase simultanément sur un seul cluster.
Optez pour un Custom Cluster si :
Votre charge de travail combine l'ETL hors ligne, le traitement en temps réel et les requêtes analytiques.
Aucun type de cluster prédéfini ne couvre tous les services dont vous avez besoin.
Privilégiez plutôt des clusters dédiés séparés si :
Vos charges de travail hors ligne et en temps réel ont des exigences différentes en matière de latence ou de ressources ; leur mélange sur un seul cluster peut provoquer des interférences.
Si un Custom Cluster ne parvient toujours pas à répondre entièrement à vos besoins, déployez manuellement des services supplémentaires après avoir évalué leur compatibilité et leur sécurité.
Étapes suivantes
Après avoir sélectionné un type de cluster, planifiez la configuration restante du cluster :