EMR propose des composants open source et développés en interne qui couvrent le développement de données, les moteurs de calcul, les services de données, la gestion des ressources, le stockage des données et l'intégration des données. Sélectionnez et configurez les composants selon vos besoins.
Si un composant souhaité n'est pas disponible lors de la création d'un cluster, ou si un composant open source est réservé aux utilisateurs existants, vous pouvez l'installer et le gérer vous-même.
EMR repose sur des composants open source, des développements internes, des produits Alibaba Cloud intégrés et une gestion de cluster. Reportez-vous au schéma d'architecture du service pour obtenir la liste complète des composants big data et leurs cas d'utilisation.
Développement de données
La couche de développement de données propose des outils visuels et une gestion du code pour la collecte, le nettoyage, la modélisation, l'analyse et la planification des tâches. Elle aide les entreprises à gérer et exploiter efficacement leurs actifs de données.
Pour le développement de données dans EMR, utilisez les produits Alibaba Cloud DataWorks . Voici les détails :
|
Nom du produit |
Description |
Documentation générale |
|
DataWorks |
DataWorks offre une solution de bout en bout pour l'intégration, le développement, la gouvernance, la gestion de la qualité, l'exploitation et maintenance (O&M) ainsi que le contrôle de sécurité des données. Cette solution convient aux scénarios nécessitant une intégration et une gouvernance complexes des données. |
Pour utiliser des composants open source de développement de données, choisissez Hue ou Superset :
|
Type de composant |
Nom du composant |
Description |
Documentation courante |
|
Open source |
Hue |
Hue est réservé aux utilisateurs existants. Hue est une interface web open source permettant d'interagir avec l'écosystème Apache Hadoop. |
|
|
Superset |
Superset est réservé aux utilisateurs existants. Superset est un outil de visualisation de données offrant des fonctionnalités riches en matière de tableaux de bord et de visualisation. |
Moteurs de calcul
EMR prend en charge les principaux moteurs de calcul pour le traitement par lots, l'analyse interactive, le traitement de flux et l'apprentissage automatique. Ces moteurs transforment la structure et la logique des données afin de répondre aux exigences des différents scénarios big data.
|
Type de composant |
Nom du composant |
Description |
Documentation associée |
|
Open source |
Spark |
Spark est un moteur de traitement de données massives rapide et polyvalent, qui propose un calcul en mémoire et prend en charge le traitement par lots, le traitement en temps réel, l'apprentissage automatique ainsi que le calcul graphique. |
|
|
Hive |
Hive est un outil d'entreposage de données basé sur Hadoop. Il fournit HiveQL, un langage de requête similaire au SQL, pour stocker, interroger et analyser des données à grande échelle sur Hadoop. |
||
|
StarRocks |
StarRocks est une base de données MPP (Massively Parallel Processing) nouvelle génération à haute vitesse. Elle prend en charge l'analyse multidimensionnelle OLAP, les requêtes à forte concurrence et l'analytique en temps réel. |
||
|
Doris |
Doris est une base de données analytique en temps réel hautes performances, idéale pour l'analyse de rapports, les requêtes ad hoc et l'accélération des requêtes fédérées pour les lacs de données. |
||
|
ClickHouse |
ClickHouse est un système de gestion de base de données columnar open source, conçu pour l'analytique OLAP efficace et l'exécution rapide de requêtes sur des ensembles de données massifs. |
||
|
Trino |
Trino, anciennement PrestoSQL, est un moteur de requête SQL distribué open source adapté aux requêtes analytiques interactives. |
||
|
Flink |
Flink est un moteur de traitement de flux qui permet le traitement de flux de données en temps réel à grande échelle. |
||
|
Presto |
Presto, également connu sous le nom de PrestoDB, est un moteur de requête SQL distribué flexible et évolutif, adapté aux requêtes analytiques interactives. |
||
|
Tez |
Apache Tez est un framework de traitement de données massives distribué qui propose un modèle d'exécution DAG (graphe acyclique dirigé) efficace et flexible. Il sert principalement de remplacement à MapReduce pour optimiser les performances des requêtes et du traitement par lots. |
||
|
Phoenix |
Phoenix est une couche intermédiaire SQL construite sur HBase. Elle vous permet d'utiliser la syntaxe SQL standard pour interroger et gérer les données stockées dans HBase. |
||
|
Impala |
Impala est disponible uniquement pour les utilisateurs existants. Impala offre des requêtes SQL hautes performances et à faible latence pour les données stockées dans Apache Hadoop. |
||
|
Kudu |
Kudu est disponible uniquement pour les utilisateurs existants. Kudu est un gestionnaire de stockage columnar distribué et évolutif qui offre des opérations de lecture/écriture aléatoires à faible latence et une analyse efficace des données. |
||
|
Druid |
Druid est disponible uniquement pour les utilisateurs existants. Druid est un système d'analytique en temps réel, distribué et en mémoire, conçu pour exécuter des requêtes interactives rapides sur des ensembles de données à grande échelle. |
Services de données
La couche de services de données fournit des fonctionnalités de chiffrement des données, de contrôle d'accès, de requête et d'accès aux données, ainsi que des capacités API. Elle vise à améliorer la sécurité des données, les performances opérationnelles et l'efficacité de l'analyse dans les environnements de big data.
|
Type de composant |
Nom du composant |
Description |
Documentation connexe |
|
Open source |
Ranger |
Ranger est un framework centralisé de gestion de la sécurité destiné à la gestion des autorisations et à l’audit au sein de l’écosystème Hadoop. |
|
|
Kerberos |
Kerberos est un protocole d’authentification qui s’appuie sur la cryptographie symétrique pour vérifier l’identité des utilisateurs auprès d’autres services et prend en charge le SSO (Single Sign-On). |
||
|
OpenLDAP |
OpenLDAP est une implémentation open source du protocole LDAP dédiée à la gestion et au stockage des informations relatives aux utilisateurs et aux ressources. Il offre des fonctionnalités de gestion des utilisateurs et d’authentification des identités. |
||
|
Kyuubi |
Kyuubi est une passerelle SQL distribuée et multi-locataires qui simplifie l’analyse des données et le traitement des requêtes en fournissant des services SQL et d’autres types de requêtes pour les moteurs de requête de data lake. |
||
|
Zookeeper |
ZooKeeper est un service de coordination distribuée conçu pour gérer les tâches critiques des applications distribuées, telles que la configuration, la synchronisation et l’attribution de noms. Il propose une solution de gestion de cluster cohérente, performante et fiable. |
||
|
Knox |
Knox est une passerelle API REST qui facilite l’accès sécurisé à Hadoop et à ses composants associés, tout en offrant une authentification unique et un contrôle d’accès centralisés. |
||
|
Livy |
Livy est un service permettant d’interagir avec Spark via une interface REST ou une bibliothèque cliente RPC. |
||
|
Kafka Manager |
Kafka Manager est disponible uniquement pour les utilisateurs existants. Kafka Manager est un outil de gestion de cluster pour Kafka qui fournit une interface web pour administrer et surveiller les clusters Kafka. |
||
|
Développé en interne |
DLF-Auth |
DLF-Auth est fourni par Data Lake Formation (DLF) et permet un contrôle d’accès granulaire aux bases de données, tables, colonnes et fonctions gérées par DLF, assurant ainsi une gestion unifiée des autorisations d’accès aux données dans le data lake. |
Gestion des ressources
La couche de gestion des ressources assure une planification et une administration efficaces des ressources. Elle permet d’automatiser l’ordonnancement des tâches, d’allouer intelligemment les ressources et de mettre à l’échelle les clusters de manière élastique, améliorant ainsi l’efficacité et la fiabilité du traitement des big data.
|
Type de composant |
Nom du composant |
Description |
Documentation connexe |
|
Open source |
YARN |
YARN est le système de gestion des ressources de Hadoop chargé d’ordonnancer et d’administrer les ressources du cluster. Il permet d’exécuter différents types de tâches de calcul distribué sur des ressources cluster partagées. |
Stockage des données
La couche de stockage des données prend en charge le stockage distribué des données structurées et non structurées. Vous pouvez choisir la méthode de stockage adaptée aux exigences de votre moteur de calcul.
|
Type de composant |
Nom du composant |
Description |
Documents courants |
|
Développé en interne |
OSS-HDFS |
OSS-HDFS est une solution de stockage d’objets compatible avec l’interface Hadoop Distributed File System (HDFS). Elle permet aux tâches de calcul Big Data d’accéder directement aux données stockées dans Alibaba Cloud OSS via le protocole HDFS standard. |
|
|
JindoCache |
JindoCache est une solution de cache distribué qui accélère l’accès aux données à grande échelle en mettant en cache les blocs de données en mémoire. Cette approche améliore les performances en lecture et réduit la pression exercée sur le système de stockage sous-jacent. |
||
|
ESS |
ESS est disponible uniquement pour les utilisateurs existants. Les nouveaux utilisateurs doivent utiliser le composant Celeborn. ESS est un composant d’extension basé sur Shuffle, conçu pour optimiser les opérations de lecture et d’écriture Shuffle. |
||
|
JindoData |
JindoData est disponible uniquement pour les utilisateurs existants. Les nouveaux utilisateurs doivent utiliser le composant JindoCache. JindoData est une suite d’accélération du stockage de lac de données développée en interne pour les écosystèmes Big Data et IA. Elle propose une solution complète d’accélération d’accès pour les principaux systèmes de stockage de lac de données d’Alibaba Cloud et du secteur. |
||
|
SmartData |
SmartData est disponible uniquement pour les utilisateurs existants. Les nouveaux utilisateurs doivent utiliser le composant OSS-HDFS. SmartData est un composant EMR développé en interne qui offre une optimisation unifiée du stockage, une optimisation du cache, une accélération des calculs et des extensions de fonctionnalités de stockage pour les moteurs de calcul EMR. Il couvre l’accès aux données, la gouvernance des données et la sécurité des données. |
SmartData (disponible uniquement pour les utilisateurs existants) |
|
|
Open source |
Paimon |
Paimon est un format de stockage de lac unifié pour les flux et les lots, prenant en charge les écritures à haut débit et les requêtes à faible latence. |
|
|
Hudi |
Hudi est un format de stockage de lac de données qui permet de mettre à jour et de supprimer des données sur un système de fichiers Hadoop, ainsi que de consommer les modifications apportées aux données. |
||
|
Iceberg |
Iceberg est un format de table de lac de données open source offrant des opérations de lecture/écriture haute performance et une gestion des métadonnées efficace. |
||
|
DeltaLake |
DeltaLake est une couche de stockage de données open source. Elle fournit des transactions ACID (atomicité, cohérence, isolation et durabilité), un traitement évolutif des métadonnées et un traitement unifié des flux et des lots. |
||
|
HDFS |
Hadoop Distributed File System (HDFS) est un système de fichiers distribué conçu pour stocker des ensembles de données à grande échelle. Il se caractérise par une tolérance aux pannes élevée et un débit important, tout en stockant les données de manière redondante sur plusieurs nœuds de cluster. |
||
|
HBase |
HBase est une base de données open source distribuée orientée colonne, construite sur le système de fichiers Hadoop. Elle offre un accès aléatoire en lecture/écriture à faible latence et un stockage hautement fiable pour les ensembles de données à grande échelle. |
||
|
Celeborn |
Celeborn est un service qui traite les données intermédiaires afin d’améliorer la stabilité, la flexibilité et les performances des moteurs Big Data. |
||
|
HBASE-HDFS |
HBASE-HDFS correspond à HDFS. Dans les scénarios de séparation calcul-stockage, il utilise HBASE-HDFS local pour stocker les données Write-Ahead Logging (WAL). |
||
|
Alluxio |
Alluxio est disponible uniquement pour les utilisateurs existants. Alluxio est une technologie open source d’orchestration des données destinée à l’analytique des données et à l’IA dans le cloud. Elle fournit une couche d’accès aux données unifiée prenant en charge plusieurs systèmes de stockage sous-jacents. |
Intégration des données
La couche d’intégration des données assure le transfert de données par lots, le traitement des flux de messages en temps réel et la collecte distribuée des journaux, afin d’améliorer l’efficacité du transfert des données et la fiabilité de leur collecte.
|
Type de composant |
Nom du composant |
Description |
Documentation générale |
|
Open source |
Flume |
Flume est un système distribué, fiable et hautement disponible qui collecte, agrège et déplace d'importants flux de journaux vers un magasin de données centralisé. |
|
|
Sqoop |
Sqoop permet de transférer efficacement des données entre Hadoop et les bases de données relationnelles. Il prend en charge les opérations d'importation et d'exportation de données à grande échelle. |
||
|
Kafka |
Kafka n'est disponible que pour les utilisateurs existants. Kafka est une plateforme open source de streaming d'événements distribuée, offrant un débit élevé, une faible latence et une persistance des données. Elle est largement utilisée pour le traitement de flux de données en temps réel et les applications de pipeline de données. |
Références
Pour l'architecture globale d'EMR, consultez Architecture du service.
Pour connaître les composants pris en charge par chaque version d'EMR ainsi que leurs numéros de version, reportez-vous à la section Composants pris en charge par chaque version.
Pour découvrir les scénarios pris en charge par EMR et les composants à utiliser dans chaque cas, consultez la rubrique Cas d'utilisation du Big Data.