E-MapReduce (EMR) est une plateforme big data open source sur Alibaba Cloud, construite sur Apache Hadoop et Apache Spark. Utilisez EMR pour traiter et analyser des données avec les écosystèmes Hadoop et Spark, et transférer des données entre les services Alibaba Cloud tels que Object Storage Service (OSS) et ApsaraDB RDS.
Options de déploiement
EMR propose les options de déploiement suivantes :
|
Type |
Description |
|
EMR on ECS |
Déploie les composants de l'écosystème Hadoop open source sur des instances Elastic Compute Service (ECS). Gérez les clusters et les services depuis la console EMR. |
|
EMR on ACK |
Déployez un cluster Container Service for Kubernetes (ACK), puis exécutez les composants big data EMR dans des conteneurs sur les ressources ACK. Qu'est-ce qu'EMR on ACK ? |
|
EMR Serverless Spark |
EMR Serverless Spark est un moteur lakehouse entièrement géré pour les charges de travail de données et d'IA. Il est compatible à 100 % avec Spark open source : exécutez vos jobs existants avec |
EMR s'appuie sur des services open source communautaires tels qu'Apache Hadoop, Spark, Flink et StarRocks. La responsabilité de l'exploitation et de la maintenance (O&M) varie selon l'option de déploiement :
EMR on ECS et EMR on ACK sont semi-gérés. Les ressources du cluster appartiennent à votre compte Alibaba Cloud et vous êtes responsable de l'O&M courante des services open source, y compris la planification de la capacité, l'ajustement des paramètres et le dépannage. Prévoyez une expertise interne en O&M big data pour assurer le bon fonctionnement de vos charges de travail.
EMR Serverless Spark et EMR Serverless StarRocks sont entièrement gérés. Alibaba Cloud exploite les ressources sous-jacentes et les services de moteur, si bien que vous vous concentrez uniquement sur le développement des jobs et l'analyse des données.
Pour connaître l'étendue complète du support, consultez la rubrique Étendue et méthodes du support technique.
Avantages
EMR on ECS
Services big data open source de niveau entreprise. Déployez rapidement des clusters Hadoop, Spark, Flink, Kafka et HBase.
Composants 100 % open source communautaire, adaptés et optimisés pour offrir des performances supérieures aux versions standard.
Mise à l'échelle élastique basée sur le temps avec prise en charge des instances Spot pour réduire les coûts.
Découplage du calcul et du stockage pour une utilisation élastique des ressources.
Créez et mettez à l'échelle des clusters en quelques minutes sans configuration manuelle.
EMR on ACK
Rentable : aucun cluster ACK distinct n'est requis.
Simplification de l'O&M : gestion unifiée des clusters pour les services big data et en ligne.
Infrastructure flexible : prend en charge les modèles de ressources ECS et ACK avec basculement transparent.
Intégration approfondie : architecture de lac de données cloud-native avec calcul basé sur ACK pour une mise à l'échelle illimitée.
EMR Serverless Spark
-
Moteur de calcul haute vitesse cloud-native
Fusion Engine intégré (Spark Native Engine) : offre des performances supérieures de 300 % par rapport à la version open source et accélère considérablement les jobs de calcul big data. Un moteur vectorisé et des technologies de traitement des données par lots optimisent l'efficacité du calcul et réduisent l'utilisation de la mémoire, ce qui améliore grandement les performances globales.
Celeborn intégré (Remote Shuffle Service) : prend en charge le traitement des données de shuffle à l'échelle du pétaoctet et améliore considérablement la stabilité et les performances des gros jobs de shuffle. Les nœuds de calcul ne nécessitent pas de disques de grande capacité. La capacité de mise à l'échelle dynamique des ressources de Spark est pleinement exploitée pour réduire les coûts de stockage et diminuer le coût total des ressources de calcul jusqu'à 30 %.
-
Architecture de lac de données ouverte
Mise à l'échelle élastique à la demande : prend en charge une architecture de séparation du stockage et du calcul. Les ressources de calcul peuvent être mises à l'échelle en quelques secondes, avec une granularité minimale d'un cœur. Les ressources sont mesurées au niveau fin du job ou de la file d'attente. Le stockage utilise la méthode de facturation au paiement à l'utilisation pour éviter le gaspillage de ressources et réduire considérablement les coûts opérationnels des entreprises.
Migration transparente et compatibilité : s'intègre à OSS-HDFS, un service de stockage cloud entièrement compatible avec HDFS, pour prendre en charge la migration fluide de vos charges de travail vers le cloud. DLF fournit une interconnexion complète des métadonnées pour le lakehouse afin de garantir la cohérence de l'accès aux données et une gestion complète des autorisations, ce qui vous aide à construire facilement une architecture moderne de lac de données.
-
Expérience développeur tout-en-un
Support de développement de bout en bout : offre une expérience de développement tout-en-un couvrant le développement, le débogage, la publication et la planification des jobs pour répondre aux normes élevées de développement et de publication de niveau entreprise. La fonctionnalité intégrée de gestion des versions enregistre l'historique complet des publications et prend en charge la comparaison des différences de code source et de configuration pour garantir la traçabilité des modifications.
Collaboration efficace et stabilité : les environnements de développement et de production sont strictement isolés pour garantir la stabilité commerciale et prendre en charge une collaboration d'équipe efficace ainsi qu'une livraison stable.
-
Plateforme de ressources serverless
Prêt à l'emploi : démarrez rapidement le développement de jobs sans gestion manuelle ni configuration complexe de l'infrastructure.
Élasticité à la seconde : les ressources sont provisionnées dynamiquement pour démarrer des pods en fonction des besoins en ressources des jobs Spark, et sont libérées immédiatement après la fin du calcul. Vous n'êtes facturé que pour les ressources que vous utilisez réellement, ce qui réduit encore le coût total du calcul.
Estimation des coûts : fournit une mesure des ressources et une estimation des coûts au niveau du job pour aider les entreprises à réaliser des opérations fines.