O E-MapReduce (EMR) é uma solução de processamento de big data da Alibaba Cloud. Desenvolvido com base nos projetos open source Apache Hadoop e Apache Spark, o EMR permite usar sistemas periféricos dos ecossistemas Hadoop e Spark para analisar e processar dados com facilidade. O EMR também lê e grava dados em outros sistemas de armazenamento e bancos de dados da Alibaba Cloud, como Object Storage Service (OSS) e ApsaraDB RDS.
Introdução ao produto
A Alibaba Cloud oferece EMR on ECS, EMR on ACK e EMR Serverless StarRocks para atender aos requisitos de negócios de diferentes usuários.
|
Item |
Descrição |
|
EMR on ECS |
Ao crie um cluster do EMR, o sistema implanta componentes do ecossistema open source Hadoop em instâncias do Elastic Compute Service (ECS), conforme suas configurações, e inicia esses componentes como serviços no cluster. Gerencie as operações de O&M dos serviços e das instâncias ECS do cluster diretamente no console do EMR. Para obter mais informações sobre o EMR on ECS, consulte O que é o EMR on ECS |
|
EMR on ACK |
Antes de usar o EMR on ACK, certifique-se de ter implantado um cluster ACK. Após a implantação, crie um cluster do EMR para implantar componentes de big data com base nos recursos do ACK e executá-los nos containers correspondentes. Para obter mais informações sobre o EMR on ACK, consulte O que é o EMR on ACK? |
|
EMR Serverless Spark |
O EMR Serverless Spark é um mecanismo lakehouse totalmente gerenciado para cargas de trabalho de dados e IA. Compatível 100% com o Spark open source, ele executa jobs existentes com Para obter mais informações sobre o EMR Serverless Spark, consulte O que é o EMR Serverless Spark?. |
Benefícios
EMR on ECS
O EMR facilita a implantação de serviços corporativos de big data open source, como Hadoop, Spark, Flink, Kafka e HBase.
Todos os componentes do EMR são open source. A plataforma adapta e otimiza esses componentes, oferecendo desempenho superior às versões originais.
Instâncias preemptíveis reduzem custos por meio do recurso de dimensionamento automático baseado em tempo.
O desacoplamento entre computação e armazenamento possibilita o uso elástico de recursos.
Crie ou escale horizontalmente um cluster em minutos, sem precisar implantar ou iniciar serviços manualmente.
EMR on ACK
Custo-benefício: Não é necessário adquirir clusters ACK separadamente.
O&M simplificada: Um sistema unificado de O&M e gerenciamento de clusters atende tanto ao big data quanto aos negócios online.
Experiência do usuário otimizada: O console do EMR disponibiliza os modelos de Infrastructure as a Service (IaaS) EMR on ECS e EMR on ACK, permitindo alternar entre eles de forma transparente.
Integração profunda: Com arquitetura de data lake nativa da nuvem, o EMR on ACK integra-se ao ACK para escalar recursos de computação sem limites.
EMR Serverless Spark
-
Mecanismos de computação nativos da nuvem que processam dados em velocidade ultrarrápida
-
Arquitetura aberta de data lake
-
Desenvolvimento ponta a ponta
-
Plataforma de recursos serverless