Todos os produtos
Search
Central de documentação

E-MapReduce:O que é o EMR Serverless Spark

Última atualização: Jul 02, 2026

O EMR Serverless Spark é um mecanismo de lakehouse totalmente gerenciado para cargas de trabalho de dados e IA. Oferece 100% de compatibilidade com o Spark open source e permite executar jobs existentes com spark-submit e spark-sql sem alterar o código.

Os recursos escalam em segundos com granularidade de núcleo único e são liberados imediatamente após a conclusão de cada job. Você paga apenas pelo consumo real.

Casos de uso

  • Data warehousing e análises de BI: Execute consultas SQL e crie relatórios no editor SQL integrado. Compatível com fluxos de trabalho tradicionais de data warehouse.

  • ETL e engenharia de dados: Orquestre processamento em lote, computação de streaming e pipelines de transformação de dados em um único fluxo de trabalho.

  • Machine learning e ciência de dados: Desenvolva e treine modelos interativamente no Notebook integrado, com gerenciamento de ambiente Python e SparkML.

  • Análises de lakehouse: Consulte e gerencie dados armazenados em formatos abertos de lakehouse, como Apache Paimon, Apache Iceberg, Delta Lake e Apache Hudi.

Arquitetura

image

A arquitetura tem quatro camadas:

Camada de cenário de aplicação

O editor SQL processa consultas e relatórios. O Notebook oferece desenvolvimento interativo em Python e ML. Ambos compartilham uma plataforma unificada para transições contínuas entre análises e treinamento de modelos.

Camada de capacidade da plataforma

A orquestração de fluxos de trabalho agenda jobs em lote, streaming e IA em um único pipeline. O Resource Access Management (RAM) fornece controle de acesso refinado. Notebook, Apache Kyuubi e Apache Livy oferecem interfaces de programação flexíveis e envio de tarefas.

Camada de mecanismo principal

Dois mecanismos integrados aceleram o desempenho:

Mecanismo

Descrição

Fusion Engine (Spark Native Engine)

Mecanismo SQL vetorizado baseado em C++ que usa instruções SIMD. Oferece desempenho 300% superior ao Spark open source ao melhorar a utilização da CPU e reduzir a sobrecarga de memória em comparação à execução na JVM.

Celeborn (Remote Shuffle Service)

Serviço de shuffle remoto de nível empresarial que processa dados de shuffle na escala de petabytes com isolamento multilocatário. Elimina a necessidade de discos grandes nos nós de computação, aproveita totalmente o dimensionamento dinâmico de recursos e reduz custos de computação em até 30%.

Camada de armazenamento de lakehouse

Construída sobre Apache Paimon e Apache Iceberg, esta camada combina a flexibilidade do data lake com capacidades de warehouse: transações ACID, upserts eficientes e rastreamento de linhagem de dados.

Dimensionamento elástico e eficiência de custos

  • Separação entre computação e armazenamento: A computação escala em segundos com granularidade de núcleo único. O armazenamento usa precificação de pagamento conforme o uso.

  • Medição no nível da tarefa: A medição ocorre por tarefa ou fila, com estimativa de custos integrada.

  • Armazenamento em nuvem compatível com HDFS: Integra-se ao OSS-HDFS para facilitar a migração de ambientes on-premises. Usa o Data Lake Formation (DLF) para gerenciamento unificado de metadados e controle de acesso.

Compatibilidade com o ecossistema

  • Compatibilidade com Spark: 100% compatível com o Spark open source. Use spark-submit e spark-sql sem modificações.

  • Formatos de lakehouse: Suporta Apache Paimon, Apache Iceberg, Delta Lake e Apache Hudi.

  • Integração de agendamento: Funciona com Apache Airflow e Apache DolphinScheduler.

  • Segurança: Conecta-se ao Kerberos ou LDAP para autenticação. Usa o Apache Ranger para autorização de dados.

  • Machine learning: Inclui SparkML e Notebook integrados, com gerenciamento do ciclo de vida de bibliotecas Python.

Plataforma de desenvolvimento

  • Fluxo de trabalho ponta a ponta: Desenvolva, depure, publique e agende tarefas em uma única plataforma.

  • Gerenciamento de versões: Histórico completo de lançamentos com diffs de source e configuração. Todas as alterações são rastreáveis.

  • Isolamento de ambiente: Os ambientes de desenvolvimento e produção são estritamente separados.

Operações serverless

  • Sem configuração de infraestrutura: Comece imediatamente, sem gerenciamento ou configuração de cluster.

  • Gerenciamento automático de recursos: Os pods iniciam dinamicamente conforme os requisitos da tarefa e são liberados logo após a computação.

  • Pagamento pelo uso: O faturamento baseia-se no consumo real de recursos.

Faturamento

O EMR Serverless Spark oferece dois métodos de faturamento:

Método de faturamento

Descrição

Assinatura

Adquira recursos por um período específico. Pague antes de usar os recursos.

Pagamento conforme o uso

Ative e libere recursos conforme necessário. Pague após usar os recursos.

Primeiros passos