O EMR Serverless Spark é um mecanismo de lakehouse totalmente gerenciado para cargas de trabalho de dados e IA. Oferece 100% de compatibilidade com o Spark open source e permite executar jobs existentes com spark-submit e spark-sql sem alterar o código.
Os recursos escalam em segundos com granularidade de núcleo único e são liberados imediatamente após a conclusão de cada job. Você paga apenas pelo consumo real.
Casos de uso
Data warehousing e análises de BI: Execute consultas SQL e crie relatórios no editor SQL integrado. Compatível com fluxos de trabalho tradicionais de data warehouse.
ETL e engenharia de dados: Orquestre processamento em lote, computação de streaming e pipelines de transformação de dados em um único fluxo de trabalho.
Machine learning e ciência de dados: Desenvolva e treine modelos interativamente no Notebook integrado, com gerenciamento de ambiente Python e SparkML.
Análises de lakehouse: Consulte e gerencie dados armazenados em formatos abertos de lakehouse, como Apache Paimon, Apache Iceberg, Delta Lake e Apache Hudi.
Arquitetura
A arquitetura tem quatro camadas:
Camada de cenário de aplicação
O editor SQL processa consultas e relatórios. O Notebook oferece desenvolvimento interativo em Python e ML. Ambos compartilham uma plataforma unificada para transições contínuas entre análises e treinamento de modelos.
Camada de capacidade da plataforma
A orquestração de fluxos de trabalho agenda jobs em lote, streaming e IA em um único pipeline. O Resource Access Management (RAM) fornece controle de acesso refinado. Notebook, Apache Kyuubi e Apache Livy oferecem interfaces de programação flexíveis e envio de tarefas.
Camada de mecanismo principal
Dois mecanismos integrados aceleram o desempenho:
|
Mecanismo |
Descrição |
|
Fusion Engine (Spark Native Engine) |
Mecanismo SQL vetorizado baseado em C++ que usa instruções SIMD. Oferece desempenho 300% superior ao Spark open source ao melhorar a utilização da CPU e reduzir a sobrecarga de memória em comparação à execução na JVM. |
|
Celeborn (Remote Shuffle Service) |
Serviço de shuffle remoto de nível empresarial que processa dados de shuffle na escala de petabytes com isolamento multilocatário. Elimina a necessidade de discos grandes nos nós de computação, aproveita totalmente o dimensionamento dinâmico de recursos e reduz custos de computação em até 30%. |
Camada de armazenamento de lakehouse
Construída sobre Apache Paimon e Apache Iceberg, esta camada combina a flexibilidade do data lake com capacidades de warehouse: transações ACID, upserts eficientes e rastreamento de linhagem de dados.
Dimensionamento elástico e eficiência de custos
Separação entre computação e armazenamento: A computação escala em segundos com granularidade de núcleo único. O armazenamento usa precificação de pagamento conforme o uso.
Medição no nível da tarefa: A medição ocorre por tarefa ou fila, com estimativa de custos integrada.
Armazenamento em nuvem compatível com HDFS: Integra-se ao OSS-HDFS para facilitar a migração de ambientes on-premises. Usa o Data Lake Formation (DLF) para gerenciamento unificado de metadados e controle de acesso.
Compatibilidade com o ecossistema
Compatibilidade com Spark: 100% compatível com o Spark open source. Use
spark-submitespark-sqlsem modificações.Formatos de lakehouse: Suporta Apache Paimon, Apache Iceberg, Delta Lake e Apache Hudi.
Integração de agendamento: Funciona com Apache Airflow e Apache DolphinScheduler.
Segurança: Conecta-se ao Kerberos ou LDAP para autenticação. Usa o Apache Ranger para autorização de dados.
Machine learning: Inclui SparkML e Notebook integrados, com gerenciamento do ciclo de vida de bibliotecas Python.
Plataforma de desenvolvimento
Fluxo de trabalho ponta a ponta: Desenvolva, depure, publique e agende tarefas em uma única plataforma.
Gerenciamento de versões: Histórico completo de lançamentos com diffs de source e configuração. Todas as alterações são rastreáveis.
Isolamento de ambiente: Os ambientes de desenvolvimento e produção são estritamente separados.
Operações serverless
Sem configuração de infraestrutura: Comece imediatamente, sem gerenciamento ou configuração de cluster.
Gerenciamento automático de recursos: Os pods iniciam dinamicamente conforme os requisitos da tarefa e são liberados logo após a computação.
Pagamento pelo uso: O faturamento baseia-se no consumo real de recursos.
Faturamento
O EMR Serverless Spark oferece dois métodos de faturamento:
|
Método de faturamento |
Descrição |
|
Adquira recursos por um período específico. Pague antes de usar os recursos. |
|
|
Ative e libere recursos conforme necessário. Pague após usar os recursos. |
Primeiros passos
Console: Console do EMR Serverless Spark
API: Operações estilo RPC usando GET e POST. Referência da API.
Portal do Desenvolvedor OpenAPI: Teste chamadas de API online e gere código SDK.
SDK: Disponível para Java, Python, PHP e outras linguagens. Baixe o SDK.