O AnalyticDB for MySQL Serverless Spark é um serviço de análise de big data baseado no Apache Spark e desenvolvido pela equipe do AnalyticDB for MySQL. Após criar um cluster do AnalyticDB for MySQL, envie jobs do Spark com configuração mínima, sem precisar implantar um cluster Spark.

Como funciona
O Apache Spark é um sistema de processamento distribuído de código aberto para cargas de trabalho de big data. Ele oferece suporte a SQL e DataFrames em várias linguagens de programação, abrangendo SQL, processamento em lote, processamento de fluxo, machine learning e computação em grafo.
O Serverless Spark integra o Apache Spark a tecnologias serverless e cloud-native. A equipe do AnalyticDB for MySQL fornece personalizações avançadas no mecanismo de código aberto, incluindo integração nativa com data warehouses do AnalyticDB for MySQL e acesso otimizado ao Object Storage Service (OSS).
Conceitos principais
|
Termo |
Descrição |
|
Job do Spark |
Unidade de trabalho enviada ao Serverless Spark. Cada job executa independentemente, com recursos próprios alocados. |
|
Driver |
Processo driver do Spark que coordena a execução do job. |
|
Executor |
Processos executor do Spark que executam as tarefas de computação efetivas. |
Vantagens
|
Recurso |
Descrição |
|
Facilidade de uso |
Envie jobs por APIs, scripts ou console. Mantenha o mesmo fluxo de trabalho do Apache Spark sem configurar componentes subjacentes. |
|
Livre de O&M |
Elimine a configuração de servidores, ajustes do Hadoop e o dimensionamento manual de recursos. O AnalyticDB for MySQL gerencia toda a infraestrutura. |
|
Escalabilidade no nível do job |
Aloque recursos independentemente para o driver e o executor de cada job. O dimensionamento ocorre em segundos. |
|
Redução de custos |
Pague apenas pelos recursos utilizados pelo job. Não há cobrança quando nenhum recurso estiver em uso. |
|
Desempenho aprimorado |
Em cenários típicos, o acesso a dados no OSS atinge até 5 vezes a velocidade do Apache Spark padrão. O desempenho de conexão chega a ser 6 vezes superior ao de uma conexão Java Database Connectivity (JDBC). Há também uma solução zero-ETL disponível para integração direta entre o AnalyticDB for MySQL e o Apache Spark. |
Casos de uso
|
Caso de uso |
Descrição |
|
ETL em larga escala |
Processe e transforme grandes volumes de dados sem provisionar um cluster Spark dedicado. |
|
Machine learning |
Execute jobs de treinamento baseados no MLlib com recursos sob demanda que se ajustam ao tamanho da carga de trabalho. |
|
Processamento de fluxo |
Gerencie pipelines de dados em tempo real usando Structured Streaming em um runtime totalmente gerenciado. |
|
Análises ad hoc |
Envie jobs SQL em lote ou DataFrame interativamente, sem pré-alocar clusters. |