O MaxCompute Spark é um service de computação Spark compatível com open source, oferecido pelo MaxCompute. Construído sobre recursos de computação unificados e um sistema de permissões de conjuntos de dados, ele fornece o framework de computação Spark e permite que os usuários enviem e executem jobs Spark com uma abordagem de desenvolvimento familiar, atendendo a uma ampla variedade de cenários de processamento e análise de dados.
Principais recursos
-
Suporte nativo a jobs Spark de múltiplas versões
O Spark nativo da comunidade roda no MaxCompute com total compatibilidade com as APIs do Spark e suporte a diversas versões.
-
Recursos de computação unificados
O MaxCompute Spark utiliza os recursos de computação unificados habilitados para projetos do MaxCompute, assim como outros tipos de tarefa, incluindo MaxCompute SQL e MapReduce.
-
Gestão unificada de dados e permissões
Segue o sistema de permissões dos projetos do MaxCompute para consultar dados com segurança dentro do escopo de permissão do usuário.
-
Experiência de usuário equivalente a sistemas open source
Oferece recursos nativos de Spark UI em tempo real e logs de histórico de consultas, idênticos aos do open source.
Recursos suportados
Atualmente, o MaxCompute Spark oferece suporte aos seguintes recursos:
Computação offline: GraphX, MLlib, RDD, Spark-SQL, PySpark, entre outros.
Leitura e gravação de dados em tabelas do MaxCompute.
Referência a resources de arquivo no MaxCompute.
Acesso a services em ambientes VPC da Alibaba Cloud.
Acesso ao armazenamento não estruturado do OSS da Alibaba Cloud.
Leitura de tabelas externas do OSS no MaxCompute.
DataWorks Notebook
Limites
No momento, o MaxCompute Spark não oferece suporte aos seguintes cenários:
Cenários interativos, como Spark-Shell, Spark-SQL-Shell e PySpark-Shell.
Acesso a funções integradas do MaxCompute ou a funções definidas pelo usuário (UDFs do MaxCompute).
Acesso a tabelas externas do MaxCompute, exceto tabelas externas do OSS.