Todos os produtos
Search
Central de documentação

E-MapReduce:Criar um cluster

Última atualização: Jul 14, 2026

O Alibaba Cloud E-MapReduce (EMR) permite construir e executar frameworks de big data open-source, como Hadoop, Spark, Hive e Presto, para processamento e análise de dados em grande escala. Este tópico descreve as etapas e opções de configuração para criar um cluster EMR on ECS, ajudando você a configurar e gerenciar seus clusters de big data rapidamente.

Nota

Se você estiver criando um cluster EMR pela primeira vez após as 17:00 (UTC+8) de 19 de dezembro de 2022, não será possível selecionar os tipos de cluster Hadoop, Data Science, Presto ou ZooKeeper.

Pré-requisitos

Conclua a autorização do RAM. Para mais informações, consulte Autorizar funções para uma conta Alibaba Cloud.

Observações de uso

Para clusters DataLake, DataFlow, DataServing e Custom do EMR V5.12.1, EMR V3.46.1 ou posterior, caso os serviços selecionados não exijam nós Core, clique em Remove Node Group na coluna Actions da seção Node Group.

Etapas

  1. Faça login no console do E-MapReduce.

  2. Na barra de navegação superior, selecione uma região e um grupo de recursos conforme sua necessidade.

    • Região: O cluster é criado na região selecionada. Não é possível alterar a região após a criação do cluster.

    • Grupo de Recursos: Por padrão, todos os recursos da sua conta são exibidos.

  3. Clique em Create Cluster.

  4. Configure o cluster seguindo as instruções na tela.

    Ao criar um cluster, configure o software, o hardware e as definições básicas e, em seguida, confirme o pedido.

    Nota

    Após a criação do cluster, não é possível alterar suas configurações, exceto pelo nome do cluster. Revise cuidadosamente todas as definições antes de criar o cluster.

  5. Após verificar se todas as configurações estão corretas, clique em Confirm.

    Importante
    • Cluster com pagamento conforme o uso: A criação começa imediatamente. Após a criação, o status do cluster muda para Running.

    • Cluster por assinatura: Um pedido é gerado primeiro. O cluster é criado após a conclusão do pagamento.

Parâmetros

Configuração de software

Parâmetro

Descrição

Region

Uma região é a área geográfica onde um data center está localizado. Selecionar uma região mais próxima da sua localização pode reduzir a latência de rede. Não é possível alterar a região após a criação do cluster.

Business Scenario

Selecione um cenário com base nas necessidades do seu negócio:

  • Data Lake (DataLake): Oferece um cluster gerenciado flexível, confiável e eficiente para executar engines de computação de big data e realizar análises de dados.

    • Suporta a construção de uma arquitetura de data lake e utiliza o JindoFS para acelerar operações de data lake.

    • Suporta OSS-HDFS (HDFS totalmente gerenciado) para armazenamento, reduzindo custos de O&M com um modelo de faturamento baseado no uso.

    Para mais informações, consulte Cluster DataLake.

  • Data Analytics (OLAP): Importa grandes conjuntos de dados para uma engine de análise OLAP, como ClickHouse ou StarRocks, usando métodos como importação de dados ou tabelas externas. Fornece análises de dados eficientes, em tempo real e flexíveis para cenários de negócios como perfilamento de usuários, segmentação de audiência, relatórios de BI e análise de negócios.

  • Real-time Data Streaming (DataFlow): Uma solução completa de computação em tempo real na plataforma EMR. Possui dois componentes principais: Kafka, um sistema de mensagens distribuído, de alto throughput e altamente escalável, e o kernel comercial Flink da Ververica (baseado em Apache Flink). Esta solução foca em resolver desafios de computação em tempo real de ponta a ponta e é amplamente utilizada para ETL de dados em tempo real, além de coleta e análise de logs. Você também pode usar cada componente individualmente.

  • Data Service (DataServing):

    • Fornece clusters de serviço de dados flexíveis, confiáveis e eficientes.

    • Oferece clusters HBase semigerenciados e desacopla clusters de computação do armazenamento de dados usando OSS-HDFS (o serviço JindoFS).

    • Suporta cache local JindoData para melhorar ainda mais o desempenho de leitura e gravação do cluster de serviço de dados.

    Para mais informações, consulte Cluster DataServing.

  • Custom Cluster (Custom): Oferece uma ampla seleção de serviços. Escolha os serviços necessários conforme seus requisitos.

    Nota

    Em ambiente de produção, recomendamos evitar a implantação de múltiplos serviços de armazenamento no mesmo grupo de nós.

Product Version

A versão de lançamento do produto EMR. Para mais informações, consulte Versões de lançamento.

High Service Availability

Este recurso está desativado por padrão. Ao ativar a alta disponibilidade, o EMR cria múltiplos nós Master para suportar alta disponibilidade para ResourceManager e NameNode. Esses nós são distribuídos em diferentes hardwares subjacentes para reduzir o risco de falhas.

Optional Services (Select One At Least)

Selecione outros serviços conforme os requisitos do seu negócio. Os serviços selecionados iniciam automaticamente seus processos relacionados.

Importante
  • Adicionar mais serviços aumenta os requisitos de hardware. Nas etapas seguintes, selecione especificações de instância adequadas aos serviços escolhidos para garantir recursos suficientes.

  • Serviços instalados não podem ser desinstalados.

  • Os parâmetros obrigatórios variam dependendo da versão do produto e dos serviços selecionados.

Collect Service Operational Logs

Esta configuração, ativada por padrão, controla a coleta de logs para todos os serviços. Esses logs são usados apenas para diagnósticos do cluster.

Após a criação do cluster, acesse a página Basic Information para alterar o Collection Status of Service Operational Logs.

Importante

Se você desativar a coleta de logs, as verificações de integridade do EMR e o suporte técnico serão limitados, mas outros recursos continuarão funcionando normalmente. Para detalhes sobre como desativar este recurso e seu impacto, consulte Como parar de coletar logs de serviço?.

Metadata

Os seguintes métodos são suportados para armazenar e gerenciar metadados:

  • DLF Unified Metadata (Recomendado): Armazena metadados no Data Lake Formation (DLF).

    Após ativar o DLF, o sistema seleciona um DLF Catalog padrão para você (geralmente seu UID). Para usar catálogos diferentes para clusters distintos, crie um novo:

    1. Clique em Create Catalog. Na caixa de diálogo exibida, insira um ID de catálogo e clique em OK.

    2. Na lista suspensa DLF Catalog, selecione o catálogo que você criou.

  • Self-managed RDS: Usa sua própria instância RDS ou uma instância Alibaba Cloud RDS como armazenamento de metadados.

    Se escolher este método, configure os parâmetros relacionados ao RDS. Para mais informações, consulte Configurar um banco de dados RDS autogerenciado.

  • Built-in MySQL (Não Recomendado): Armazena metadados em um banco de dados MySQL no nó Master do cluster.

    Nota
    • Para cenários de teste: Recomendamos o uso de DLF Unified Metadata.

    • Para cenários de produção: Utilize DLF Unified Metadata ou Self-managed RDS.

Root Storage Directory of Cluster

Este parâmetro é necessário apenas quando você seleciona o serviço OSS-HDFS. Não é necessário se você selecionar o serviço HDFS.

Importante

Buckets criados ao clicar no botão Create OSS-HDFS Bucket no console do EMR suportam operações de leitura e gravação apenas através do EMR. Operações via console ou API não são suportadas.

Ao usar o serviço OSS-HDFS pela primeira vez, sua conta Alibaba Cloud (conta principal) deve clicar here e seguir as instruções para concluir a autorização. Se você for um usuário RAM, sua conta Alibaba Cloud deve autorizá-lo a ativar o serviço e conceder a política AliyunEMRDlsFullAccess e as funções AliyunOSSDlsDefaultRole e AliyunEMRDlsDefaultRole. Para mais informações, consulte Conceder permissões a um usuário RAM. Selecione um bucket na mesma região onde o serviço OSS-HDFS já está habilitado ou clique em Create OSS-HDFS Bucket para criar uma nova instância OSS-HDFS como caminho raiz de armazenamento do cluster.

Nota
  • Antes de usar o serviço OSS-HDFS, verifique se ele está disponível na região selecionada. Caso contrário, mude para outra região ou use o serviço HDFS. Para informações sobre regiões que suportam o serviço OSS-HDFS, consulte Habilitar OSS-HDFS e conceder permissões de acesso.

  • O serviço OSS-HDFS é suportado para clusters DataLake, DataFlow, DataServing e Custom do EMR V5.12.1, EMR V3.46.1 ou posterior.

Parâmetros de serviço e versão

Os parâmetros abaixo estão relacionados à versão do produto e aos serviços selecionados.

  • Estes parâmetros são necessários apenas para EMR V5.12.0 e anteriores, ou EMR V3.46.0 e anteriores, quando o serviço Hive é selecionado.

    Parâmetro

    Descrição

    Hive Storage Mode

    Define se deve usar OSS-HDFS ou OSS como diretório de armazenamento para o data warehouse. Se esta opção não for selecionada, o HDFS local do cluster será usado.

    Quando selecionado por padrão, configure também o Hive Data Warehouse Path. Recomendamos selecionar um bucket com o serviço HDFS habilitado.

    Nota

    Certifique-se de ter as permissões necessárias para acessar o bucket OSS ou OSS-HDFS.

  • Estes parâmetros são necessários apenas para EMR V5.12.0 e anteriores, ou EMR V3.46.0 e anteriores, quando o serviço HBase é selecionado.

    Parâmetro

    Descrição

    HBase Storage Mode

    Define o modo de armazenamento para arquivos de dados do HBase. Os seguintes modos são suportados: OSS-HDFS e OSS.

    Se selecionar o modo OSS-HDFS, configure também o HBase Storage Path. Recomendamos selecionar um bucket com o serviço HDFS habilitado.

  • Estes parâmetros são necessários apenas para EMR V5.12.1 e posterior, ou EMR V3.46.1 e posterior, após selecionar os serviços OSS-HDFS e HBase. Após a criação do cluster, um serviço HBase-HDFS é gerado. Para mais informações, consulte HBASE-HDFS.

    Parâmetro

    Descrição

    HBase Log Storage

    Selecionado por padrão, o que significa que o HBase armazena arquivos HLog no HDFS.

Mais cenários

Importante

Se você estiver criando um cluster EMR pela primeira vez após as 17:00 (UTC+8) de 19 de dezembro de 2022, não poderá selecionar os seguintes tipos de cluster.

  • Machine Learning (Data Science): Focado principalmente em cenários de Big Data + IA.

    • Oferece um framework de deep learning distribuído.

    • Disponibiliza mais de 200 pacotes de algoritmos clássicos de machine learning.

    • Fornece capacidades de AutoML e mais de 10 algoritmos de deep learning cobrindo cenários como recomendação e publicidade.

  • Old Data Lake: Usado para construir frameworks e pipelines de processamento de dados em grande escala, adequado para análises de big data. Suporta frameworks open-source como Apache Hive, Spark e Presto. Os seguintes tipos de cluster são suportados:

    • Hadoop:

      • Oferece a lista mais extensa de componentes open-source, totalmente compatível com o ecossistema Hadoop.

      • Pode ser usado em vários cenários, como processamento offline de big data, processamento em tempo real e consultas interativas.

      • Suporta a construção de arquitetura de data lake e usa JindoFS para aceleração de data lake.

    • ZooKeeper: Fornece um serviço de coordenação distribuída independente para clusters Hadoop, HBase e Kafka de grande escala.

    • Presto: Uma engine SQL distribuída em memória para consultas interativas. Suporta múltiplas fontes de dados e é adequada para análises complexas de dados na escala de petabytes e consultas entre fontes de dados.

Configurações avançadas (opcional)

Parâmetro

Descrição

Kerberos Authentication

Este recurso está desativado por padrão. Kerberos é um protocolo de autenticação de rede baseado em criptografia de chave simétrica que fornece autenticação para outros serviços. Para mais informações, consulte Kerberos.

Importante
  • Knox: Autenticação Kerberos não é suportada.

  • Kudu: Mesmo com o Kerberos habilitado, o serviço Kudu requer configuração adicional para suportar e ativar a autenticação Kerberos. Para mais informações, consulte a documentação do Apache Kudu sobre Autenticação.

Custom Software Configuration

Especifique um arquivo JSON para configurar o software básico no cluster, como Hadoop, Spark e Hive. Este recurso está desativado por padrão. Para mais informações, consulte Configurar software personalizado.

Nota

Para informações sobre como definir o nível de concorrência para jobs do Hive, consulte FAQ.

Configuração de hardware

Parâmetro

Descrição

Billing Method

Assinatura é selecionado por padrão. Os seguintes métodos de faturamento são suportados:

  • Pay-as-you-go: Modelo pós-pago onde o faturamento é horário com base no uso real. Adequado para testes de curto prazo ou tarefas dinâmicas e flexíveis.

  • Subscription: Modelo pré-pago onde o pagamento é feito antes do uso.

    Nota
    • Recomendamos usar o método Pay-as-you-go para cenários de teste. Após o sucesso nos testes, crie um cluster por Subscription para uso em produção.

    • Para instâncias por assinatura, selecione também uma Subscription Duration e decida se deseja ativar a Auto-renewal. O período de renovação padrão é de seis meses, com renovação automática ativada. Quando ativada, a instância é renovada automaticamente sete dias antes de expirar. Para mais informações, consulte Renovação.

Zone

Uma zona de disponibilidade é uma localização física distinta dentro de uma região, interconectada por uma rede privada de baixa latência. Geralmente, utilize a zona de disponibilidade padrão.

VPC

Uma VPC é um ambiente de rede logicamente isolado no Alibaba Cloud que oferece controle total sobre sua configuração de rede.

Selecione uma VPC existente ou clique em Create VPC para criar uma instantaneamente no console VPC. Para mais informações, consulte Criar e gerenciar uma VPC.

Nota

Não é possível alterar o endereço IP privado após a criação do cluster, pois ele está vinculado à Virtual Private Cloud (VPC).

vSwitch

Um vSwitch é uma subdivisão básica de rede de uma VPC usada para conectar diferentes recursos cloud.

Selecione um vSwitch existente ou clique em . Create vSwitch para criar um instantaneamente no console VPC. Para mais informações, consulte VPCs e vSwitches.

O tamanho do bloco CIDR do vSwitch determina o número de endereços IPv4 disponíveis. Por exemplo, um bloco CIDR /24 fornece cerca de 250 endereços IP disponíveis, um bloco /20 fornece cerca de 4.090 e um bloco /17 fornece cerca de 32.764. Se seu cluster exigir um grande número de nós, selecione um vSwitch com um bloco CIDR maior para garantir que endereços IP suficientes possam ser alocados para todos os nós do cluster.

Não é possível alterar o bloco CIDR de um vSwitch após sua criação. Se precisar de um intervalo de endereços IP maior, crie um novo vSwitch com um bloco CIDR maior e, em seguida, crie um novo cluster baseado nesse vSwitch. Ao criar um vSwitch, o console exibe o número de endereços IP disponíveis para o bloco CIDR selecionado, ajudando a avaliar se atende aos requisitos de tamanho do seu cluster.

Default Security Group

Um grupo de segurança é um firewall virtual que controla o tráfego de entrada e saída das instâncias dentro do grupo. Para mais informações, consulte Visão geral de grupos de segurança.

Selecione um grupo de segurança existente ou clique em create a new security group. para criar um no console ECS. Para mais informações, consulte Criar um grupo de segurança.

Importante

Não utilize grupos de segurança empresariais criados no ECS.

Node Group

Selecione tipos de instância conforme seus requisitos. Para mais informações, consulte Famílias de instâncias.

  • Master: Executa serviços do plano de controle, como ResourceManager e NameNode.

  • Core: Armazena dados no sistema de arquivos distribuído do cluster (HDFS). Também é possível escalar horizontalmente os nós Core sob demanda após a criação do cluster.

  • Task: Fornece capacidade de computação adicional e não armazena dados. Este grupo de nós é opcional e pode ser adicionado para escalar recursos de computação.

    Importante

    Grupos de nós Task suportam métodos de faturamento por pagamento conforme o uso, instância preemptível e assinatura.

  • Add to Deployment Set: Quando a alta disponibilidade está ativada, os nós Master são adicionados a um conjunto de implantação por padrão. Um conjunto de implantação é uma política que controla a distribuição de instâncias. Para mais informações, consulte Conjuntos de implantação.

  • System Disk: Selecione SSD padrão, SSD aprimorado (ESSD) ou disco ultra conforme necessário. Ajuste o tamanho do disco de sistema conforme exigido.

  • Data Disk: Selecione SSD padrão, SSD aprimorado (ESSD) ou disco ultra conforme necessário. Ajuste o tamanho do disco de dados conforme exigido.

    Nota

    Ao selecionar um SSD aprimorado (ESSD), defina diferentes níveis de desempenho (PLs) com base na capacidade do disco para atender a várias necessidades de desempenho do cluster. O nível de desempenho padrão é PL1. Dependendo da capacidade do disco, discos de sistema suportam PL0, PL1 e PL2, enquanto discos de dados suportam PL0, PL1, PL2 e PL3. Para mais informações sobre discos cloud, consulte Visão geral de discos cloud.

  • Instances: O grupo de nós Master possui uma instância por padrão. Se a alta disponibilidade estiver ativada, é possível ter múltiplas instâncias Master.

    O grupo de nós Core possui duas instâncias por padrão. Ajuste esse número conforme necessário.

  • Additional Security Group: Grupos de segurança adicionais permitem controle de acesso flexível entre diferentes recursos externos ou aplicações. Associe até dois grupos de segurança adicionais a este grupo de nós.

  • Assign Public Network IP: Define se deve atribuir um endereço Elastic IP (EIP) ao cluster. Desativado por padrão. Apenas clusters DataLake suportam a atribuição de IPs públicos no nível do grupo de nós.

    Nota

    Se não ativar este recurso, mas desejar usar um endereço IP público para acessar o cluster após sua criação, solicite um no console ECS. Para mais informações, consulte Solicitar um EIP.

Cluster Scaling

Selecione uma regra de auto scaling conforme necessário:

  • Do Not Use Auto Scaling Rules (Padrão).

  • Custom Auto Scaling Rule: Defina regras personalizadas para auto scaling baseado em tempo ou carga. Para mais informações, consulte Criar uma regra de auto scaling personalizada.

  • Managed Auto Scaling Rule: Ao iniciar o cluster, o EMR provisiona previamente o número de nós Task com base na regra de dimensionamento gerenciado. Para mais informações, consulte Criar uma regra de auto scaling gerenciada.

Nota
  • Configure regras de auto scaling apenas quando o método de faturamento do grupo de nós Task for pagamento conforme o uso ou instância preemptível.

  • Se um cluster contiver componentes Trino, Presto, StarRocks, Impala ou ClickHouse, não é possível mudar para uma regra de auto scaling gerenciada.

Configuração básica

Parâmetro

Descrição

Cluster Name

O nome do cluster. O nome deve ter de 1 a 64 caracteres e pode conter apenas caracteres chineses, letras, dígitos, hifens (-) e sublinhados (_).

Identity Credentials

Identity Credentials fornecem acesso seguro ao nó Master do cluster. Para instruções de login, consulte Fazer login em um cluster. Os seguintes tipos de credenciais são suportados:

  • Key Pair (Padrão): Selecione um par de chaves existente ou clique em Create Key Pair para criar um instantaneamente.

    Um par de chaves, composto por uma chave pública e uma chave privada, é um método de autenticação seguro e conveniente para fazer login em instâncias Linux. Para mais informações sobre o uso de pares de chaves, consulte Pares de chaves SSH.

  • Password: Defina uma senha de login para o nó Master e confirme-a. O nome de usuário padrão é root.

    • Requisitos de senha: 8 a 30 caracteres de comprimento, devendo conter letras maiúsculas, minúsculas, dígitos e caracteres especiais.

    • Caracteres especiais suportados incluem: ponto de exclamação (!), arroba (@), cerquilha (#), cifrão ($), sinal de porcentagem (%), circunflexo (^), e comercial (&) e asterisco (*).

Configurações avançadas (opcional)

Parâmetro

Descrição

ECS Application Role

Quando seu programa executa em um nó de computação do EMR, não é necessário especificar uma AccessKey do Alibaba Cloud para acessar serviços cloud relacionados, como o OSS. O EMR obtém automaticamente uma AccessKey temporária para o acesso, e as permissões dessa chave são controladas por uma ECS Application Role.

Bootstrap Actions

Scripts executados nos nós do cluster antes do início dos serviços. Use-os para instalar software ou personalizar o ambiente. Para mais informações, consulte Executar scripts usando bootstrap actions.

Release Protection

Este recurso evita a exclusão acidental de clusters com pagamento conforme o uso. Se ativado, desative-o antes de liberar o cluster. Para mais informações, consulte Ativar e desativar proteção de liberação.

Tags

Adicione tags ao criar um cluster ou após sua criação. Tags ajudam a identificar e gerenciar recursos do cluster. Para mais informações, consulte Gerenciar tags.

Resource Group

Grupos de recursos permitem agrupar seus recursos cloud por finalidade, permissões ou propriedade. Para mais informações, consulte Usar grupos de recursos.

Data Disk Encryption

Este recurso só pode ser ativado durante a criação do cluster. Quando ativado, os dados em repouso no disco de dados são criptografados. Para mais informações, consulte Ativar criptografia de disco de dados.

System Disk Encryption

Este recurso só pode ser ativado durante a criação do cluster. Quando ativado, o sistema operacional, arquivos de programa e outros dados em repouso no disco de sistema são criptografados. Para mais informações, consulte Ativar criptografia de disco de sistema.

Remarks

Usado para registrar informações importantes sobre o cluster. Adicione ou modifique observações na página Basic Information após a criação do cluster.

Confirmar pedido

(Opcional) Save as Cluster Template: Se selecionar Key Pair para credenciais de login, clique em Save as Cluster Template para salvar a configuração atual do cluster como um modelo de cluster.

  1. Na caixa de diálogo Save as Cluster Template, insira um Cluster Template Name e selecione um Cluster Template Resource Group.

    Parâmetro

    Descrição

    Cluster Template Name

    Insira um nome para o modelo de cluster para facilitar o gerenciamento. O nome deve ter de 1 a 64 caracteres e pode conter apenas caracteres chineses, letras, dígitos, hifens (-) e sublinhados (_).

    Cluster Template Resource Group

    Selecione um grupo de recursos existente para organizar seus modelos.

    Se precisar criar um novo grupo de recursos, clique em Create Resource Group. abaixo. Para mais informações, consulte Criar um grupo de recursos.

  2. Clique em OK.

    Um novo modelo de cluster é adicionado ao painel Manage Cluster Templates. Para mais informações sobre modelos de cluster, consulte Criar um modelo de cluster.

FAQ

Erro EntityNotExist.Role

  • Causa: A conta atual não possui as permissões necessárias para criar um cluster.

  • Solução:

    Escolha a solução apropriada dependendo se você está usando uma conta Alibaba Cloud ou um usuário RAM.

    • Conta Alibaba Cloud: Ao criar um cluster, sua conta deve ter permissão para acessar outros recursos do Alibaba Cloud e realizar operações relacionadas. Clique em RAM Quick Authorization para autorizar sua conta. Após a autorização bem-sucedida, crie o cluster. Para mais informações sobre autorização de funções, consulte Autorizar funções para uma conta Alibaba Cloud.

    • Usuário RAM: Sua conta não possui permissões para criar um cluster EMR. Recomendamos usar uma conta Alibaba Cloud para conceder a política AliyunEMRFullAccess ao usuário RAM. Para mais informações, consulte Conceder permissões a um usuário RAM.

Documentação relacionada