Todos os produtos
Search
Central de documentação

E-MapReduce:Instâncias do ECS

Última atualização: Jun 27, 2026

O E-MapReduce (EMR) é compatível com diversas famílias de instâncias do Elastic Compute Service (ECS). Cada família otimiza uma combinação específica de computação, memória e armazenamento. Escolha a família adequada para cada tipo de nó afeta diretamente o desempenho do cluster, o custo de armazenamento e a confiabilidade dos dados.

Visão geral das famílias de instâncias

Família de instâncias

Armazenamento

Proporção vCPU:memória

Indicação

Uso geral

Disco em nuvem

1:4 (ex.: 8 vCPUs / 32 GiB)

Computação e memória equilibradas; nós mestre e nós principais de pequena escala

Otimizada para computação

Disco em nuvem

1:2 (ex.: 8 vCPUs / 16 GiB)

Cargas de trabalho intensivas em CPU; nós principais com volumes moderados de dados

Otimizada para memória

Disco em nuvem

1:8 (ex.: 8 vCPUs / 64 GiB)

Cargas intensivas em memória; nós mestre e processamento em memória

Big data

Disco SATA local

Armazenamento HDFS em grande escala (10 terabytes ou mais); menor custo por GiB

Tipo SSD local

SSD local

Alto IOPS aleatório e throughput; cargas sensíveis à latência

Tipo compartilhado (nível básico)

Exclusivo para usuários iniciantes; não recomendado para clientes empresariais

GPU

Machine learning e computação heterogênea

Escolha da família de instâncias por tipo de nó

Cada tipo de nó em um cluster EMR tem uma função distinta que determina seu perfil de recursos. Selecione a família de instâncias conforme a atividade real do nó.

Nós mestre

Os nós mestre coordenam os serviços do cluster e exigem memória confiável e armazenamento estável, em vez de throughput bruto.

Use instâncias de uso geral ou otimizadas para memória nos nós mestre. Ambas utilizam discos em nuvem, que oferecem alta confiabilidade de dados para estado de coordenação e metadados.

Nós principais

Os nós principais processam tarefas e armazenam dados no HDFS. A família de instâncias ideal depende do volume de dados:

  • Abaixo de 10 terabytes: use instâncias de uso geral, otimizadas para computação ou otimizadas para memória. Essas opções armazenam dados em discos em nuvem e funcionam bem quando o OSS atua como camada primária de armazenamento.

  • 10 terabytes ou mais: use a família de instâncias big data. Discos SATA locais oferecem custo por GiB significativamente menor para armazenamento HDFS em grande escala.

Importante

Quando os nós principais utilizam discos locais (tipo big data ou SSD local), os dados do HDFS ficam armazenados nesses discos, o que não garante a confiabilidade dos dados.

Nota

É possível criar nós principais com a família de instâncias big data apenas em clusters Hadoop, Data Science, Dataflow e Druid.

Nós de tarefa

Os nós de tarefa adicionam capacidade de computação ao cluster sem armazenar dados no HDFS. Como não persistem dados, todas as famílias de instâncias são compatíveis, exceto o tipo big data. Escolha conforme o gargalo de recursos da carga de trabalho:

  • Tarefas limitadas por CPU: otimizadas para computação

  • Tarefas limitadas por memória: otimizadas para memória ou uso geral

  • Inferência de machine learning: GPU

Detalhes das famílias de instâncias

Uso geral

Armazena dados em discos em nuvem com proporção de 1:4 entre vCPU e memória. Adequada para diversas cargas de trabalho sem requisitos extremos de memória ou computação.

Otimizada para computação

Armazena dados em discos em nuvem com proporção de 1:2 entre vCPU e memória. Recomendada quando as tarefas têm limitação de CPU e a memória não representa o gargalo.

Otimizada para memória

Armazena dados em discos em nuvem com proporção de 1:8 entre vCPU e memória. Ideal para cargas de trabalho que mantêm grandes conjuntos de dados na memória, como o processamento em memória do Spark.

Big data

Utiliza discos SATA locais para armazenamento. O custo por GiB é significativamente inferior ao dos discos em nuvem, tornando esta a opção recomendada para armazenar grandes volumes de dados HDFS em nós principais. Disponível apenas em clusters Hadoop, Data Science, Dataflow e Druid.

Tipo SSD local

Utiliza SSDs locais para armazenamento. Oferece alto IOPS aleatório e throughput, adequada para cargas de trabalho sensíveis à latência.

Tipo compartilhado (nível básico)

As instâncias compartilham recursos físicos de CPU, o que pode resultar em desempenho inconsistente sob cargas elevadas de computação. Projetada para usuários iniciantes, mas não indicada para clientes empresariais.

GPU

Tipo de instância heterogênea baseada em hardware GPU. Use para machine learning e outras cargas aceleradas por GPU em nós de tarefa.