Todos os produtos
Search
Central de documentação

E-MapReduce:Quick start: Create and use a Data Lake cluster

Última atualização: Sep 17, 2026

Este tópico descreve como usar o console do E-MapReduce (EMR) para criar rapidamente um cluster Data Lake baseado no ecossistema open-source Hadoop e enviar um job clássico de WordCount usando um cliente de cluster. O WordCount é uma tarefa fundamental de computação distribuída no Hadoop que conta a ocorrência de palavras em grandes arquivos de texto. Ele é amplamente utilizado em análise de dados, mineração de dados e outros cenários.

Visão geral

Este guia de início rápido demonstra como:

  • Criar rapidamente um cluster Data Lake.

  • Enviar e executar um job WordCount usando um cliente de cluster.

  • Compreender os principais recursos do Alibaba Cloud EMR e o uso básico do ecossistema Hadoop.

Pré-requisitos

  • Você criou uma conta Alibaba Cloud e concluiu a verificação de nome real.

  • Conceda as funções padrão do EMR e ECS à conta de serviço do E-MapReduce. Para mais informações, consulte Role authorization.

Precauções

Você é responsável por gerenciar e configurar o ambiente de execução do seu código.

Procedimento

Etapa 1: Criar um cluster

  1. Acesse a página Create Cluster.

    1. Faça login no console do EMR on ECS.

    2. Na barra de navegação superior, selecione uma região e um grupo de recursos conforme suas necessidades de negócio.

      • Region: defina a região onde o cluster será criado. Não é possível alterar a região após a criação do cluster.

      • Resource group: exibe todos os recursos da sua conta por padrão.

    3. No canto superior esquerdo, clique em CREATE_CLUSTER.

  2. Na página Create Cluster, configure os parâmetros do cluster.

    Seção

    Parâmetro

    Exemplo

    Descrição

    Software Configuration

    Region

    China (Hangzhou)

    Localização física das instâncias ECS para os nós do cluster.

    Importante

    Não é possível alterar a região após a criação do cluster. Escolha a região com atenção.

    Business Scenario

    Data Lake

    Selecione um cenário para permitir que o EMR configure automaticamente componentes, serviços e recursos padrão. Isso simplifica a configuração do cluster e fornece um ambiente adaptado ao caso de uso especificado.

    Product Version

    EMR-5.18.1

    Selecione a versão mais recente do EMR.

    High Service Availability

    Disabled

    Este recurso vem desativado por padrão. Se você ativar a High Service Availability, o EMR distribui os nós mestres em hardwares subjacentes diferentes para reduzir o risco de falhas.

    Optional Services

    HADOOP-COMMON, OSS-HDFS, YARN, Hive, Spark3, Tez, Knox e OpenLDAP.

    Escolha os serviços conforme suas necessidades de negócio. Por padrão, o EMR inicia os processos de serviço correspondentes à sua seleção.

    Nota

    Para acessar as interfaces web dos serviços pelo console, selecione também os serviços Knox e OpenLDAP.

    Collect Service Operational Logs

    Enabled

    Defina se a coleta de logs deve ser ativada para todos os serviços. Por padrão, esta opção vem ativada para coletar os logs operacionais do seu cluster. Esses logs são utilizados exclusivamente para diagnósticos do cluster.

    Após criar o cluster, modifique o parâmetro Collection Status of Service Operational Logs na aba Basic Information.

    Importante

    Se você desativar esta opção, a verificação de integridade do cluster EMR e o suporte técnico relacionado aos serviços serão limitados. Para mais informações sobre como desativar a coleta de logs e os impactos dessa ação, consulte How do I stop collecting service logs?

    Metadata

    Built-in MySQL

    Armazena metadados no banco de dados MySQL integrado.

    Importante

    O banco de dados MySQL integrado permite configurar rapidamente um ambiente de teste, mas não é recomendado para ambientes de produção. Para produção, utilize uma instância auto-gerenciada do ApsaraDB RDS ou o Data Lake Formation (DLF) para gerenciamento unificado de metadados, conforme suas necessidades de negócio.

    Root Storage Directory of Cluster

    oss://.cn-hangzhou.oss-dls.aliyuncs.com

    Diretório raiz de armazenamento dos dados do cluster. Este parâmetro é obrigatório apenas se você selecionar o serviço OSS-HDFS.

    Nota
    • Antes de usar o serviço OSS-HDFS, certifique-se de que ele esteja disponível na região onde deseja criar o cluster. Caso o OSS-HDFS não esteja disponível na região escolhida, altere a região ou utilize o HDFS em vez do OSS-HDFS. Para mais informações sobre as regiões com suporte ao OSS-HDFS, consulte Enable OSS-HDFS and grant access permissions.

    • É possível selecionar o serviço OSS-HDFS ao criar um cluster DataLake no novo cenário de data lake, um cluster Dataflow, um cluster DataServing ou um cluster personalizado do EMR V5.12.1, EMR V3.46.1 ou versões posteriores.

    Hardware Configuration

    Billing Method

    Pay-as-you-go

    Para testes, utilize o método de faturamento Pay-as-you-go. Após validar os testes com sucesso, libere o cluster de teste e crie um novo cluster com o método de faturamento Subscription para produção.

    Zone

    Zone I

    Não é possível alterar a zona após a criação do cluster. Escolha a zona com atenção.

    VPC

    vpc_Hangzhou/vpc-bp1f4epmkvncimpgs****

    Selecione uma VPC na região atual. Se não houver nenhuma VPC disponível, clique em Create VPC para criar uma. Após criar a VPC, clique no ícone Refresh para selecioná-la.

    vSwitch

    vsw_i/vsw-bp1e2f5fhaplp0g6p****

    Selecione um vSwitch na zona especificada da VPC escolhida. Se não houver nenhum vSwitch disponível na zona, crie um.

    Default Security Group

    sg_seurity/sg-bp1ddw7sm2risw****

    Importante

    O EMR não oferece suporte a grupos de segurança corporativos criados no console do ECS.

    Selecione um grupo de segurança existente ou crie um novo.

    Node Group

    Ative a opção Assign Public Network IP para o grupo de nós mestre. Mantenha os valores padrão para os demais parâmetros.

    Configure os grupos de nós mestre, core e task conforme suas necessidades de negócio. Para mais informações, consulte Configure hardware and a network.

    Basic Configuration

    Cluster Name

    Emr-Data Lake

    Nome do cluster. Deve ter entre 1 e 64 caracteres e pode conter letras, dígitos, hífens (-), sublinhados (_) e caracteres chineses.

    Identity Credentials

    Password

    Permite fazer login remoto no nó mestre do cluster.

    Nota

    Caso prefira autenticação sem senha, selecione Key Pair. Para mais informações, consulte Manage SSH key pairs.

    Password e Confirm Password

    Uma senha personalizada.

    Anote a senha. Ela será necessária para fazer login no cluster.

  3. Clique em Confirm.

    Na página EMR on ECS, o cluster estará pronto quando seu Status mudar para Running. Para mais informações sobre os parâmetros do cluster, consulte Create a cluster.

Etapa 2: Preparar dados

Após criar o cluster, execute um teste de análise de dados usando o programa de exemplo WordCount pré-instalado. Também é possível enviar e executar suas próprias aplicações de big data. Este tópico utiliza o programa WordCount para demonstrar o processo, desde a preparação dos dados até o envio do job.

  1. Conecte-se ao cluster via SSH. Para mais informações, consulte Log on to a cluster.

  2. Prepare o arquivo de dados.

    Crie um arquivo de texto chamado wordcount.txt para servir como entrada para o job WordCount. O arquivo deve conter o seguinte conteúdo:

    hello world
    hello wordcount
  3. Envie o arquivo de dados.

    Nota

    Envie o arquivo de dados para o serviço HDFS, OSS ou OSS-HDFS do cluster conforme suas necessidades de negócio. Este tópico usa o serviço OSS-HDFS como exemplo. Para enviar um arquivo para o OSS, consulte Simple upload.

    1. Execute o comando abaixo para criar um diretório chamado input:

      hadoop fs -mkdir oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/input/
    2. Execute o comando a seguir para enviar o arquivo wordcount.txt do diretório local atual para o diretório input no OSS-HDFS:

      
      hadoop fs -put wordcount.txt oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/input/

Etapa 3: Enviar um job

Use o programa WordCount para analisar dados textuais e contar a frequência das palavras.

Execute o comando abaixo para enviar o job WordCount:

hadoop jar /opt/apps/HDFS/hadoop-3.2.1-1.2.16-alinux3/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.2.1.jar wordcount -D mapreduce.job.reduces=1 "oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/input/wordcount.txt" "oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/output/"

A tabela a seguir descreve os parâmetros do comando.

Parâmetro

Descrição

/opt/apps/.../hadoop-mapreduce-examples-3.2.1.jar

Pacote de programas de exemplo fornecido com o Hadoop. Inclui diversos exemplos clássicos de MapReduce. Neste caso, hadoop-mapreduce-examples-3.2.1.jar é o nome do arquivo JAR no seu cluster, e 3.2.1 é o número da versão. Geralmente, a versão é 3.2.1 para clusters da série EMR 5.x e 2.8.5 para clusters da série EMR 3.x.

-D mapreduce.job.reduces

Defina o número de reducers para o job MapReduce.

Por padrão, o Hadoop determina automaticamente essa quantidade com base no tamanho dos dados de entrada. Se o número de reducers não for especificado, vários arquivos de saída podem ser gerados, como part-r-00000 e part-r-00001. Ao definir este parâmetro como 1, garante-se a geração de apenas um arquivo de saída chamado part-r-00000.

oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/input/wordcount.txt

Caminho de entrada para o job WordCount. Corresponde ao caminho do arquivo de dados no OSS. Substitua <yourBucketname> pelo nome do seu bucket OSS e cn-hangzhou pelo ID da região.

oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/output/

Caminho de saída onde o job WordCount armazena seus resultados.

Etapa 4: Visualizar os resultados

Saída do job

Use um comando shell do Hadoop para visualizar a saída do job.

  1. Conecte-se ao cluster via SSH. Para mais informações, consulte Log on to a cluster.

  2. Execute o comando abaixo para visualizar a saída do job:

    hadoop fs -cat oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/output/part-r-00000

    A seguinte saída é retornada:

    hello	2
    wordcount	1
    world	1

Histórico de jobs

O YARN é o framework de gerenciamento de recursos do Hadoop responsável por agendar e gerenciar tarefas do cluster. Use a interface do YARN para verificar o status e o histórico dos jobs e revisar detalhes de execução.

  1. Abra a porta 8443. Para mais informações, consulte Manage security groups.

  2. Adicione um usuário. Para mais informações, consulte OpenLDAP user management.

    Ao acessar a página da interface do YARN, use o nome de usuário e a senha de uma conta Knox.

  3. Na página EMR on ECS, localize seu cluster e clique em Services na coluna Actions.

  4. Clique na aba Access Links and Ports.

  5. Na linha YARN UI, clique no link da coluna Public URL.

    Autentique-se com suas credenciais de usuário para acessar a página da interface do YARN.

  6. Na página All Applications, clique no ID de um job para visualizar seus detalhes.

    A parte superior desta página exibe Cluster Metrics (como Apps Submitted, Apps Running e Memory Used) e Cluster Nodes Metrics. A parte inferior lista as aplicações com colunas como ID, Name, Application Type, State e FinalStatus.

(Opcional) Etapa 5: Liberar o cluster

Caso não precise mais do cluster, libere-o para evitar cobranças adicionais. Após confirmar a liberação, o sistema executa as seguintes operações:

  1. Encerra forçadamente todos os jobs no cluster.

  2. Encerra e libera todas as instâncias ECS.

O tempo necessário para liberar um cluster depende do seu tamanho. Clusters menores são liberados mais rapidamente. O processo geralmente é concluído em alguns segundos e não ultrapassa 5 minutos.

Importante
  • Clusters com pagamento conforme o uso podem ser liberados a qualquer momento. Clusters por assinatura só podem ser liberados após o vencimento da assinatura.

  • Antes de liberar um cluster, certifique-se de que ele esteja no estado Initializing, Running ou Idle.

  1. Na página EMR on ECS, localize o cluster a ser liberado e escolha more > Release na coluna Actions.

    Alternativamente, clique no nome do cluster. Na aba Basic Information, escolha All operations > Release no canto superior direito.

  2. Na caixa de diálogo exibida, clique em OK.

Documentação relacionada

Perguntas frequentes

Para problemas comuns relacionados ao Alibaba Cloud EMR, consulte FAQ.