Este tópico descreve como usar o console do E-MapReduce (EMR) para criar rapidamente um cluster Data Lake baseado no ecossistema open-source Hadoop e enviar um job clássico de WordCount usando um cliente de cluster. O WordCount é uma tarefa fundamental de computação distribuída no Hadoop que conta a ocorrência de palavras em grandes arquivos de texto. Ele é amplamente utilizado em análise de dados, mineração de dados e outros cenários.
Visão geral
Este guia de início rápido demonstra como:
Criar rapidamente um cluster Data Lake.
Enviar e executar um job WordCount usando um cliente de cluster.
Compreender os principais recursos do Alibaba Cloud EMR e o uso básico do ecossistema Hadoop.
Pré-requisitos
-
Você criou uma conta Alibaba Cloud e concluiu a verificação de nome real.
Conceda as funções padrão do EMR e ECS à conta de serviço do E-MapReduce. Para mais informações, consulte Role authorization.
Precauções
Você é responsável por gerenciar e configurar o ambiente de execução do seu código.
Procedimento
Etapa 1: Criar um cluster
-
Acesse a página Create Cluster.
Faça login no console do EMR on ECS.
-
Na barra de navegação superior, selecione uma região e um grupo de recursos conforme suas necessidades de negócio.
Region: defina a região onde o cluster será criado. Não é possível alterar a região após a criação do cluster.
Resource group: exibe todos os recursos da sua conta por padrão.
No canto superior esquerdo, clique em CREATE_CLUSTER.
-
Na página Create Cluster, configure os parâmetros do cluster.
Seção
Parâmetro
Exemplo
Descrição
Software Configuration
Region
China (Hangzhou)
Localização física das instâncias ECS para os nós do cluster.
ImportanteNão é possível alterar a região após a criação do cluster. Escolha a região com atenção.
Business Scenario
Data Lake
Selecione um cenário para permitir que o EMR configure automaticamente componentes, serviços e recursos padrão. Isso simplifica a configuração do cluster e fornece um ambiente adaptado ao caso de uso especificado.
Product Version
EMR-5.18.1
Selecione a versão mais recente do EMR.
High Service Availability
Disabled
Este recurso vem desativado por padrão. Se você ativar a High Service Availability, o EMR distribui os nós mestres em hardwares subjacentes diferentes para reduzir o risco de falhas.
Optional Services
HADOOP-COMMON, OSS-HDFS, YARN, Hive, Spark3, Tez, Knox e OpenLDAP.
Escolha os serviços conforme suas necessidades de negócio. Por padrão, o EMR inicia os processos de serviço correspondentes à sua seleção.
NotaPara acessar as interfaces web dos serviços pelo console, selecione também os serviços Knox e OpenLDAP.
Collect Service Operational Logs
Enabled
Defina se a coleta de logs deve ser ativada para todos os serviços. Por padrão, esta opção vem ativada para coletar os logs operacionais do seu cluster. Esses logs são utilizados exclusivamente para diagnósticos do cluster.
Após criar o cluster, modifique o parâmetro Collection Status of Service Operational Logs na aba Basic Information.
ImportanteSe você desativar esta opção, a verificação de integridade do cluster EMR e o suporte técnico relacionado aos serviços serão limitados. Para mais informações sobre como desativar a coleta de logs e os impactos dessa ação, consulte How do I stop collecting service logs?
Metadata
Built-in MySQL
Armazena metadados no banco de dados MySQL integrado.
ImportanteO banco de dados MySQL integrado permite configurar rapidamente um ambiente de teste, mas não é recomendado para ambientes de produção. Para produção, utilize uma instância auto-gerenciada do ApsaraDB RDS ou o Data Lake Formation (DLF) para gerenciamento unificado de metadados, conforme suas necessidades de negócio.
Root Storage Directory of Cluster
oss://.cn-hangzhou.oss-dls.aliyuncs.com
Diretório raiz de armazenamento dos dados do cluster. Este parâmetro é obrigatório apenas se você selecionar o serviço OSS-HDFS.
NotaAntes de usar o serviço OSS-HDFS, certifique-se de que ele esteja disponível na região onde deseja criar o cluster. Caso o OSS-HDFS não esteja disponível na região escolhida, altere a região ou utilize o HDFS em vez do OSS-HDFS. Para mais informações sobre as regiões com suporte ao OSS-HDFS, consulte Enable OSS-HDFS and grant access permissions.
É possível selecionar o serviço OSS-HDFS ao criar um cluster DataLake no novo cenário de data lake, um cluster Dataflow, um cluster DataServing ou um cluster personalizado do EMR V5.12.1, EMR V3.46.1 ou versões posteriores.
Hardware Configuration
Billing Method
Pay-as-you-go
Para testes, utilize o método de faturamento Pay-as-you-go. Após validar os testes com sucesso, libere o cluster de teste e crie um novo cluster com o método de faturamento Subscription para produção.
Zone
Zone I
Não é possível alterar a zona após a criação do cluster. Escolha a zona com atenção.
VPC
vpc_Hangzhou/vpc-bp1f4epmkvncimpgs****
Selecione uma VPC na região atual. Se não houver nenhuma VPC disponível, clique em Create VPC para criar uma. Após criar a VPC, clique no ícone Refresh para selecioná-la.
vSwitch
vsw_i/vsw-bp1e2f5fhaplp0g6p****
Selecione um vSwitch na zona especificada da VPC escolhida. Se não houver nenhum vSwitch disponível na zona, crie um.
Default Security Group
sg_seurity/sg-bp1ddw7sm2risw****
ImportanteO EMR não oferece suporte a grupos de segurança corporativos criados no console do ECS.
Selecione um grupo de segurança existente ou crie um novo.
Node Group
Ative a opção Assign Public Network IP para o grupo de nós mestre. Mantenha os valores padrão para os demais parâmetros.
Configure os grupos de nós mestre, core e task conforme suas necessidades de negócio. Para mais informações, consulte Configure hardware and a network.
Basic Configuration
Cluster Name
Emr-Data Lake
Nome do cluster. Deve ter entre 1 e 64 caracteres e pode conter letras, dígitos, hífens (-), sublinhados (_) e caracteres chineses.
Identity Credentials
Password
Permite fazer login remoto no nó mestre do cluster.
NotaCaso prefira autenticação sem senha, selecione Key Pair. Para mais informações, consulte Manage SSH key pairs.
Password e Confirm Password
Uma senha personalizada.
Anote a senha. Ela será necessária para fazer login no cluster.
-
Clique em Confirm.
Na página EMR on ECS, o cluster estará pronto quando seu Status mudar para Running. Para mais informações sobre os parâmetros do cluster, consulte Create a cluster.
Etapa 2: Preparar dados
Após criar o cluster, execute um teste de análise de dados usando o programa de exemplo WordCount pré-instalado. Também é possível enviar e executar suas próprias aplicações de big data. Este tópico utiliza o programa WordCount para demonstrar o processo, desde a preparação dos dados até o envio do job.
Conecte-se ao cluster via SSH. Para mais informações, consulte Log on to a cluster.
-
Prepare o arquivo de dados.
Crie um arquivo de texto chamado
wordcount.txtpara servir como entrada para o job WordCount. O arquivo deve conter o seguinte conteúdo:hello world hello wordcount -
Envie o arquivo de dados.
NotaEnvie o arquivo de dados para o serviço HDFS, OSS ou OSS-HDFS do cluster conforme suas necessidades de negócio. Este tópico usa o serviço OSS-HDFS como exemplo. Para enviar um arquivo para o OSS, consulte Simple upload.
-
Execute o comando abaixo para criar um diretório chamado
input:hadoop fs -mkdir oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/input/ -
Execute o comando a seguir para enviar o arquivo
wordcount.txtdo diretório local atual para o diretórioinputno OSS-HDFS:hadoop fs -put wordcount.txt oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/input/
-
Etapa 3: Enviar um job
Use o programa WordCount para analisar dados textuais e contar a frequência das palavras.
Execute o comando abaixo para enviar o job WordCount:
hadoop jar /opt/apps/HDFS/hadoop-3.2.1-1.2.16-alinux3/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.2.1.jar wordcount -D mapreduce.job.reduces=1 "oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/input/wordcount.txt" "oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/output/"
A tabela a seguir descreve os parâmetros do comando.
|
Parâmetro |
Descrição |
|
|
Pacote de programas de exemplo fornecido com o Hadoop. Inclui diversos exemplos clássicos de MapReduce. Neste caso, |
|
|
Defina o número de reducers para o job MapReduce. Por padrão, o Hadoop determina automaticamente essa quantidade com base no tamanho dos dados de entrada. Se o número de reducers não for especificado, vários arquivos de saída podem ser gerados, como |
|
|
Caminho de entrada para o job WordCount. Corresponde ao caminho do arquivo de dados no OSS. Substitua |
|
|
Caminho de saída onde o job WordCount armazena seus resultados. |
Etapa 4: Visualizar os resultados
Saída do job
Use um comando shell do Hadoop para visualizar a saída do job.
Conecte-se ao cluster via SSH. Para mais informações, consulte Log on to a cluster.
-
Execute o comando abaixo para visualizar a saída do job:
hadoop fs -cat oss://<yourBucketname>.cn-hangzhou.oss-dls.aliyuncs.com/output/part-r-00000A seguinte saída é retornada:
hello 2 wordcount 1 world 1
Histórico de jobs
O YARN é o framework de gerenciamento de recursos do Hadoop responsável por agendar e gerenciar tarefas do cluster. Use a interface do YARN para verificar o status e o histórico dos jobs e revisar detalhes de execução.
Abra a porta 8443. Para mais informações, consulte Manage security groups.
-
Adicione um usuário. Para mais informações, consulte OpenLDAP user management.
Ao acessar a página da interface do YARN, use o nome de usuário e a senha de uma conta Knox.
Na página EMR on ECS, localize seu cluster e clique em Services na coluna Actions.
Clique na aba Access Links and Ports.
-
Na linha YARN UI, clique no link da coluna Public URL.
Autentique-se com suas credenciais de usuário para acessar a página da interface do YARN.
-
Na página All Applications, clique no ID de um job para visualizar seus detalhes.
A parte superior desta página exibe Cluster Metrics (como Apps Submitted, Apps Running e Memory Used) e Cluster Nodes Metrics. A parte inferior lista as aplicações com colunas como ID, Name, Application Type, State e FinalStatus.
(Opcional) Etapa 5: Liberar o cluster
Caso não precise mais do cluster, libere-o para evitar cobranças adicionais. Após confirmar a liberação, o sistema executa as seguintes operações:
Encerra forçadamente todos os jobs no cluster.
Encerra e libera todas as instâncias ECS.
O tempo necessário para liberar um cluster depende do seu tamanho. Clusters menores são liberados mais rapidamente. O processo geralmente é concluído em alguns segundos e não ultrapassa 5 minutos.
Clusters com pagamento conforme o uso podem ser liberados a qualquer momento. Clusters por assinatura só podem ser liberados após o vencimento da assinatura.
Antes de liberar um cluster, certifique-se de que ele esteja no estado Initializing, Running ou Idle.
-
Na página EMR on ECS, localize o cluster a ser liberado e escolha na coluna Actions.
Alternativamente, clique no nome do cluster. Na aba Basic Information, escolha no canto superior direito.
Na caixa de diálogo exibida, clique em OK.
Documentação relacionada
Paths of commonly used files: Encontre os caminhos de instalação de arquivos comuns.
API overview: Use operações de API para gerenciar clusters e serviços.
Perguntas frequentes
Para problemas comuns relacionados ao Alibaba Cloud EMR, consulte FAQ.
> Release