Os nós de computação em um cluster E-HPC são instâncias do Elastic Compute Service (ECS). Conforme a carga de trabalho muda, dimensione o cluster adicionando ou removendo nós. Em nós ativos, reinicie-os para recuperar falhas, conecte-se para depuração interativa ou envie comandos em lote para tarefas de operação e manutenção. Também é possível ativar a proteção contra exclusão para evitar remoções acidentais.
A página Nodes do console E-HPC exibe apenas nós de computação. O sistema não exibe nós de gerenciamento nem de logon.
Pré-requisitos
Antes de começar, verifique se você tem:
Um cluster no estado Running
Para criar nós, verifique também se você tem:
Uma fila criada no cluster. Para mais informações, consulte Gerenciar filas
Um vSwitch e um endereço IP disponível na região de destino. Para mais informações, consulte Criar e gerenciar vSwitches
Cotas suficientes de instâncias ECS não utilizadas na região de destino. Para mais informações, consulte Visualizar ou aumentar as cotas de tipos de instância ECS
Criar nós
Adicionar nós manualmente expande o cluster. As aplicações do cluster são implantadas automaticamente nos novos nós durante a inicialização, sem afetar os nós de computação existentes.
Faça login no console E-HPC. Na parte esquerda da barra de navegação superior, selecione uma região. No painel de navegação à esquerda, clique em Cluster.
Na página Cluster List, clique no ID do cluster de destino para acessar a página Cluster Details.
No painel de navegação à esquerda, escolha Nodes and Queues > Nodes.
-
Clique em Add Node e configure os seguintes parâmetros.
Configurações básicas
Parâmetro
Descrição
Destination Queue
Selecione uma fila criada no cluster.
Nodes
Especifique o número de nós a adicionar.
Configurações do nó
Parâmetro
Descrição
Select Node Type
Apenas New Node está disponível.
Inter-node interconnection
Selecione o modo de rede para comunicação entre nós. VPCNetwork: os nós se comunicam por meio de nuvens privadas virtuais (VPCs). eRDMANetwork: os nós se comunicam por meio de redes elastic Remote Direct Memory Access (eRDMA). Este modo requer tipos de instância com suporte a interfaces Elastic RDMA (ERIs). Para mais informações, consulte Visão geral e Configurar eRDMA em uma instância de nível empresarial.
Use Preset Node Pool
Selecione um pool de nós reservado. O sistema atribui endereços IP e nomes de host de nós reservados não atribuídos no pool aos novos nós de computação. O uso de um pool de nós reservado permite reutilizar recursos pré-alocados para acelerar o dimensionamento. Para mais informações, consulte Usar pools de nós reservadas em clusters.
vSwitch
Selecione um vSwitch. O sistema atribui automaticamente um endereço IP do bloco CIDR do vSwitch.
Instance type Group
Clique em Add an instance specification e selecione um tipo de instância. Se o dimensionamento automático da fila estiver desativado, apenas um tipo de instância é permitido. Caso esteja ativado, vários tipos de instância são permitidos.
Hostname Prefix
Especifique o prefixo do nome de host para distinguir nós de diferentes filas.
Hostname Suffix
Especifique o sufixo do nome de host para distinguir nós de diferentes filas.
Instance RAM role
Vincule uma função do Resource Access Management (RAM) para permitir que os nós acessem serviços da Alibaba Cloud. A função padrão AliyunECSInstanceForEHPCRole é recomendada.
Marque a caixa de seleção confirmando que a proteção contra exclusão está ativada por padrão para os nós adicionados e clique em Confirm Add.
Após adicionar os nós, verifique a lista na página Nodes. Nós no estado Running indicam que o cluster foi dimensionado com sucesso.
Reiniciar nós
Reinicie um nó de computação para recuperá-lo de exceções.
Reiniciar um nó interrompe todos os jobs em execução nele. Confirme se não há jobs em execução no nó antes de prosseguir.
Dois modos de reinicialização estão disponíveis:
|
Modo de reinicialização |
Comportamento |
Quando usar |
|
Normal Reboot |
Envia um comando de reinicialização para o nó. O sistema operacional encerra todos os processos e reinicia. |
Opção padrão para a maioria das situações. |
|
Force Reboot |
Desliga o nó diretamente. Pode ocorrer perda de dados. |
Apenas quando uma reinicialização normal falhar. |
Acesse a página Cluster Details e escolha Nodes and Queues > Nodes no painel de navegação à esquerda.
Na lista de nós, selecione um ou mais nós de computação para reiniciar.
Clique em Reboot abaixo da lista de nós.
Na caixa de diálogo, selecione um modo de reinicialização e clique em OK.
Conectar-se a um nó
Conecte-se a um nó de computação usando o Workbench para depuração interativa ou tarefas de operação e manutenção.
Por padrão, uma sessão do Workbench persiste por seis horas. Sem operações por mais de seis horas, a sessão fecha e exige reconexão.
Acesse a página Cluster Details e escolha Nodes and Queues > Nodes no painel de navegação à esquerda.
Na lista de nós, localize o nó de destino e clique em Connect na coluna Operation.
Na caixa de diálogo Connect, clique em Log On na seção Workbench.
Na caixa de diálogo Instance Login, configure os parâmetros de conexão. Para mais informações, consulte Conectar-se a uma instância usando o Workbench.
Enviar comandos para nós
Envie comandos remotos para executar tarefas de manutenção — como instalar software ou rodar scripts de operação e manutenção — sem conexão interativa.
Acesse a página Cluster Details e escolha Nodes and Queues > Nodes no painel de navegação à esquerda.
Na lista de nós, selecione um ou mais nós de computação.
Clique em Send Command abaixo da lista de nós.
Na caixa de diálogo, configure os parâmetros e insira seus comandos. Para detalhes sobre os parâmetros, consulte Enviar comandos remotos.
Clique em Run.
Ativar ou desativar a proteção contra exclusão
A proteção contra exclusão evita a exclusão acidental de um nó. Quando ativada, impede a exclusão até que o recurso seja desativado. Por padrão, a proteção contra exclusão vem ativada para nós adicionados pelo console.
Acesse a página Cluster Details e escolha Nodes and Queues > Nodes no painel de navegação à esquerda.
Na lista de nós, selecione um ou mais nós de computação.
Clique em More abaixo da lista de nós e selecione Enable Deletion Protection ou Disable Deletion Protection.
Na caixa de diálogo de confirmação, clique em OK.
Excluir nós
Exclua nós de computação desnecessários para reduzir o cluster.
O comportamento após a exclusão depende do método de faturamento:
|
Método de faturamento |
Comportamento após a exclusão |
|
Pagamento conforme o uso |
Liberado imediatamente. |
|
Assinatura |
Retido até a solicitação de reembolso ou conversão para pagamento conforme o uso antes do vencimento. Para mais informações, consulte Liberar ou cancelar assinatura de uma instância. |
Não é possível restaurar dados após a liberação do nó. Crie um snapshot para fazer backup dos dados antes de excluir o nó. Para mais informações, consulte Criar um snapshot.
Acesse a página Cluster Details e escolha Nodes and Queues > Nodes no painel de navegação à esquerda.
Na lista de nós, selecione um ou mais nós de computação para excluir.
Clique em Delete abaixo da lista de nós.
Confirme a mensagem e clique em OK.