Todos os produtos
Search
Central de documentação

Elastic High Performance Computing:Criar um cluster Standard Edition

Última atualização: Jun 27, 2026

Um cluster Standard Edition de nuvem pública opera na nuvem e consiste em componentes como instâncias do Elastic Compute Service (ECS) e sistemas de arquivos compartilhados. Você gerencia a disponibilidade dos serviços do cluster. Este tópico descreve como criar um cluster de nuvem pública no console.

Informações básicas

Um cluster E-HPC Standard Edition de nuvem pública inclui os seguintes componentes:

  • Nó do plano de controle: uma instância ECS que executa o agendador e o serviço de conta de domínio para gerenciar o agendamento de jobs e as informações do usuário.

  • Nós de computação: várias instâncias ECS agrupadas em filas para gerenciamento. Esses nós oferecem suporte a dimensionamento e executam jobs.

  • Nó de logon: uma instância ECS com o componente Login implantado e vinculada a um elastic IP address (EIP) para acesso remoto ao cluster.

  • Armazenamento compartilhado: permite montar sistemas de arquivos NAS e CPFS para compartilhar dados, como dados de jobs e software.

Importante
  • Ao criar um cluster E-HPC, o sistema cria automaticamente recursos como instâncias ECS, o que pode gerar custos. Para mais informações, consulte Visão geral do faturamento.

  • Após criar um cluster E-HPC, não ajuste nós individuais do cluster no console do ECS a menos que seja necessário. Utilize o console do E-HPC para essa finalidade.

Para mais informações sobre clusters E-HPC, consulte Visão geral.

Pré-requisitos

  • Crie uma função vinculada ao serviço. Na primeira vez que você fizer logon no console do E-HPC, o sistema solicitará a criação da função vinculada ao serviço E-HPC.

  • Crie uma virtual private cloud (VPC) e vSwitches. Para mais informações, consulte Criar uma VPC e Criar um vSwitch.

  • Ative o serviço NAS e crie um sistema de arquivos NAS e um destino de montagem. Para mais informações, consulte Criar um sistema de arquivos e Adicionar um destino de montagem.

Criação manual

Etapa 1: Abrir a página Create Cluster

Acesse a página Create Cluster.

Etapa 2: Configurar o cluster

Na página Cluster Configuration, configure a rede, o tipo, o agendador e outras definições do cluster.

  • Configurações básicas

    Item de configuração

    Descrição

    Region

    Selecione a região onde o cluster residirá.

    Network and Availability Zone

    Selecione a VPC e o vSwitch para o cluster.

    Nota

    Os nós do cluster consomem endereços IP do vSwitch selecionado. Certifique-se de que o número de endereços IP disponíveis no vSwitch exceda a quantidade necessária de nós.

    Security Group

    Os grupos de segurança controlam o tráfego de entrada e saída do cluster e de seus nós. Grupos de segurança criados automaticamente incluem regras que permitem a comunicação entre os nós do cluster.

    Selecione o tipo de grupo de segurança criado automaticamente conforme necessário. Para diferenças entre grupos de segurança básicos e avançados, consulte Grupos de segurança básicos versus grupos de segurança avançados.

  • Tipo de cluster

    Este tipo de cluster inclui um nó do plano de controle e vários nós de computação. Selecione um tipo de agendador e configure o nó do plano de controle.

    Item de configuração

    Descrição

    Series

    Selecione Standard Edition.

    Deployment Mode

    Selecione Public cloud cluster.

    Cluster Type

    Escolha um tipo de agendador. Os agendadores com suporte para cenários de HPC incluem Slurm, OpenPBS.

    Management node

    O nó do plano de controle é uma instância ECS que executa o agendador e o serviço de conta de domínio. Selecione uma configuração adequada com base no seu cenário de negócios e na escala do cluster.

    • Billing Method

      Defina como pagar pelo nó do plano de controle. Para detalhes de faturamento, consulte Faturamento de instâncias.

      • Pagamento conforme o uso: pós-pago com base na duração real de uso. Não há suporte para instâncias spot.

      • Assinatura: pré-pago faturado pormês ou ano.

    • Instance Specification

      Escolha um tipo apropriado de nó do plano de controle. As configurações recomendadas para diferentes escalas de cluster são:

      • Se o número de nós de computação for ≤ 100, use pelo menos 16 vCPUs e 64 GiB de memória.

      • Se 100 < número de nós de computação ≤ 500, use pelo menos 32 vCPUs e 128 GiB de memória.

      • Se o número de nós de computação for > 500, use pelo menos 64 vCPUs e 256 GiB de memória.

    • Image

      Após selecionar um tipo de imagem, escolha uma imagem específica. Imagens diferentes correspondem a sistemas operacionais diferentes. O sistema implanta os nós do cluster com base na imagem selecionada.

      Nota

      Imagens personalizadas possuem as seguintes limitações:

      • Há suporte apenas para imagens personalizadas criadas a partir de imagens oficiais da Alibaba Cloud ou imagens CentOS importadas. Ao importar uma imagem, selecione Run validation after import. Caso contrário, o console do E-HPC não conseguirá reconhecer a imagem.

      • Não utilize imagens personalizadas criadas a partir de nós existentes de clusters E-HPC. Isso causa erros ao criar nós de computação.

      • Não modifique a configuração do repositório yum na imagem personalizada. Essa ação impede a criação ou o dimensionamento do cluster.

      • Os caminhos de montagem para sistemas de arquivos NAS (montados usando o comando mount) em imagens personalizadas não devem incluir os diretórios /home ou /opt.

    • Storage

      Selecione o tipo de disco do sistema para o nó do plano de controle e se deseja anexar um disco de dados. Para informações sobre tipos e desempenho de discos, consulte Visão geral de discos.

    • Hyper-Threading

      O hyper-threading da CPU está ativado por padrão. Desative-o se sua carga de trabalho exigir melhor desempenho.

    Nota

    Após a criação do cluster, o nó do plano de controle se vincula automaticamente à função RAM da instância AliyunECSInstanceForEHPCRole. Essa função habilita recursos essenciais, como o dimensionamento automático. Não desvincule ou substitua essa função no console do ECS. Para estender as permissões de chamada de API, consulte Função de serviço do E-HPC.

  • Opções personalizadas

    Item de configuração

    Descrição

    Scheduler

    Selecione o software de agendamento a ser implantado com base no tipo de cluster e na imagem configurada para o nó do plano de controle.

    Domain Account

    Escolha o serviço de conta de domínio a ser implantado para o cluster.

    Domain name resolution

    Mantenha a configuração padrão.

    Specify a cluster post-processing script

    Especifique um script para processar dados de resultados ou executar outras operações após a conclusão das tarefas de computação.

    Maximum number of cluster nodes

    Defina o número máximo de nós permitidos no cluster. Este parâmetro funciona em conjunto com o máximo de núcleos para controlar o tamanho do cluster.

    Maximum number of cores in the cluster

    Defina o número máximo de núcleos permitidos no cluster. Este parâmetro funciona em conjunto com o máximo de nós para controlar o tamanho do cluster.

    Cluster Deletion Protection

    Ative ou desative a proteção contra exclusão. Se ativada, você deve desativar esse recurso antes de liberar o cluster para evitar exclusões acidentais.

  • Grupo de recursos

    Grupos de recursos ajudam a organizar recursos. Para mais informações, consulte Grupos de recursos. Por padrão, os clusters pertencem ao grupo de recursos padrão. Altere essa configuração conforme necessário.

Etapa 3: Configurar nós de computação e filas

Na página Compute Node and Queue, configure as filas.

As filas agrupam nós de computação para gerenciamento. É possível especificar uma fila ao executar jobs. O cluster inclui uma fila padrão (comp). Clique em Add more queues para adicionar mais filas. Configure os seguintes itens para cada fila:

  • Configurações básicas

    Item de configuração

    Descrição

    Automatic queue scaling

    Ative ou desative o Auto Scale. Se ativado, você poderá habilitar adicionalmente o Auto Grow e o Auto Shrink conforme necessário.

    Com o dimensionamento automático ativado, o sistema adiciona ou remove nós de computação automaticamente com base na configuração e na carga em tempo real.

    Queue Compute Nodes

    Defina o número de nós na fila.

    • Se o dimensionamento automático estiver desativado, defina o número inicial de nós de computação.

    • Se o dimensionamento automático estiver ativado, defina o número mínimo e máximo de nós.

      Importante

      Se você definir a contagem mínima de nós como um valor diferente de zero, a fila manterá esse número de nós durante a redução de escala — mesmo os nós ociosos permanecerão. Defina esse valor com cuidado para evitar desperdício desnecessário de recursos e custos.

  • Selecionar configuração de nó da fila

    Se o dimensionamento automático estiver ativado ou se a contagem inicial de nós for maior que zero, configure os itens a seguir para que o sistema possa criar nós de computação.

    Item de configuração

    Descrição

    Inter-node interconnection

    Selecione o método de conectividade de rede entre os nós.

    Use Preset Node Pool

    Selecione um pool de nós predefinido. O sistema atribui automaticamente endereços IP e nomes de host de nós não alocados no pool para criar nós de computação.

    Nota

    O uso de um pool de nós predefinido permite a reutilização rápida de recursos pré-alocados durante o aumento de escala. Para mais informações, consulte Usar pools de nós predefinidos em clusters.

    vSwitch

    Selecione o vSwitch para os nós. O sistema atribui automaticamente endereços IP do bloco CIDR disponível do vSwitch.

    Instance type Group

    Clique em Add an instance specification para selecionar as especificações dos nós.

    Se o dimensionamento automático estiver desativado, você poderá adicionar apenas um tipo de instância. Se estiver ativado, será possível adicionar vários tipos de instância.

    Importante

    É possível selecionar vários vSwitches e tipos de instância como alternativas para evitar falhas de criação devido à falta de estoque. Durante a criação de nós, o sistema tenta criá-los começando pela zona do primeiro vSwitch e seguindo a ordem dos tipos de instância especificados até atingir a contagem necessária de nós. Os tipos de instância finais podem variar conforme a disponibilidade de estoque.

  • Dimensionamento automático

    Item de configuração

    Descrição

    Scaling Policy

    Selecione uma estratégia de dimensionamento. Apenas a Supply Priority Strategy tem suporte, a qual tenta criar nós de computação na ordem dos vSwitches e zonas configurados.

    Maximum number of single expansion nodes

    Defina o número máximo de nós adicionados ou removidos em cada ciclo de aumento ou redução de escala. O valor padrão é 0, o que significa sem limite.

    Se houver restrições de custo, defina esse valor para garantir que o aumento de escala permaneça dentro dos limites esperados.

    Hostname Prefix

    Especifique os caracteres iniciais para os nomes de host dos nós para distingui-los.

    Hostname Suffix

    Especifique os caracteres finais para os nomes de host dos nós para distingui-los.

    Host RAM role

    Vincule uma função RAM aos nós para que eles possam acessar os serviços da Alibaba Cloud.

    Recomendamos usar a função padrão AliyunECSInstanceForEHPCRole criada pelo sistema.

Etapa 4: Configurar armazenamento de arquivos compartilhado

Na página Shared File Storage, configure o armazenamento.

Por padrão, o nó do plano de controle monta sistemas de arquivos em /home e /opt como diretórios de armazenamento compartilhado. Para montar sistemas de arquivos em outros diretórios, clique em Add more storage e configure conforme necessário. Para cada diretório, configure as seguintes informações do sistema de arquivos:

Nota

Os diretórios /home e /opt não oferecem suporte à montagem de diretórios de sistemas de arquivos diferentes.

Item de configuração

Descrição

Type

Selecione o tipo de sistema de arquivos a ser montado.

  • General-purpose NAS: monte um sistema de arquivos NAS de uso geral.

  • Extreme: monte um sistema de arquivos NAS Extreme.

  • Parallel file CPFS: monte um sistema de arquivos CPFS usando o protocolo NFS.

File System

Selecione o ID do sistema de arquivos e o destino de montagem. Certifique-se de que o sistema de arquivos tenha capacidade disponível no destino de montagem.

File System Directory

Insira o diretório do sistema de arquivos a ser montado.

Mount Options

Selecione o protocolo de montagem.

Etapa 5: Configurar componentes de software e serviço

Na página Software and Service Component, configure o software e os componentes.

  • Clique em Add software e selecione o software a ser instalado na caixa de diálogo. O E-HPC fornece softwares de HPC comuns. Selecione conforme necessário.

  • Clique em Add Service Component e selecione um componente na caixa de diálogo. Em seguida, configure os parâmetros do componente.

    Nota

    Atualmente, apenas o componente Login tem suporte.

    Clusters de nuvem pública incluem o componente Login por padrão para acesso remoto via rede pública. Os parâmetros do componente são os seguintes:

    Configuração

    Item de configuração

    Descrição

    Parâmetros personalizados do componente Login

    SSH

    Defina a porta, o protocolo e o bloco CIDR de IP permitido para conexões SSH ao cluster.

    VNC

    Defina a porta, o protocolo e o bloco CIDR de IP permitido para conexões VNC ao cluster.

    CLIENT

    Defina a porta, o protocolo e o bloco CIDR de IP permitido para conexões de cliente ao cluster.

    Recursos de implantação de componentes

    EIP instance

    Vincule um EIP à instância ECS que executa o componente Login para acesso à rede pública. Você pode criar um EIP automaticamente ou selecionar um existente.

    ECS instance

    Defina o tipo de instância para a instância ECS que executa o componente Login.

    Nota

    Após a criação, o nó de logon se vincula automaticamente à função RAM da instância AliyunECSInstanceForEHPCRole. Essa função garante que recursos como o Web Portal funcionem corretamente. Não desvincule ou substitua essa função no console do ECS. Para estender as permissões de chamada de API, consulte Função de serviço do E-HPC.

Etapa 6: Confirmar configuração

Na página Confirm configuration, revise suas configurações e defina o nome do cluster e as credenciais de logon.

Item de configuração

Descrição

Cluster Name

Insira um nome. Este nome aparece na lista de clusters para facilitar a identificação.

Cluster Password-free

Permite que usuários root alternem do nó do plano de controle para os nós de computação sem senha.

Importante

Ativar este recurso configura logon unidirecional sem senha do nó do plano de controle para todos os nós de computação. Não há suporte para logon sem senha dos nós de computação para o nó do plano de controle. Prossiga com cautela.

Login Credentials

Selecione as credenciais para logon no cluster. Apenas Custom Password tem suporte.

Set Password, Confirm Password

Insira uma senha para logon no cluster. Todos os nós do cluster usam essa senha como senha de logon do usuário root por padrão.

Após concluir a configuração, leia o Service Agreement, confirme as informações de faturamento e clique em Create Cluster.

Criar a partir de modelo

O E-HPC oferece suporte à criação rápida e em lote de clusters usando modelos. Os modelos definem parâmetros básicos para a criação do cluster. Você pode usar modelos fornecidos pelo E-HPC ou criar modelos personalizados.

Criar um cluster a partir de um modelo público

  1. Acesse a página Cluster List.

    1. Faça logon no console do E-HPC.

    2. Na parte esquerda da barra de navegação superior, selecione uma região.

    3. No painel de navegação à esquerda, clique em Cluster.

  2. Na página Cluster List, clique em Cluster Templates.

  3. Na caixa de diálogo, selecione um modelo e clique em Create Cluster.

    Os modelos são agrupados da seguinte forma: o grupo General-purpose clusters inclui os modelos SLURM e SLURM Serverless. O grupo Big data clusters inclui o modelo FastMR. O grupo Climate and weather clusters inclui o modelo WRF. Cada cartão de modelo inclui um seletor de versão e um botão Create Cluster.

  4. Revise a configuração e insira informações como o nome do cluster.

    • Em Configuration Summary, a configuração padrão do modelo é exibida. Para modificar as configurações, clique em Edit e atualize os parâmetros relevantes.

    • Em Manage Settings, conclua a configuração conforme solicitado.

  5. Leia o Service Agreement, confirme as informações de faturamento e clique em Create Cluster.

Criar um cluster a partir de um modelo personalizado

  1. Crie um modelo personalizado localmente.

    Este tópico usa este (modelo) como exemplo. Modifique os (parâmetro)s de acordo com suas necessidades reais.

    ### Basic cluster settings
    Region: cn-hangzhou                            # Cluster region. Optional. If omitted, the console auto-fills the region.
    ClusterName: "TestClusterName"                 # Cluster name. Optional. If omitted, the system generates a name such as SLURM-Region-DATESTAMP.
    ClusterDescription: "XXXXX"                    # Cluster description. Optional.
    ClusterCategory: "Standard"                    # Cluster edition. Required. Valid values: ['Standard', 'Serverless', 'SuperComputing'].
    ClusterVpcId: ""                               # Cluster VPC ID. Optional. If omitted, the console auto-selects a valid value for the region.
    ClusterVSwitchId: ""                           # Control plane node vSwitch ID. Optional. If omitted, the console auto-selects a valid value for the VPC.
    IsEnterpriseSecurityGroup: true                # Use advanced security group. Takes effect only if SecurityGroupId is empty. Optional. Default: false (basic security group).
    SecurityGroupId: sg-bp1gje9ip78z7v6zy203       # Security group ID. If empty, the system creates one. Optional. Default: empty (auto-create).
    ClusterCustomConfiguration:                    # Custom post-installation script. Optional.
      Script: oss://                               # OSS URL of the script.
      Args: arg1 arg2                              # Script arguments.
    MaxCount: 1000                                 # Maximum nodes. Optional. Default: 1000.
    MaxCoreCount: 100000                           # Maximum vCPUs. Optional. Default: 100000.
    DeletionProtection: true                       # Deletion protection. Optional. Default: true (enabled).
    ResourceGroupId: rg-acfm2xumdifd3ri            # Resource group ID. Optional. If omitted, the console auto-selects a valid value for the account.
    Tags:                                          # Cluster tags. Optional.
      - Key: String
        Value: String
    ### Cluster control services
    Manager:                                     # Control plane node module.
      Scheduler:                                 # Scheduler module.
        Type: "SLURM"                            # Scheduler type. Optional. Default: SLURM.
        Version: "22"                            # Scheduler version. Optional. Default: 22.
      DirectoryService:                          # Account service module.
        Type: "NIS"                              # Account service type. Optional. Default: NIS.
        Version: "x.x.x"                         # Domain account version. Optional.
      DNS:                                       # Domain name resolution module.
        Type: "NIS"                              # DNS service type. Optional. Default: NIS.
        Version: "x.x.x"                         # DNS service version. Optional.
      ManagerNode:                               # Control plane node instance.
        InstanceType: "ecs.c7.xlarge"            # Instance type. Required for non-managed clusters.
        ImageId: "m-xxxxxx"                      # Instance image. Required for non-managed clusters.
        InstanceChargeType: "PostPaid"           # Billing method. Optional. Valid values: PostPaid, Subscription. Default: PostPaid.
        PeriodUnit: "Month"                      # Subscription duration unit. Required only for Subscription billing.
        Period: 1                                # Subscription duration. Required only for Subscription billing.
        AutoRenew: false                         # Auto-renewal. Required only for Subscription billing.
        AutoRenewPeriod: 1                       # Auto-renewal period. Required only for Subscription billing.
        SpotStrategy: "SpotWithPriceGo"          # Spot instance strategy. Ignored for control plane nodes.
        SpotPriceLimit: 0.5                      # Spot price limit. Ignored for control plane nodes.
        Duration: 1                              # Spot instance duration. Ignored for control plane nodes.
        SystemDisk:                              # System disk. Optional.
          Category: "cloud_essd"                 # Disk category. Optional. Default: cloud_essd.
          Size: 40                               # Disk size (GiB). Optional. Default: 40.
          Level: "PL0"                           # Performance level. Optional. Default: PL0.
        DataDisks:                               # Data disks. Optional.
          - Category: "cloud_essd"               # Disk category. Optional. Default: cloud_essd.
            Size: 40                             # Disk size (GiB). Optional. Default: 40.
            Level: "PL0"                         # Performance level. Optional. Default: PL0.
            DeleteWithInstance: false            # Delete disk with instance. Optional. Default: false.
        EnableHT: false                          # Enable hyper-threading. Optional. Default: true.
    ### Compute queues and node configuration      # Optional. Queue configuration.
    Queues:                                      # 
      - Name: workq                              # Queue name. Optional.
        EnableScaleOut: false                     # Enable scale-out. Optional. Default: false.
        EnableScaleIn: false                      # Enable scale-in. Optional. Default: false.
        MinCount: 0                              # Minimum nodes. Optional.
        MaxCount: 500                            # Maximum nodes. Optional.
        InitialCount: 0                          # Initial nodes. Optional.
        InterConnect: erdma                      # Interconnect type. Optional. Valid values: VPC, eRDMA.
        VSwitchIds:                              # vSwitch IDs. Optional.
          - "vsw-xxxxxxx"
          - "vsw-xxxxxxx"        
        ComputeNodes:                            # Compute node configuration. Optional.
          - InstanceType: "ecs.c7.xlarge"            # Instance type. Required for non-managed clusters.
            ImageId: "m-xxxxxx"                      # Instance image. Required for non-managed clusters.
            InstanceChargeType: "PostPaid"           # Billing method. Optional. Valid values: PostPaid, Subscription. Default: PostPaid.
            PeriodUnit: "Month"                      # Subscription duration unit. Required only for Subscription billing.
            Period: 1                                # Subscription duration. Required only for Subscription billing.
            AutoRenew: false                         # Auto-renewal. Required only for Subscription billing.
            AutoRenewPeriod: 1                       # Auto-renewal period. Required only for Subscription billing.
            SpotStrategy: "SpotWithPriceGo"          # Spot instance strategy. Ignored for control plane nodes.
            SpotPriceLimit: 0.5                      # Spot price limit. Ignored for control plane nodes.
            Duration: 1                              # Spot instance duration. Ignored for control plane nodes.
            SystemDisk:                              # System disk. Optional.
              Category: "cloud_essd"                 # Disk category. Optional. Default: cloud_essd.
              Size: 40                               # Disk size (GiB). Optional. Default: 40.
              Level: "PL0"                           # Performance level. Optional. Default: PL0.
            DataDisks:                               # Data disks. Optional.
              - Category: "cloud_essd"               # Disk category. Optional. Default: cloud_essd.
                Size: 40                             # Disk size (GiB). Optional. Default: 40.
                Level: "PL0"                         # Performance level. Optional. Default: PL0.
                DeleteWithInstance: false            # Delete disk with instance. Optional. Default: false.
            EnableHT: false                          # Enable hyper-threading. Optional. Default: true.   
        AllocationStrategy: "PriorityInstanceType"   # Scaling strategy. Optional. Valid values: supply priority, cost priority.
        RamRole: "xxxxxx"                            # RAM role name for nodes. Optional.
        HostNamePrefix: "xxxxx"                        # Hostname prefix. Optional.
        HostNameSuffix: "xxxxx"                        # Hostname suffix. Optional.
        KeepAliveNodes:                                # Exception node list. Optional.
          - compute000
          - compute001
          - compute002
    ### Shared storage
    SharedStorage:
      - MountDirectory: "/home"                    # Mount directory. Optional.
        FileSystemId: "xxxx"                       # File system ID. Optional.
        NASDirectory: "/"                          # File system directory. Optional.
        MountTargetDomain: "xxxxxx"                # Mount target. Optional.
        ProtocolType: "NFS"                        # Protocol. Optional.
        MountOptions: "xxxxx"                      # Mount options. Optional.
    ### Software
    AdditionalPackages:                            # Software list. Optional.
      - Name: "LAMMPS"                             # Software name.
        Version: "xxxx"                            # Software version.
      - Name: "Gromacs"
        Version: "xxx"
    ### Components
    Addons:
      - Name: "LoginNode"                          # Component name.    
        Version: "xxxxxx"                          # Component version.
        ServicesSpec: "JSON String"                # Custom service parameters.
        ResourcesSpec: "JSON String"               # Custom resource parameters.
  2. Acesse a página Cluster List.

    1. Faça logon no console do E-HPC.

    2. Na parte esquerda da barra de navegação superior, selecione uma região.

    3. No painel de navegação à esquerda, clique em Cluster.

  3. Na página Cluster List, clique em Cluster Templates.

  4. Na caixa de diálogo, clique em Import local template e carregue seu arquivo de modelo personalizado.

  5. Na caixa de diálogo Edit Cluster Template, verifique seu modelo personalizado e clique em Confirm and Create.

  6. Na página Create Cluster, verifique a configuração e clique em Create Cluster.

Referências

Após criar um cluster, você precisa criar um usuário para enviar jobs. Para etapas detalhadas, consulte Gerenciamento de usuários e Visão geral de jobs.