Todos os produtos
Search
Central de documentação

CloudOps Orchestration Service:Reiniciar automaticamente uma instância ECS em caso de alerta de utilização da CPU

Última atualização: Sep 06, 2026

A alta utilização da CPU em uma instância ECS pode degradar o desempenho das aplicações e causar lentidão ou falta de resposta. Para mitigar o impacto nas suas aplicações, reinicie a instância e reduza a utilização da CPU. O CloudOps Orchestration Service (OOS) oferece um recurso acionado por alertas que reinicia automaticamente uma instância ECS ao detectar alta utilização da CPU, eliminando a intervenção manual. Este tópico descreve como configurar esse recurso para reiniciar automaticamente uma instância ECS quando a utilização da CPU ultrapassar um limiar especificado e restaurar rapidamente o desempenho do service.

Pré-requisitos

Crie uma função do RAM para o CloudOps Orchestration Service com permissões para reiniciar instâncias ECS.

  1. Crie uma custom policy que inclua as permissões para reiniciar instâncias (ecs:RebootInstance) e consultar instâncias (ecs:DescribeInstances). Para mais informações, consulte Create a custom policy.

    Permissões necessárias para reinicialização automática

    {
      "Version": "1",
      "Statement": [
        {
          "Action": [
            "ecs:RebootInstance",
            "ecs:DescribeInstances"
          ],
          "Resource": "*",
          "Effect": "Allow"
        }
      ]
    }
  2. Crie uma função de service regular e especifique o CloudOps Orchestration Service como service confiável. Para obter etapas detalhadas sobre como selecionar um service confiável, consulte Create a RAM role for a trusted Alibaba Cloud service.

  3. Anexe a política personalizada à função de service recém-criada para conceder as permissões necessárias à execução das operações. Para obter etapas detalhadas, consulte Manage the permissions of a RAM role.

Procedimento

  1. Faça login no console do CloudOps Orchestration Service. No painel de navegação à esquerda, escolha Automated Task > Alert and Event O&M.

  2. Na página Alert and Event O&M, clique em Create e selecione Threshold Alert.image

  3. Na seção Trigger Rule, configure a regra e selecione as instâncias de destino.image

  4. Selecione um modelo, defina Template Type como Public Template e escolha o modelo ACS-ECS-BulkyRebootInstances.image

  5. Mantenha os valores padrão para RegionId, TargetInstance e RateConsole. Em Permissions, selecione uma função do RAM com permissões para reiniciar instâncias ECS.image

  6. Clique em Create. Na caixa de diálogo de confirmação, clique em Confirm.

Verificar os resultados

Este exemplo utiliza a ferramenta de teste de estresse de código aberto stress-ng para simular um cenário de alta utilização da CPU.

  1. Conecte-se à instância ECS monitorada. Para mais informações, consulte Select a method to connect to an ECS instance.

  2. Instale o stress-ng.

    Alibaba Cloud Linux, CentOS e RHEL

    yum install stress-ng -y

    Ubuntu e Debian

    apt-get install stress-ng -y
  3. Use o stress-ng para executar um teste de estresse de 5 minutos em dois núcleos de CPU com carga de 85%.

    stress-ng --cpu 2 --cpu-load 85 --timeout 5m
  4. Observe a utilização da CPU. Após a reinicialização da instância, a utilização da CPU diminui.image