Consulte os itens de diagnóstico, métricas, escopos e ações recomendadas para o diagnóstico de integridade de instâncias ECS no console e na API.
Tipos de diagnóstico no console ECS
O diagnóstico de integridade da instância oferece suporte aos seguintes tipos de diagnóstico:
Diagnostics of computing service health: verifica os recursos subjacentes e a camada de virtualização do ECS.
Diagnostics of network service health: verifica o status dos componentes de rede e exceções no ambiente de rede externa.
Diagnostics of storage service health: verifica se há exceções nos discos.
Diagnostics of instance configuration management health: verifica se operações impedem a inicialização ou execução da instância.
Diagnostics of security control health: verifica se o tráfego de entrada em portas comuns está permitido nos grupos de segurança.
Diagnostics of billing health: verifica se há pagamentos em atraso na instância e em componentes associados, como EIPs.
Diagnostics of resource quotas health: verifica se o uso de cotas de recursos críticos está próximo do limite superior.
Diagnostics of configurations in the Linux operating system of the instance: verifica arquivos de sistema, processos essenciais, portas comuns e o status do firewall.
Diagnostics of configurations in the Windows operating system of the instance: verifica o status de portas comuns e do firewall.
As exceções nos diagnósticos de computação, rede, armazenamento e gerenciamento de configuração não são em tempo real. Os resultados incluem exceções das últimas 12 horas e podem não exigir ação imediata.
As exceções nos diagnósticos de controle de segurança, faturamento, cota de recursos e configuração do SO são em tempo real. Corrija essas exceções prontamente.
Itens de diagnóstico de integridade do serviço de computação
|
Item de diagnóstico no console ECS |
Descrição |
Escopo do diagnóstico e operação recomendada |
|
Insufficient Resources |
A instância não consegue iniciar devido à insuficiência de recursos de CPU ou memória. |
Verifique se há recursos físicos de CPU ou memória suficientes. Se os recursos forem insuficientes durante a realocação (por exemplo, ao iniciar uma instância parada em modo econômico), a instância não poderá ser iniciada. Aguarde e tente novamente ou crie uma instância em outra zona ou região. |
|
Exceptions in Instance Operating System |
O SO da instância apresenta kernel panic, exceção OOM ou tempo de inatividade interno. |
Verifique se há falhas de kernel panic, OOM ou tempo de inatividade interno no SO da instância. Essas falhas podem resultar de configurações inadequadas da instância ou de programas do usuário. Reinicie a instância para recuperação. |
|
Exceptions on Instance Virtualization |
A instância não responde ou para inesperadamente durante a execução. |
Verifique se há exceções nos serviços principais na camada de virtualização subjacente. Exceções podem fazer com que a instância pare de responder ou pare inesperadamente. Reinicie a instância para recuperação. |
|
Alerts for Instance Host |
Alertas foram acionados no dispositivo físico que hospeda a instância. |
Verifique se há falhas no servidor físico subjacente que hospeda a instância. Falhas no servidor físico podem afetar o estado ou o desempenho da instância. Reinicie a instância para recuperação. |
|
Instance Performance Limited |
A instância burstable está no modo padrão. |
Verifique se a instância burstable tem créditos de CPU suficientes para alto desempenho. Créditos de CPU insuficientes impedem o aumento de desempenho, limitando a instância ao desempenho de linha de base durante horários de pico. |
|
Instance CPU Exceptions |
Ocorreu uma exceção porque as instâncias competem por CPUs ou as CPUs não podem ser vinculadas à instância dedicada. |
Verifique se instâncias compartilhadas competem por CPUs na camada subjacente. A contenção de CPU na camada subjacente pode impedir que a instância dedicada obtenha CPUs. Reinicie a instância para recuperação. |
|
Exceptions on Instance Management System |
Ocorreu uma exceção no sistema de gerenciamento de backend da instância. |
Verifique se o sistema de gerenciamento de backend funciona conforme esperado. Problemas no sistema de gerenciamento podem causar exceções na instância. Reinicie a instância para recuperação. |
|
Instance Performance Temporarily Degraded |
Verifica se o desempenho da instância está temporariamente degradado devido a problemas de software ou hardware subjacentes. |
Verifique se o desempenho da instância está temporariamente degradado devido a problemas de software ou hardware subjacentes. Se estiver degradado, o horário da degradação será exibido. Visualize eventos históricos ou logs do sistema para identificar a causa. Consulte View historical system events e View instance system logs and screenshots. |
Itens de diagnóstico de integridade do serviço de rede
Item de diagnóstico no console ECS | Descrição | Escopo do diagnóstico e operação recomendada |
Packet Loss on Instance Network Link | Pacotes estão sendo perdidos nos dispositivos físicos ou no serviço de rede da instância. | Verifique se há perda de pacotes no link de rede da instância. A perda de pacotes afeta a conectividade ou o throughput da rede, causando falhas de conexão ou acesso lento. Reinicie a instância para recuperação. |
Inconsistent Network Configurations | As configurações de rede da instância são inconsistentes com as do serviço subjacente. | Verifique se as configurações de rede da instância correspondem às do serviço subjacente. Inconsistências afetam o desempenho da rede. Reinicie a instância para recuperação. |
Exceptions on Instance Link Layer | Ocorreu uma exceção na camada de enlace das NICs. | Envie solicitações ARP para as NICs para verificar se a configuração básica de rede está normal. Solicitações com falha indicam que a instância não iniciou normalmente ou que a configuração de rede está anormal. Reinicie a instância para recuperação. |
NIC Loading Exceptions | Ocorreu uma exceção durante o carregamento da NIC. | Verifique se a NIC pode ser carregada. Uma NIC que não pode ser carregada afeta a conectividade da rede. Reinicie a instância para recuperação. |
Packet Loss on NIC | Ocorreu perda de pacotes de entrada ou saída na NIC. | Verifique se há perda de pacotes de entrada ou saída na NIC. A perda de pacotes afeta a conectividade ou o throughput, causando falhas de conexão ou velocidades lentas. Reinicie a instância para recuperação. |
Network Connection Exceptions | Não é possível estabelecer conexões NIC ou o número máximo de conexões foi atingido. | Verifique se é possível estabelecer conexões na NIC. Se não for possível estabelecer conexões ou se o limite máximo for atingido, a conectividade ou o throughput da rede será afetado. Reinicie a instância para recuperação. |
Abnormal DDoS Protection State | Verifica o estado de proteção contra DDoS e se o endereço IP público está sob ataque DDoS. | Verifique se o endereço IP público está sob ataque DDoS. A Alibaba Cloud fornece Anti-DDoS Origin gratuito para limpar tráfego malicioso. Se o tráfego de ataque exceder sua capacidade de proteção, a instância ficará indisponível. Consulte What is a DDoS attack? Adquira serviços anti-DDoS adicionais para obter proteção mais robusta. Consulte How to select an Anti-DDoS product. Para práticas recomendadas de mitigação de DDoS, consulte DDoS attack mitigation solutions. |
Burst Bandwidth Limited | Verifica se a largura de banda burst está limitada. | Verifique a largura de banda burst da instância. Se a largura de banda burst exceder o limite do tipo de instância, o desempenho da rede se tornará um gargalo. Atualize para um tipo de instância com maior largura de banda. Consulte Change the instance type. Nota Para capacidades de largura de banda burst de vários tipos de instância, consulte Instance family overview. |
Network Traffic Throttled | Verifica se a largura de banda total interna e pública atingiu o máximo para o tipo de instância. | Verifique a largura de banda total interna e pública. Se a largura de banda total exceder a linha de base máxima para o tipo de instância, o desempenho da rede se tornará um gargalo. Atualize para um tipo de instância com maior largura de banda. Consulte Change the instance type. Nota Para largura de banda de rede de linha de base de diferentes tipos de instância, consulte Instance family overview. |
Itens de diagnóstico de integridade do serviço de armazenamento
|
Item de diagnóstico no console ECS |
Descrição |
Escopo do diagnóstico e operação recomendada |
|
Ineffective Disk Resizing Operation |
Após redimensionar o disco no console ECS, verifique se outras operações são necessárias. |
Depois de redimensionar o disco no console ECS, verifique se o disco foi realmente redimensionado. Caso contrário, execute comandos para estender partições e sistemas de arquivos. Consulte Step 1: Resize a disk to extend the disk capacity. |
|
Disk I/O Hang |
Um disco está apresentando I/O hang; não é possível ler dados dele nem gravar dados nele. |
Verifique se há I/O hangs no disco do sistema. Alta latência de I/O de leitura/gravação pode causar instabilidade ou falha na instância. Se um disco apresentar I/O hang, verifique suas métricas de desempenho. Consulte View disk monitoring information. Para detecção de I/O hang no Alibaba Cloud Linux 2, consulte Detect I/O hangs of file systems and block layers. |
|
Disk Loading Exceptions |
Ocorreu uma exceção ao criar ou anexar um disco. |
Verifique se é possível anexar um disco durante a inicialização da instância. Se o disco não puder ser anexado, a instância poderá falhar ao iniciar. Pare e reinicie a instância ou anexe o disco novamente. Consulte Attach a data disk. |
|
Disk Read/Write Limited |
A latência de I/O de um disco está alta ou o IOPS do disco atingiu o limite superior. |
Verifique se o disco do sistema tem alta latência de I/O ou atingiu seu IOPS máximo. Se um disco atingir seu IOPS máximo, as operações de leitura/gravação serão limitadas. Consulte View disk monitoring information. Reduza a frequência de I/O do disco ou atualize a categoria do disco para obter maior desempenho. Consulte Block Storage performance. |
|
Disk Resizing Exceptions |
Após o redimensionamento do disco, o SO não consegue ajustar os tamanhos do sistema de arquivos. |
Verifique se o tamanho do sistema de arquivos também foi redimensionado após o redimensionamento do disco do sistema. Se não tiver sido redimensionado, o disco não poderá ser usado. Redimensione-o novamente. Para limites e procedimentos em diferentes sistemas operacionais, consulte Overview. |
Itens de diagnóstico de integridade do gerenciamento de configuração da instância
|
Item de diagnóstico no console ECS |
Descrição |
Escopo do diagnóstico e operação recomendada |
|
Instance Startup Exceptions |
A instância não pode ser iniciada pelo sistema de gerenciamento. |
Verifique se você consegue executar a operação de inicialização na instância. Caso contrário, crie outra instância. |
|
Core Operation Error |
A operação realizada na instância falhou. |
Verifique se as operações recentes na instância foram bem-sucedidas, incluindo início, parada e atualização de configurações. Se as operações falharam, repita-as. |
|
Image Loading Exceptions |
A imagem usada pela instância não pode ser carregada. |
Verifique se a imagem pode ser carregada na inicialização. A imagem pode falhar ao carregar devido a problemas no sistema ou na própria imagem. Reinicie a instância para recuperação. |
Itens de diagnóstico de integridade do controle de segurança
Item de diagnóstico no console ECS | Descrição | Escopo do diagnóstico e operação recomendada |
Status of Common Ports | Para instâncias Windows e Linux, verifica se o tráfego é permitido nas portas 3389 e 22 nos grupos de segurança da instância, respectivamente. | Verifique se o tráfego em portas comuns está permitido nos grupos de segurança. Se o tráfego de portas comuns estiver bloqueado, os serviços podem não ser executados ou a instância pode ficar inacessível. Permita o tráfego de entrada nas seguintes portas:
|
Itens de diagnóstico de integridade do faturamento
|
Item de diagnóstico no console ECS |
Descrição |
Escopo do diagnóstico e operação recomendada |
|
Expiration of Subscription Instance |
Verifica se a instância por assinatura expirou. |
Verifique se sua instância por assinatura expirou. Se sua instância expirar, ela será parada e não poderá ser acessada. Para alterações no estado do recurso após a expiração, consulte Subscription. Para recuperar o serviço, renew the instance. |
|
Check Whether the Pay-as-you-go Instance Is Stopped Due to an Overdue Payment |
Verifica se a instância de pagamento conforme o uso está parada e não pode ser usada devido a pagamentos em atraso. |
Verifique se sua instância de pagamento conforme o uso tem pagamentos em atraso. Em caso afirmativo, a instância será parada e não poderá ser usada. Para alterações no estado do recurso após pagamentos em atraso, consulte Pay-as-you-go. Adicione fundos à sua conta e reative a instância. |
|
Overdue Payments for Instance Components |
Verifica se os discos ou a largura de banda de rede da instância estão indisponíveis devido a pagamentos em atraso em sua conta. |
Verifique se os discos de pagamento conforme o uso anexados à instância por assinatura ou a largura de banda estão indisponíveis devido a pagamentos em atraso em sua conta. Se houver pagamentos em atraso para componentes da instância, o acesso à instância também será afetado. Você deve adicionar fundos à sua conta. |
Itens de diagnóstico de integridade da cota de recursos
Item de diagnóstico no console ECS | Descrição | Escopo do diagnóstico e operação recomendada |
Insufficient Disk Capacity Quota | Sua capacidade de disco está próxima da cota. | Faça login no console ECS para request a quota increase. |
Insufficient Image Quota | O número de imagens em sua conta está próximo da cota. | Para aumentar a cota de imagens, acesse a página General Quotas of Elastic Compute Service e clique em Request na coluna Actions referente a Number of Custom Images. |
Insufficient ENI Quota | O número de Interfaces de Rede Elástica (ENIs) secundárias em sua conta está próximo da cota. | Solicite um aumento de cota no console ECS. Consulte ECS quota management. |
Insufficient NIC Queue Quota | A instância atingiu o número máximo de filas de NIC. |
|
Insufficient Security Group Quota | O número de grupos de segurança em sua conta está próximo da cota. | Para aumentar a cota de grupos de segurança, acesse a página General Quotas of Elastic Compute Service e clique em Request na coluna Actions referente a Maximum Number Of Security Groups. |
Insufficient Security Group Quota for Resource | A ENI está próxima do número máximo de grupos de segurança aos quais pode ser adicionada. | Solicite um aumento de cota no console ECS. Consulte Manage ECS quotas. Ajustar o limite de grupos de segurança aos quais uma instância ECS ou ENI pode ingressar também altera o número máximo de regras por grupo de segurança. Consulte Limits. |
Insufficient Rule Quota for Security Group | O número de regras no grupo de segurança está próximo da cota. | Solicite um aumento de cota no console ECS. Consulte Manage ECS quotas. Ajustar o máximo de regras por grupo de segurança também altera o número de grupos de segurança aos quais uma instância ECS ou ENI pode ingressar. Consulte Limits. |
Itens de diagnóstico de configurações relacionadas ao Linux
|
Item de diagnóstico no console ECS |
Descrição |
Escopo do diagnóstico e operação recomendada |
|
Total CPU Utilization |
A saída do comando |
Verifique a utilização total da CPU da instância. Se a utilização da CPU estiver alta, identifique processos que consomem muitos recursos e verifique se são normais. Consulte Troubleshoot high CPU utilization or load on a Linux instance. |
|
Inodes in Disks |
Verifica se os inodes do disco são suficientes. |
Verifique o uso de inodes dos discos na instância. O alto uso de inodes pode impedir a criação de arquivos. Resize disks conforme necessário. |
|
DHCP Service |
Verifica se existem processos relacionados à rede quando o Dynamic Host Configuration Protocol (DHCP) está configurado. Caso contrário, o endereço IP poderá ser perdido após a expiração da concessão. |
Verifique o processo DHCP da NIC eth0 na instância. Se o processo DHCP não existir, o endereço IP poderá falhar na renovação após a expiração da concessão, causando interrupções na rede. Consulte Configure DHCP on a Linux instance. |
|
Devices in fstab |
Verifica se o arquivo fstab contém configurações de dispositivos inexistentes. |
Verifique o arquivo /etc/fstab na instância. Se o arquivo /etc/fstab contiver configurações para dispositivos inexistentes, a instância poderá falhar ao iniciar. Para remover essas configurações, consulte Troubleshoot boot failures caused by /etc/fstab errors on a Linux instance |
|
Mounting Status of Devices in fstab |
Verifica se os dispositivos no arquivo fstab estão montados corretamente. |
Verifique o arquivo /etc/fstab na instância. Se os dispositivos não estiverem configurados para montagem automática no arquivo /etc/fstab, eles ficarão indisponíveis após uma reinicialização. Execute o comando mount para montá-los manualmente ou configure auto-mount with UUID in /etc/fstab. |
|
fstab File Format |
Verifica se o conteúdo do arquivo fstab está no formato correto. |
Verifique o arquivo /etc/fstab na instância. Formato inválido no /etc/fstab pode impedir que a instância inicie. Consulte Troubleshoot boot failures caused by /etc/fstab errors on a Linux instance |
|
System Firewall Status |
Verifica se o firewall do sistema está ativado. |
Verifique as configurações do firewall. Se o firewall bloquear o acesso externo, as conexões poderão falhar. Consulte Manage system firewall on Linux. |
|
System File Status |
Verifica o status de arquivos críticos do sistema. |
A ferramenta Para verificar e reparar sistemas de arquivos, consulte Check and repair the file systems on a Linux instance. |
|
Limits Configuration |
Verifica se a configuração de limites está correta. |
Verifique o arquivo /etc/security/limits.conf na instância. Se o valor |
|
Memory Configuration |
Verifica se o tamanho de página grande configurado é excessivo. |
Verifique o arquivo etc/sysctl.conf na instância. Se o tamanho total de páginas grandes (número de páginas grandes × tamanho por página) exceder a memória da instância, poderão ocorrer problemas de desempenho. Para ajustar, consulte How to adjust Huge Pages on a Linux instance |
|
Listening Status of Common Ports |
Verifica se portas comuns, como a porta 22 e a porta 3389, estão no estado de escuta. |
Verifique as portas comuns da instância. Se as portas comuns não estiverem em escuta, os aplicativos poderão ficar inacessíveis. Consulte Test TCP and UDP ports. |
|
Processes with CPU Utilization Exceeding 50% |
A saída do comando |
Verifique a utilização da CPU dos processos na instância. Se alguns processos tiverem alta utilização de CPU, verifique se são normais. Consulte Troubleshoot high CPU utilization or load on a Linux instance. |
|
High Single-CPU Utilization |
A saída do comando |
Verifique a utilização de CPU única da instância durante um período de tempo. Se a utilização de CPU única estiver alta, identifique processos que consomem muitos recursos. Consulte Troubleshoot high CPU utilization or load on a Linux instance. |
|
Startup Status of Key System Processes |
Verifica se processos críticos do sistema foram iniciados. |
Verifique os processos críticos do sistema da instância. Se os processos críticos do sistema não estiverem no estado Running, a instância poderá ficar inacessível. |
|
Kernel Parameters in NAT Environment |
Verifica se os parâmetros de kernel no ambiente NAT são válidos. |
Verifique os parâmetros de kernel relacionados ao ambiente NAT na instância. Se os parâmetros de kernel relacionados a NAT estiverem mal configurados, conexões SSH e acesso HTTP poderão falhar. Verifique os valores net.ipv4.tcp_tw_recycle e net.ipv4.tcp_timestamps em /etc/sysctl.conf. Consulte Why am I unable to access an ECS instance or an ApsaraDB RDS instance after I configure NAT for my client? |
|
TCP SACK Configuration |
Verifica se o TCP SACK está ativado. |
Verifique se o TCP SACK está ativado para a instância. O TCP SACK desativado pode afetar o desempenho da rede. Consulte Enable TCP SACK on Linux instances. |
|
Check Whether the Operating System is OOM |
Verifica se ocorreu um problema de OOM no sistema operacional da instância. |
Verifique se ocorreu um problema de OOM no sistema operacional da instância. Em caso afirmativo, verifique se a instância tem memória suficiente para suas cargas de trabalho. Se a memória for insuficiente, atualize a instância. Para analisar e resolver problemas de OOM, consulte Troubleshoot Out of Memory issues in a Linux instance |
|
Critical System File Format |
Verifica os formatos de arquivos críticos do sistema. |
Verifique se os arquivos críticos do sistema na instância estão no formato UNIX. Caso contrário, as conexões poderão falhar. Consulte Repair files in non-Unix formats on a Linux instance. |
|
SELinux Status |
Verifica se o SELinux está ativado. |
Verifique se o SELinux está ativado na instância. Se estiver ativado, conexões SSH poderão falhar. Desative o SELinux temporária ou permanentemente. Consulte SSH connection fails when SELinux is enabled on a Linux instance |
|
Status and Password Settings of Critical System Users |
Verifica se usuários críticos do sistema possuem senhas. Usuários críticos do sistema incluem o usuário root no Linux e o usuário administrador no Windows. |
Verifique se existem usuários críticos para o sistema operacional da instância. Caso contrário, as conexões poderão falhar. Verifique o status e as configurações de senha de usuários críticos em /etc/passwd. Consulte A critical system user does not exist in a Linux instance |
|
SSH Access Permissions |
Verifica se as permissões de acesso SSH estão configuradas corretamente. |
Verifique as permissões de acesso SSH da instância. Permissões de acesso SSH incorretas podem impedir conexões. Consulte A critical system user does not exist in a Linux instance |
|
Critical File Systems for SSH |
Verifica se existem arquivos ou diretórios críticos para acesso SSH. |
Verifique arquivos ou diretórios críticos exigidos pelo SSH. A ausência de arquivos ou diretórios críticos do SSH pode impedir conexões SSH. Consulte Verify required SSH files on a Linux instance. |
|
Whether SSH Allows Root Logon |
Verifica se o SSH permite login como usuário root. |
Verifique se o SSH permite login como usuário root. Se o SSH negar acesso root, o erro Permission denied, please try again será retornado quando você se conectar como root via SSH. Consulte Resolve the "Permission denied, please try again" error for SSH connections to a Linux instance |
|
NIC Multi-queue Status |
Verifica se a multifila de NIC está ativada. |
Verifique se a multifila de NIC está ativada para as NICs da instância. Se a multifila de NIC não estiver ativada, o desempenho da rede poderá ser afetado. Consulte NIC multi-queue. |
Itens de diagnóstico de configurações relacionadas ao Windows
Item de diagnóstico no console ECS | Descrição | Escopo do diagnóstico e operação recomendada |
Versão do sistema operacional Windows | A Microsoft não oferece mais suporte para o Windows Server 2008 e versões anteriores. | Verifique a versão do sistema operacional Windows da instância. O Alibaba Cloud e a Microsoft não suportam mais o Windows 2008 e versões anteriores. Instale uma versão mais recente do Windows Server. Consulte Replace system disk (OS). |
Alta utilização total de CPU | Verifica se a utilização total de CPU da instância Windows excede 85%. | Analise a utilização de CPU da instância. Se a utilização total de CPU estiver alta, identifique os processos que consomem muitos recursos. Consulte Troubleshoot high CPU utilization on Windows instances |
Alta utilização de CPU individual | Verifica se a utilização de um único núcleo de CPU excede 80%. | Analise a utilização de CPU da instância. Caso a utilização de CPU individual esteja elevada, identifique os processos com alto consumo de recursos. Consulte Troubleshoot high CPU utilization on Windows instances |
Alto uso de memória | Verifica se o uso de memória da instância Windows excede 80%. | Confira se o uso de memória ultrapassa 80%. Nesse caso, os cinco processos que mais consomem memória são exibidos. Verifique se eles estão em execução conforme o esperado. Consulte Memory analysis tools for Windows. |
Status de porta de service comum do Windows | Verifica se a porta 3389 está habilitada na instância Windows. | Inspecione a porta 3389 da instância. Se a porta 3389 estiver desabilitada, o acesso RDP falhará. Consulte How do I enable Remote Desktop Services on a Windows ECS instance? |
Status da NIC do Windows | Verifica se as NICs da instância Windows estão habilitadas. | Examine as NICs da instância. Se as NICs estiverem indisponíveis, não será possível conectar-se à instância. Para verificar e reparar as NICs, consulte Check network connectivity. |
Endereços IPv4 das NICs | Verifica se as NICs da instância Windows possuem endereços IPv4 atribuídos. | Confira se as NICs têm endereços IPv4 atribuídos. Caso contrário, os services na instância podem ficar inacessíveis. Verifique se o DHCP está habilitado ou se um endereço IP estático foi atribuído. Para habilitar o DHCP, consulte Instalar e configurar o servidor DHCP. |
Status do proxy de rede | Verifica se há informações de proxy de rede configuradas. | Cheque se existem configurações de proxy de rede. Se um proxy de rede estiver configurado, os services na instância podem ficar inacessíveis. Habilite ou desabilite proxies de rede conforme suas necessidades de negócios. Para desabilitar proxies de rede no Windows, consulte Como redefinir as configurações de proxy do Internet Explorer. |
Status da configuração DHCP | Verifica se o DHCP está habilitado nas NICs da instância Windows. | Analise o status do DHCP nas NICs. Se o DHCP estiver desabilitado nas NICs, os services podem ficar inacessíveis. Modifique as configurações de DHCP conforme suas necessidades de negócios. Para habilitar e configurar o DHCP, consulte Como instalar e configurar um servidor DHCP em um grupo de trabalho. |
Status do driver de disco virtual do Windows | Verifica a versão do driver virtio. | Consulte a versão do driver virtio da instância. Se a versão do driver virtio estiver desatualizada, não será possível redimensionar discos online. Para fazer upgrade, consulte Update the virtio driver for a Windows instance. |
Capacidade do disco | Verifica se a capacidade disponível do disco do sistema C:\\ é inferior a 1 GB. | Avalie a capacidade disponível do disco do sistema C:\\ na instância. Se a capacidade disponível for menor que 1 GB, o sistema pode ficar lento ou falhar ao iniciar. Resize the system disk conforme suas necessidades. |
Status do Firewall do Windows | Verifica se o firewall do Windows está habilitado. | Confira se o firewall está ativo na instância. Em caso afirmativo, os services na instância podem ficar inacessíveis. Para modificar as políticas de firewall, consulte Configure firewall rules for Windows. |
Status da configuração de despejo de memória | Verifica se a coleta de despejo de memória (crash dump) está habilitada na instância. | Cheque se a coleta de despejo de memória está ativada para a instância. Caso contrário, a instância não conseguirá salvar informações de recuperação durante reinicializações inesperadas ou eventos de tela azul. Habilite ou desabilite a coleta de despejo de memória conforme seus requisitos. Consulte Enable or disable kernel crash dump. |
Conta Administrator | Verifica se a conta Administrator existe. | Valide a existência da conta Administrator. Se ela não existir, os services podem ficar inacessíveis. Crie a conta Administrator conforme necessário. Consulte Como adicionar ou remover um administrador usando o Management Console. |
Categorização de métricas de diagnóstico por API
Termos
Métrica de diagnóstico (DiagnosticMetric): unidade que verifica o status de uma instância ou conta, como a utilização de CPU.
Item de diagnóstico (Issue): item associado descoberto durante a verificação de uma métrica de diagnóstico. Os itens são classificados por nível de gravidade como
Info,WarnouCritical. Cada métrica de diagnóstico pode estar associada a vários itens de diagnóstico. Se não houver itens associados, significa que nenhum problema foi encontrado quando o sistema verificou a métrica. No entanto, isso não garante a inexistência de problemas reais relacionados à métrica.-
Conjunto de métricas de diagnóstico (DiagnosticMetricSet): coleção de métricas de diagnóstico que permite diagnosticar todas as métricas de uma só vez.
ImportanteOs resultados do diagnóstico servem apenas como referência. Um resultado normal não implica necessariamente a ausência de problemas nas métricas do sistema relacionadas.
A tabela a seguir descreve os itens de diagnóstico de integridade da instância, classificados por recurso e módulo.
|
Código da categoria |
Nome da categoria |
Descrição |
|
ECSService.ServiceHealth |
Verifica os recursos do servidor físico e a camada de virtualização do ECS. |
|
|
ECSService.InstanceNetwork |
Analisa o status dos componentes de rede em uma instância e exceções no ambiente de rede externa. |
|
|
ECSService.InstanceStorage |
Verifica a existência de exceções nos discos de uma instância. |
|
|
ECSService.InstanceConfigure |
Identifica se alguma operação está impedindo a instância de iniciar ou executar conforme o esperado. |
|
|
ECSService.SecurityGroup |
Confere se o tráfego de entrada em portas comuns é permitido em todos os grupos de segurança associados a uma instância. |
|
|
ECSService.AccountBalance |
Verifica se há pagamentos atrasados referentes à instância e seus componentes associados, como endereço IP público e tráfego de EIP. |
|
|
ECSService.GuestOS |
Inspeciona os arquivos do sistema, processos principais e o status de uso de portas comuns e firewalls no sistema operacional da instância. |
|
|
ECSService.GuestOS |
Diagnostics of configurations in the Windows operating system |
Avalia o status de uso de portas comuns e firewalls no sistema operacional da instância. |
|
ECSService.ActionTrace |
Audita e rastreia operações relacionadas ao faturamento da instância, operações de grupos de segurança e operações de estado da instância. |
As exceções detectadas durante diagnósticos de integridade do service de computação, integridade do service de rede, integridade do service de armazenamento e gerenciamento de configuração de instâncias não são em tempo real. Os resultados incluem exceções ocorridas nas últimas 12 horas para visualização de problemas históricos e podem não exigir resolução imediata.
Já as exceções detectadas durante diagnósticos de integridade do controle de segurança, faturamento, cotas de recursos e configurações nos sistemas operacionais das instâncias são em tempo real. Essas exceções existem no momento do diagnóstico, e recomendamos que você as resolva imediatamente.
Itens de diagnóstico de integridade do service de computação
ID da métrica de diagnóstico | Descrição da métrica de diagnóstico | ID do item de resultado do diagnóstico | Descrição do item da métrica de diagnóstico | Operação recomendada |
Instance.ControllerError | Verifica se o sistema de gerenciamento de back-end da instância está funcionando conforme o esperado. | Instance.ECSService.MngServiceException | O sistema de gerenciamento de back-end não está funcionando conforme o esperado, o que pode causar comportamento anormal na instância. | |
Instance.CPUException | Verifica se instâncias compartilhadas estão competindo por CPUs na camada subjacente. | Instance.ECSService.CPUBindFailure | Existe contenção de CPU, o que pode impedir a instância de obter recursos de CPU ou causar outras exceções. | |
Instance.CPUSplitLock | Verifica a ocorrência de um problema de Split Lock em CPU Intel. | Instance.ECSService.CPUSplitLock | A instância apresenta um problema de Split Lock em CPU Intel. | Verifique se sua aplicação na instância ECS contém código anormal que cause esse problema e otimize o código. |
Instance.GuestOSCrash | Verifica se o sistema operacional da instância sofreu uma falha crítica (crash). | Instance.ECSService.GuestOSCrashed | O sistema operacional sofreu uma falha crítica. | Analise se a aplicação na instância ECS possui código defeituoso causador dessa falha e otimize-o. |
Instance.HostDownAlert | Verifica se há falhas no servidor físico subjacente que hospeda a instância. | Instance.ECSService.HostDown | Existem falhas no servidor físico subjacente. O status ou desempenho da instância pode ser afetado. | |
Instance.PerformanceAffected | Verifica se o desempenho da instância está temporariamente degradado devido a problemas de software ou hardware subjacentes. | Instance.ECSService.PerformanceAffected | O desempenho da instância está degradado. Consulte historical system events ou system logs and screenshots para identificar a causa. | |
Instance.PerfRestrict | Verifica se os créditos de CPU da instância com capacidade de burst são suficientes para manter alto desempenho. | Instance.ECSService.BurstPerformanceRestricted | Se os créditos de CPU forem insuficientes, a instância com capacidade de burst fornecerá apenas o desempenho básico durante picos de carga, sem conseguir aumentar seu desempenho além desse limite. | Caso a instância não atenda aos seus requisitos, faça upgrade do tipo de instância. Consulte Upgrade the instance types of subscription instances ou Change pay-as-you-go instance type. |
Instance.ResourceNotEnough | Verifica se os recursos físicos necessários de CPU ou memória são suficientes. | Instance.ECSService.ResourceOutOfStock | Se os recursos físicos forem insuficientes quando o sistema tentar realocar recursos para a instância (por exemplo, ao iniciar uma instância parada em modo econômico), a instância não poderá ser iniciada. | Aguarde alguns minutos e tente novamente, ou crie outra instância em uma zona ou região diferente. |
Instance.SystemException | Verifica se existem falhas como kernel panic, exceção OOM ou tempo de inatividade interno no sistema operacional da instância. | Instance.ECSService.GuestOSException | Exceções internas do SO podem resultar de configurações inadequadas da instância ou de programas mal configurados no espaço do usuário. | |
Instance.VirtException | Verifica se há exceções nos services principais da camada de virtualização subjacente da instância. | Instance.ECSService.VirtualizationException | Essa exceção pode fazer com que a instância pare de responder ou seja interrompida inesperadamente. | |
Instance.RecentUtilHigh | Verifica se a carga histórica excede 80%. | Instance.UtilizationHigh.IntranetBandwidth | Durante o período de diagnóstico selecionado, a utilização de largura de banda interna da instância excedeu 80%. A alta utilização indica que sua instância transfere um grande volume de tráfego de rede interna. | O Alibaba Cloud não consegue determinar informações específicas sobre processos. Faça uma análise mais detalhada com base no seu negócio. Para obter informações de monitoramento detalhadas, faça login no console CloudMonitor. |
Instance.UtilizationHigh.DiskIOPS | No período de diagnóstico escolhido, a utilização de IOPS da instância atingiu 80%. Esse patamar elevado sinaliza que a instância realiza operações frequentes de leitura e gravação de E/S. | O Alibaba Cloud não identifica os processos específicos envolvidos. Realize uma investigação complementar baseada na sua carga de trabalho. Acesse o console CloudMonitor para dados completos de monitoramento. | ||
Instance.UtilizationHigh.DiskBPS | No intervalo de diagnóstico definido, a utilização de BPS da instância alcançou 80%. Valores altos demonstram transferência intensa de dados pela instância. | Não é possível determinar quais processos geraram essa carga através do Alibaba Cloud. Recomenda-se analisar o comportamento conforme o contexto da aplicação. Consulte o console CloudMonitor para métricas detalhadas. | ||
Instance.UtilizationHigh.CPU | Ao longo do período analisado, a utilização de CPU da instância chegou a 80%, indicando execução de tarefas computacionais intensivas. | Para visualizar métricas completas, acesse o console CloudMonitor. | ||
Instance.KMSInvalid | Verifica se a chave KMS funciona corretamente. | Instance.KMSInvalid.SecretInvalid | A instância atual utiliza o service de chaves fornecido pelo Key Management Service (KMS) para criptografar o disco do sistema ou discos de dados, mas falhou ao iniciar porque a chave é inválida. | Faça login no console KMS para verificar o status da chave usada nos discos da instância. Se houver pagamentos pendentes na instância, renove sua assinatura e reinicie-a. Caso a instância esteja operando normalmente, ignore este alerta. |
Itens de diagnóstico de integridade do service de rede
ID da métrica | Descrição da métrica | ID do item de resultado | Descrição do resultado | Operação recomendada |
Instance.ArpPingError | Envia solicitações ARP para as NICs a fim de verificar se as configurações básicas de rede da instância funcionam adequadamente. | Instance.ECSService.ARPPingIssue | Ocorreu uma exceção na camada de enlace das NICs da instância. | Se as solicitações falharem, a instância não iniciará conforme o esperado ou a configuração de rede estará anormal. Restart the instance. |
Instance.DDoSStatus | Verifica se o endereço IP público da instância está sofrendo ataques DDoS. | Instance.Security.SufferDDoSAttacks | Os seguintes dados de exemplo são retornados nas informações adicionais do item: Atributos no resultado retornado:
| O service gratuito Anti-DDoS Origin faz a limpeza do tráfego malicioso. Se o tráfego exceder a capacidade de proteção da sua instância, ela ficará indisponível. Consulte What is a DDoS attack? Adquira services adicionais anti-DDoS para proteger sua instância. Consulte Comparison of Alibaba Cloud Anti-DDoS solutions. Consulte DDoS attack mitigation solutions. |
Instance.NetworkBoundLimit | Verifica a largura de banda total interna e pública da instância. | Instance.Network.IOLimit | A largura de banda total excede a linha de base máxima suportada pelo tipo de instância, tornando o desempenho da rede um gargalo para o seu negócio. | Upgrade to an instance type com maior largura de banda. |
Instance.NetworkBurstLimit | Verifica se a largura de banda de burst da instância atingiu o limite superior. | Instance.Network.BurstBoundLimit | A largura de banda de burst excede o limite máximo permitido para o tipo de instância, fazendo com que o desempenho da rede se torne um gargalo para o seu negócio. | Upgrade to an instance type com maior largura de banda. |
Instance.NetworkLoadFailure | Verifica se a NIC da instância pode ser carregada. | Instance.Network.ENILoadFailure | Se a NIC não puder ser carregada, a conectividade de rede da instância será afetada. Por exemplo, você não conseguirá se conectar à instância. | |
Instance.NetworkSessionError | Verifica se é possível estabelecer conexões na NIC da instância. | Instance.Network.SessionException | Se não for possível estabelecer conexões na NIC ou se o número máximo de conexões for atingido, a conectividade ou throughput da rede da instância será afetado. Por exemplo, você pode não conseguir se conectar à instância ou a velocidade da rede pode ficar lenta. | |
Instance.PacketDrop | Verifica se houve perda de pacotes de entrada ou saída na NIC. | Instance.Network.PacketDrop | Se houver perda de pacotes, a conectividade ou throughput da rede da instância será afetado. Isso pode impedir a conexão com a instância ou reduzir a velocidade da rede. | |
Instance.NetworkConfigConsistency | Verifica se as métricas de rede da instância estão normais. | Instance.NetworkConfig.Inconsistent | A configuração de rede efetiva da instância é inconsistente com a configuração do service subjacente, o que pode afetar o desempenho da rede. |
|
Instance.NetworkLinkException | Verifica se há perda de pacotes nos enlaces internos da instância. | Instance.Network.LinkException | A instância apresentou perda de pacotes nos enlaces de rede subjacentes durante o período de detecção, o que pode afetar seu desempenho. |
|
Itens de diagnóstico de integridade do service de armazenamento
ID da métrica | Descrição da métrica | ID do item de resultado | Descrição do resultado | Operação recomendada |
Instance.DiskLimit | Verifica se o disco do sistema da instância apresenta latência de I/O de leitura e gravação e se os IOPS de leitura e gravação excedem o limite superior do disco. | Instance.Disk.IOLimit | Os IOPS do disco excederam o limite superior e as operações de leitura/gravação estão restritas. Consulte View disk monitoring information. | Para evitar isso, reduza a frequência de I/O do disco ou faça upgrade para uma categoria de disco de maior desempenho. Consulte Block Storage performance. |
Instance.DiskLoadFailure | Verifica se é possível anexar um disco à instância durante a inicialização. | Instance.Disk.EBSLoadFailure | Não foi possível anexar o disco à instância. A instância não pode ser iniciada. | Pare e reinicie a instância, ou re-attach the disk para recuperação. |
Instance.IOHang | Verifica se ocorreu um travamento de I/O no disco do sistema da instância, como quando os sistemas de arquivos do disco apresentam alta latência de I/O de leitura e gravação, causando instabilidade ou falha na instância. | Instance.Disk.IOHang | O disco do sistema sofreu um travamento de I/O e não é possível ler ou gravar dados no disco. | Verifique as métricas de desempenho do disco. Consulte View disk monitoring information. Para instâncias Alibaba Cloud Linux 2, consulte Detect I/O hangs of file systems and block layers. |
Instance.ResizeFsFailure | Verifica se os sistemas de arquivos no disco do sistema também foram estendidos após o redimensionamento do disco. | Instance.Disk.ResizeFailure | Os sistemas de arquivos não foram estendidos e o disco recém-redimensionado não pode ser utilizado. | Redimensione o disco novamente. Consulte Overview. |
Instance.DiskFull | Verifica se o uso do disco atingiu 100% durante um período de tempo. | Instance.Disk.Full | O uso do disco da instância atingiu 100% em um período específico, o que pode causar exceções na instância. | Escolha uma das soluções abaixo conforme sua necessidade para garantir o funcionamento adequado do sistema:
|
Itens de diagnóstico de gerenciamento de configuração da instância
ID da métrica | Descrição da métrica | ID do item de resultado | Descrição do resultado | Operação recomendada |
Instance.BootFailure | Verifica se é possível executar a operação de inicialização na instância. | Instance.ECSService.BootIssue | A instância não consegue iniciar. | |
Instance.ImageLoadFailure | Verifica se a imagem utilizada pela instância pode ser carregada na inicialização. | Instance.ECSService.ImageIssue | O carregamento da imagem pode falhar devido a problemas no sistema ou na própria imagem. | |
Instance.OperationFailure | Verifica se as operações realizadas na instância foram bem-sucedidas. Essas operações incluem iniciar e parar a instância, além de fazer upgrade das configurações. | Instance.ECSService.OperationError | Uma operação falhou. | Tente novamente. |
Instance.BootScreenshot | Verifica se a falha de inicialização do sistema operacional foi causada por problemas no próprio sistema. | Instance.BootScreenshot.Exception | O sistema operacional da instância não consegue iniciar devido a problemas, como configurações anormais ou desligamento incorreto. | Faça logon na instância usando VNC. |
Itens de diagnóstico de integridade de segurança
ID da métrica | Descrição da métrica | ID do item de resultado | Descrição do resultado | Operação recomendada |
Instance.SGIngress | Verifica se as regras do grupo de segurança da NIC da instância permitem tráfego de entrada nas portas comuns. | Instance.Network.SSHPortRuleDeny | A porta de entrada SSH 22 não está permitida. | Para acessar a instância via SSH, add a security group rule para permitir o tráfego de entrada SSH. |
Instance.SgRule.PingPortDeny | Não é possível executar ping na instância. | Para executar ping na instância, add a security group rule para permitir o tráfego ICMP. | ||
Instance.SgRule.WinRemotePortDeny | Não é possível conectar-se à instância via RDP. | Para acessar a instância usando a Área de Trabalho Remota, add a security group rule para permitir o tráfego de entrada RDP. | ||
Instance.SecurityRisk | Verifica se existem riscos de segurança na instância. | Instance.Security.Risk | A instância apresenta riscos de segurança que podem causar exceções. | Para visualizar os riscos de segurança, faça logon no Security Center. |
Itens e resultados de diagnóstico de faturamento
ID da métrica | Descrição da métrica | ID do item de resultado | Descrição do resultado | Operação recomendada |
Instance.ExpenseException | Verifica se o status de faturamento da instância ECS está anormal. | Account.Balance.ExpenseException | Alguns recursos da instância apresentam exceções no status de faturamento (incluindo expiração de assinatura ou pagamento atrasado da conta), o que impede conexões ou o uso normal da instância. Os recursos com exceções de faturamento estão listados abaixo. Renove a instância ou adicione fundos à sua conta e, em seguida, reinicie e faça logon na instância.
Exemplo: Exemplo: Atributos no resultado retornado:
| Consulte Billing overview. |
Itens de diagnóstico e resultados das configurações do sistema operacional Linux
ID da métrica | Descrição da métrica | ID do item de resultado | Descrição do resultado | Operação recomendada |
GuestOS.CPUUtil | Verifica se a utilização da CPU está muito alta. | GuestOS.CPU.HighUtilization | A utilização total da CPU da instância excede 80%. Confira os 5 processos com maior utilização de CPU abaixo. Atributos no resultado retornado:
| Para consultar a utilização da CPU, consulte Troubleshoot high CPU utilization or load on a Linux instance. |
GuestOS.CoreCPU.HighUtilization | Uma ou mais CPUs da instância apresentam utilização superior a 85%. Verifique os seguintes processos cuja utilização de CPU excede 85%. Atributos no resultado retornado:
| Para consultar o uso de recursos de CPU, consulte Troubleshoot high CPU utilization or load on a Linux instance. | ||
GuestOS.MemUtil | Verifica se o uso de memória da instância está muito alto. | GuestOS.Memory.HighUtilization | A utilização total de memória da instância excede 80%. Exemplo dos cinco processos com maior uso de memória: Atributos no resultado retornado:
| Desative serviços ou processos desnecessários conforme necessário. Se isso for causado por suas operações comerciais normais, recomendamos atualizar a configuração do seu ECS. Para consultar o uso de memória, consulte Troubleshoot high memory usage on a Linux instance |
GuestOS.DiskUtil | Verifica se o uso do disco do sistema está muito alto. | GuestOS.SystemDisk.InsufficientSpace | O uso de espaço em disco ou de inodes de alguns sistemas de arquivos nos discos da instância excede 80%. Isso pode impedir a criação de novos arquivos nessas partições. Exemplo de discos com alto uso de inodes: Atributos no resultado retornado:
| Redimensione o disco conforme necessário. Consulte Overview. Para resolver problemas de capacidade de inodes, consulte Resolve "no space left" issues on Linux. |
GuestOS.SystemConfig | Verifica se as configurações críticas do sistema estão corretas. | GuestOS.AuditConfig.AutoShutdown | O arquivo de configuração do service Audit da instância possui parâmetros de alto risco. Quando o sistema de arquivos que armazena logs do service Audit fica sem espaço, o sistema operacional é desligado automaticamente. Após a reinicialização, o sistema operacional pode ser desligado repetidamente porque os logs do service Audit são gerados continuamente. Atributos no resultado retornado:
| Modifique os itens de configuração no service Audit conforme necessário. Consulte How do I modify the auditd service configuration to prevent automatic shutdown due to insufficient disk space? |
GuestOS.LimitsFile.UnreasonableConfig | Algumas configurações no arquivo de sistema Exemplos de parâmetros anormais: Atributos no resultado retornado:
| Modifique as configurações do | ||
GuestOS.EnormousPageSize.UnreasonableConfig | O número de huge pages no arquivo de sistema Atributos no resultado retornado:
| Altere o número de huge pages conforme necessário. Consulte How to adjust Huge Pages on a Linux instance | ||
GuestOS.SELinuxService.Enabled | O service SELinux está ativado na instância, o que pode impedir conexões SSH à instância. | Desative o SELinux temporária ou permanentemente. Consulte SSH connection fails when SELinux is enabled on a Linux instance | ||
GuestOS.NvmeIOTimeout.UnreasonableConfig | Um período curto de timeout de leitura/gravação de I/O está configurado para discos Non-Volatile Memory Express (NVMe) no arquivo de sistema da instância. Isso pode fazer com que os discos NVMe se tornem somente leitura após um timeout de I/O, resultando em falhas de gravação de dados. Atributos no resultado retornado:
| Altere o valor para 4294967295 conforme necessário. Consulte What do I do if a NVMe disk on a Linux ECS instance is unavailable due to an invalid I/O timeout parameter? | ||
GuestOS.SysctlUnknownNmiPanic.Enabled | A configuração de interrupção não mascarável no kernel da instância é inadequada. Isso pode causar kernel panic inesperado e reinicialização da instância quando ela encontra uma interrupção não mascarável. Atributos no resultado retornado:
| Altere o valor para 0 conforme necessário. Consulte Why does kernel.unknown_nmi_panic cause abnormal restarts of a Linux instance? | ||
GuestOS.NetworkInterfaceMultiQueue.Disabled | O recurso multi-queue está desativado para uma ou mais NICs na instância, o que pode afetar o desempenho da rede. Atributos no resultado retornado:
| Ative o multi-queue conforme necessário. Consulte NIC multi-queue. | ||
GuestOS.SysctlIPv4TCPSACK.Disabled | O recurso Atributos no resultado retornado:
| Altere o valor para 1 conforme necessário. Para ativar o | ||
GuestOS.SysctlIPv4TCPTWRecycle.Enabled | Os parâmetros de kernel relacionados ao NAT estão configurados incorretamente na instância. Isso impede conexões SSH à instância e causa acesso anormal aos services HTTP na instância. Atributos no resultado retornado:
| Altere o valor para 0 conforme necessário. Para obter informações sobre como corrigir parâmetros de kernel no ambiente NAT, consulte Common kernel network parameters of Linux ECS instances and FAQ. | ||
GuestOS.SysctlIPv4TCPTWReuse.Disabled | O recurso de reutilização de sockets TIME-WAIT está desativado para a instância. Sockets no estado TIME-WAIT não podem ser usados para novas conexões TCP. Isso pode afetar o desempenho da rede quando a instância envia solicitações. Atributo no resultado retornado:
| Altere o valor de | ||
GuestOS.SysctlNetfilterNfMaxConnections.Unreasonable | Os logs históricos do sistema da instância contêm logs de erro dentro de um período de tempo. Esse problema ocorre quando o espaço total da tabela hash é usado pelo módulo de kernel Atributos no resultado retornado:
| Altere os valores desses dois parâmetros no arquivo de configuração do kernel da instância conforme necessário e as condições do sistema. Para obter mais informações, consulte Common kernel network parameters of ECS Linux instances and FAQCommon kernel network parameters of Linux ECS instances and FAQ. | ||
GuestOS.PidMax.TooSmall | O número de processos em execução na instância excede dois terços do número máximo de processos ( Atributos no resultado retornado:
| Aumente o | ||
GuestOS.SysctlTcpMaxTwBuckets.Unreasonable | Os logs históricos do sistema da instância contêm logs de erro dentro de um período de tempo. Esse problema ocorre porque muitas conexões TIME_WAIT na instância podem causar desconexões inesperadas ou falhas ao responder a novas conexões, afetando o acesso à instância ou a resposta do service. Atributos no resultado retornado:
| Esse problema geralmente resulta de uma configuração inadequada do parâmetro de kernel | ||
GuestOS.SystemUserPwd | Verifique as configurações de conta e senha do sistema. | GuestOS.SystemUser.MissingInfo | A conta do sistema da instância não existe, o que pode causar falhas de logon na instância. Atributos no resultado retornado:
| Adicione as informações da conta conforme necessário. Para obter informações sobre como verificar usuários de sistema ausentes, consulte A critical system user does not exist in a Linux instance. |
GuestOS.SystemUserFile.NotUnixFormat | O formato do arquivo de conta do sistema na instância está incorreto, o que pode causar falhas de logon na instância. Atributo no resultado retornado:
| Modifique o formato do arquivo conforme necessário. Consulte Repair files in non-Unix formats on a Linux instance. | ||
GuestOS.SystemUserFile.InvalidExtensionAttribute | Os atributos estendidos do arquivo de conta do sistema na instância estão incorretos. Isso pode impedir que alguns recursos da instância funcionem conforme o esperado. Por exemplo, alterações na senha da conta root no console ECS podem não entrar em vigor. Atributos no resultado retornado:
| Modifique o formato do arquivo conforme necessário. Consulte Repair files in non-Unix formats on a Linux instance. | ||
GuestOS.FileSystems | Verifique o status do sistema de arquivos. | GuestOS.Filesystems.UUIDConflicts | A instância contém sistemas de arquivos com UUIDs duplicados, o que pode fazer com que o sistema monte automaticamente sistemas de arquivos inesperados durante a inicialização. Isso pode levar a falhas de inicialização ou comportamento inesperado. Exemplo de sistemas de arquivos com UUID idêntico: Atributos no resultado retornado:
| Verifique a versão do driver virtio da instância. Para obter informações sobre como modificar o UUID de um sistema de arquivos, consulte Modify the UUID of a disk. |
GuestOS.FstabFile.InvalidFormatExists | O arquivo Exemplo: Atributos no resultado retornado:
| Modifique o arquivo Para obter informações sobre como modificar o arquivo | ||
Verificação de status do firewall do Windows | Um dispositivo configurado no arquivo Atributos no resultado retornado:
| Remova dispositivos inexistentes do Para modificar o formato do arquivo | ||
GuestOS.FstabFile.LossMountDevice | A instância possui discos para os quais a montagem automática está desativada no arquivo Atributos no resultado retornado:
| Modifique os atributos de montagem do disco. Consulte Troubleshoot boot failures caused by /etc/fstab errors on a Linux instance | ||
GuestOS.FileSystems.PartitionUnaligned | O disco da instância possui partições que não estão alinhadas aos 2.048 setores recomendados. Quando o disco é redimensionado, a operação de extensão automática de partição no Linux pode falhar devido a partições desalinhadas, resultando em nenhum aumento no espaço disponível do sistema de arquivos. Atributos no resultado retornado:
| Corrija a partição de disco desalinhada. Consulte How do I handle the failure to extend GPT partitions using growpart after resizing a cloud disk? | ||
GuestOS.FstabFile.IncorrectType | O sistema de arquivos configurado para um dispositivo no arquivo Atributos no resultado retornado:
| Atualize o arquivo | ||
GuestOS.Mountpoint.Multiple | O arquivo Atributos no resultado retornado:
| Atualize o arquivo | ||
GuestOS.NetworkStatus | Verifique as configurações e o status da rede. | GuestOS.Network.InvalidNetmask | O endereço IPv4 ou a máscara de sub-rede correspondente da instância está configurado incorretamente, tornando a configuração do endereço IP inválida e causando falhas de conexão da instância. Atributo no resultado retornado:
| Modifique a máscara de sub-rede conforme necessário. Para obter mais informações, consulte How to configure a static IP address for a Linux ECS instance |
GuestOS.Network.InvalidDefaultRoute | Nenhuma rota padrão está configurada para a instância, o que pode causar falhas de acesso à instância. Atributo no resultado retornado:
| Modifique a NIC ou a configuração de roteamento do sistema para adicionar regras de roteamento necessárias. Consulte What do I do if the "Network is unreachable" error message appears when I access a public IP address from a Linux instance? | ||
GuestOS.DHCPService.Disabled | O processo do service DHCP para as NICs na instância está desativado. Isso pode fazer com que o endereço IP da instância não seja renovado após a expiração do lease, resultando em interrupção da rede. A configuração DHCP para a NIC Atributos no resultado retornado:
| Verifique a configuração do service DHCP. Consulte Troubleshoot Linux network service issues | ||
GuestOS.Udev.MacAddressNotExist | As regras udev para gerenciamento dinâmico de dispositivos no kernel da instância contêm entradas residuais nas quais os endereços MAC não correspondem à configuração real das NICs. Essa inconsistência pode causar mau funcionamento da rede da instância ou resultar em nomenclatura inesperada de dispositivos de rede. Atributos no resultado retornado:
| Exclua regras udev inconsistentes, como endereços MAC e nomes de interface de rede incompatíveis. Consulte How do I resolve network interface name drift in Linux instances with multiple network interfaces? | ||
GuestOS.DHCPService.CustomPort | Instâncias ECS executando versões específicas do CentOS ou RHEL 7 incluem versões do DHClient anteriores a 4.2.5-60. Essas versões anteriores contêm bugs e podem escutar em portas diferentes de 67, 68, 546 e 547. Se outros services ou processos nas instâncias ECS também usarem essas portas, poderão ocorrer conflitos, fazendo com que outros services ou processos falhem ao iniciar ou fiquem indisponíveis. Atributos no resultado retornado:
| Atualize a versão do service DHClient prontamente. Consulte Port conflict when starting a service on a CentOS or RHEL 7 instance. | ||
GuestOS.NetworkConfig.InvalidInterface | O arquivo de configuração de rede da instância especifica uma interface de rede inexistente, o que pode fazer com que o service de rede do sistema falhe ao iniciar ou execute anormalmente. Esse problema ocorre porque uma interface de rede inexistente é especificada no arquivo de configuração de rede. As possíveis causas incluem:
Atributos no resultado retornado:
| Adicione as ENIs necessárias ou exclua arquivos de configuração de ENIs inexistentes. | ||
GuestOS.Firewall | Verifique o status do firewall do sistema. | GuestOS.NetworkFirewall.Enabled | O firewall (configurações iptables) da instância está ativado. Se a instância tiver ativado o firewall e definido regras para bloquear acesso externo, as conexões à instância podem falhar. | Modifique a configuração do firewall conforme necessário. Consulte Manage system firewall on Linux. |
GuestOS.CloudInitService | Verifique o status do cloud-init. | GuestOS.CloudinitService.BadDriverStatus | O driver cloud-init da instância está anormal, o que pode impedir que configurações do sistema sejam executadas corretamente durante a fase de inicialização do sistema, resultando em falhas de acesso à instância. Atributos no resultado retornado:
| Verifique e inicie o cloud-init conforme necessário. Consulte Install cloud-init. |
GuestOS.CloudinitService.StartFailed | O service cloud-init da instância não inicia conforme o esperado, o que pode causar falhas de configuração do sistema e tornar a instância inacessível. | Faça logon na instância usando VNC, verifique os logs do sistema cloud-init e restart the instance. | ||
GuestOS.SSHServiceStatus | Verifique o status do service SSH. | GuestOS.SSH.ForbiddenRootLogin | O service SSH da instância proíbe o logon da conta root, impedindo que a conta root acesse a instância via SSH. Atributo no resultado retornado:
| Corrija o problema de logon remoto root. Consulte Resolve the "Permission denied, please try again" error for SSH connections to a Linux instance. |
GuestOS.SSH.MissingCriticalFileOrDirectory | Arquivos ou diretórios críticos para o service SSH da instância estão ausentes, o que impede o acesso à instância via SSH. Atributo no resultado retornado:
| Reconfigure diretórios e arquivos SSH. Consulte Verify required SSH files on a Linux instance. | ||
GuestOS.SSH.IncorrectSSHFilePermission | As permissões de acesso aos arquivos dos quais o service SSH depende estão configuradas incorretamente, o que impede o acesso SSH à instância. Atributos no resultado retornado:
| Reconfigure diretórios e arquivos SSH conforme necessário. Consulte Verify required SSH files on a Linux instance. | ||
GuestOS.SSH.ListeningPortMismatchWithConfig | O endereço e a porta nos quais o processo sshd está escutando não correspondem aos do arquivo de configuração. Essa incompatibilidade pode fazer com que conexões SSH ao endereço e porta esperados falhem. O endereço e a porta nos quais o processo sshd está escutando não estão definidos no arquivo de configuração sshd Atributos no resultado retornado:
| Altere o endereço e a porta de escuta no arquivo de configuração sshd com base em suas necessidades reais e reinicie o processo sshd para aplicar as alterações. Consulte Incorrect SSH permissions block remote connection to a Linux instance. | ||
GuestOS.TimeSyncService | Verifique o status do service de sincronização de hora. | GuestOS.TimeSyncService.Disabled | O service de sincronização de hora da instância não está funcionando corretamente ou está configurado incorretamente. Isso pode fazer com que a hora do sistema se desvie da hora padrão real, afetando a operação normal de alguns aplicativos na instância. Atributos no resultado retornado:
| Modifique a configuração do service de sincronização de hora conforme necessário. Consulte Time synchronization. |
GuestOS.OSOOM | Verifica se ocorreu um erro OOM. | GuestOS.Memory.OOM | Ocorreu um erro OOM no Guest OS da instância. Exemplo do timestamp e logs detalhados do incidente OOM mais recente: | Verifique se o tamanho atual da memória da instância é suficiente para suportar a carga de trabalho em execução nela. Se necessário, atualize a configuração para aumentar a memória da instância. Para analisar e resolver problemas de OOM, consulte Troubleshoot Out of Memory issues in a Linux instance |
Itens de diagnóstico e resultados das configurações do sistema operacional Windows
ID da métrica | Descrição da métrica | ID do item de resultado | Descrição do item | Operação recomendada |
GuestOS.WinCPUUtil | Verifica se a utilização da CPU está excessivamente alta. | GuestOS.CPU.HighUtilization | A utilização total da CPU da instância excede 80%. Os cinco processos com maior utilização de CPU estão listados abaixo. Verifique se eles estão em execução conforme o esperado. Atributos no resultado retornado:
| Verifique se há anormalidades nos processos da CPU. Se a causa for operações normais de negócios, atualize a configuração do ECS. Para alta utilização de núcleo único de CPU, consulte Troubleshoot high CPU utilization on Windows instances |
GuestOS.WinCoreCPU.HighUtilization | A instância possui uma ou mais CPUs com utilização superior a 85%. As informações sobre as CPUs com utilização acima de 85% estão listadas abaixo. Verifique se os processos estão em execução conforme o esperado. Atributos no resultado retornado:
| Verifique se os processos estão em execução conforme o esperado. Para alta utilização de núcleo único de CPU, consulte Troubleshoot high CPU utilization on Windows instances | ||
GuestOS.WinMemoryUtil | Verifica se o uso de memória está excessivamente alto. | GuestOS.WinMemory.HighUtilization | O uso total de memória excede 80%. Exemplo dos cinco processos com maior uso de memória: Atributos no resultado retornado:
| Desative serviços ou processos desnecessários. Para análise de alto uso de memória, consulte Memory analysis tools for Windows. |
GuestOS.WinMemory.LicenseCorrupted | A corrupção ou configuração incorreta do banco de dados de licenças do Windows causa um uso anormalmente alto de memória reservada para hardware no Gerenciador de Tarefas, resultando em alto uso de memória. Atributo no resultado retornado:
| Restaure o banco de dados de licenças do Windows e reinicie a instância. Para corrigir um banco de dados de licenças do Windows corrompido, consulte What do I do if a Windows instance stutters due to excessive memory reserved for hardware? | ||
GuestOS.WinSysDiskUtil | Verifica se o uso do disco do sistema está excessivamente alto. | GuestOS.WinFileSystem.InsufficientSpace | O espaço restante no disco do sistema (C:) é insuficiente, o que pode causar lentidão nas respostas ou falhas na inicialização. Atributos no resultado retornado:
| Redimensione o disco do sistema ou atualize o tipo de instância conforme necessário. Consulte Overview. |
GuestOS.WinSystemConfig | Verifica se as configurações críticas do sistema estão corretas. | GuestOS.WinOSVersion.Low | A versão do SO convidado não recebe mais manutenção da Alibaba Cloud e da Microsoft. Atributo no resultado retornado:
| Reinstale o sistema e atualize para uma versão mais recente do Windows. Consulte Replace system disk (OS) ou OS migration. |
GuestOS.VirtIOVersion.Low | O sistema operacional da instância usa uma versão anterior do driver virtio, o que impede o redimensionamento online do disco. O dispositivo Atributos no resultado retornado:
| Atualize a versão do virtio conforme necessário. | ||
GuestOS.WinCrashDump.Disabled | O recurso de despejo de memória está desativado na instância. Quando o sistema sofre uma reinicialização anormal ou tela azul, ele não consegue salvar as informações de erro para solução de problemas. Atributo no resultado retornado:
| Ative o recurso de despejo de memória conforme necessário. Para obter informações sobre como ativar o recurso no Windows, consulte Enable or disable kernel crash dump. | ||
GuestOS.KMSService.MismatchedKey | A instância usa o KMS para ativar o sistema operacional Windows, mas a chave de ativação usada pelo cliente KMS não corresponde à versão do Windows, causando falhas na ativação. Atributo no resultado retornado:
| Siga os tutoriais de ativação do Windows para selecionar uma chave compatível com sua versão do Windows. Para obter informações sobre como ativar o Windows usando o KMS, consulte | ||
GuestOS.KMSService.Disconnected | A instância não consegue se conectar ao servidor de ativação KMS, causando falha na ativação. Atributo no resultado retornado:
| Verifique se a configuração do firewall ou software de terceiros na instância bloqueia o acesso ao servidor de ativação KMS e modifique as configurações relevantes conforme necessário. Para obter informações sobre como verificar o servidor de ativação KMS, consulte Resolve Windows activation failure on an ECS instance. | ||
GuestOS.SPPSVCService.Unhealthy | O Software Protection Platform Service (SPPSVC.exe) da instância não consegue iniciar ou executar, o que impede a ativação do Windows e o acesso às configurações de ativação. Atributo no resultado retornado:
| Siga os tutoriais de ativação do Windows para reiniciar o serviço SPPSVC.exe e alterar seu tipo de inicialização para Automatic (Delayed Start), garantindo que o serviço inicie automaticamente na próxima vez. | ||
GuestOS.SystemPatch.Incorrect | Patches de sistema incorretos estão instalados na instância, o que pode causar reinicializações anormais ou travamentos do sistema. Exemplo de patch incorreto: Atributo no resultado retornado:
| Desinstale os patches incorretos durante um período apropriado, conforme necessário. Consulte Uninstall system patches from a Windows ECS instance | ||
GuestOS.WinFiles.Missing | Alguns arquivos críticos do sistema estão ausentes no diretório do sistema da instância (
| Restaure o arquivo de sistema conforme necessário. Consulte What do I do if a black screen appears and I cannot access the desktop when I remotely log on to a Windows instance? | ||
GuestOS.OperatingSystem.Unactivated | O sistema operacional Windows da instância não está ativado, o que pode causar a indisponibilidade de serviços específicos de personalização do Windows. | Ative o Windows usando a chave KMS correta. Consulte Windows system ECS instance activation failed. | ||
GuestOS.WinSystemInit | Verifica o status de inicialização do sistema. | GuestOS.SysPrepService.Interrupted | O processo de inicialização do serviço de preparação do sistema (SysPrep) foi interrompido durante a criação da instância porque a instância foi reiniciada muito cedo. Algumas configurações críticas do sistema operacional estão incompletas, o que pode causar falhas na inicialização da instância. Atributo no resultado retornado:
| Devido à inicialização incompleta do sistema, você deve substituir o disco do sistema para reinstalar o sistema operacional ou criar outra instância para substituir esta. Consulte Replace system disk (OS) ou Re-initialize a system disk. |
GuestOS.SysPrepService.InitFailed | O processo de inicialização do sistema foi concluído de forma anormal durante a criação da instância, o que pode impedir o funcionamento adequado da instância. A seguinte mensagem de erro aparece: Atributo no resultado retornado:
| Substitua o disco do sistema para reinstalar o sistema operacional ou crie outra instância para substituir esta. Consulte Replace system disk (OS) ou Re-initialize a system disk. | ||
GuestOS.WinSystemUser | Verifica a conta de administrador. | GuestOS.WinAdministrator.NotExist | A conta Administrator não existe, o que pode tornar os serviços inacessíveis. Atributo no resultado retornado:
| Ative a conta Administrator conforme necessário. |
GuestOS.WinNetworkStatus | Verifica a configuração e o status da rede. | GuestOS.WinNetworkInterfaceDriver.Disabled | A NIC da instância está indisponível, o que pode impedir conexões com a instância. A NIC está desativada. Atributos no resultado retornado:
| Corrija o status da NIC conforme necessário. Para obter informações sobre como verificar e corrigir o status da NIC, consulte Step 7: Check the network. |
GuestOS.WinRDPPort.Closed | A porta do sistema da instância não está aberta ou o firewall está ativado, impedindo o acesso à instância via RDP. Atributos no resultado retornado:
| Altere o status de abertura desta porta conforme necessário. Para obter informações sobre como habilitar a porta 3389 para permitir conexões RDP, consulte How do I enable Remote Desktop Services on a Windows ECS instance? | ||
GuestOS.WinDHCPService.Disabled | A configuração DHCP está desativada na NIC da instância, o que pode tornar os serviços inacessíveis. Atributos no resultado retornado:
| Altere o status de abertura desta porta conforme necessário. | ||
GuestOS.WinNetworkInterface.LackIPV4Address | A NIC da instância não possui endereço IPv4, o que pode tornar os serviços inacessíveis. Atributo no resultado retornado:
| Verifique se o DHCP está ativado na instância ou se um endereço IP estático foi configurado. | ||
GuestOS.NetworkProxy.Enabled | Proxies de rede configurados para a instância podem tornar os serviços inacessíveis. Atributo no resultado retornado:
| Desative os proxies de rede conforme necessário. | ||
GuestOS.WinPort.Conflict | A porta RDP da instância está sendo usada por outro processo, causando um conflito de porta que pode impedir o acesso à instância via RDP. Atributos no resultado retornado:
| Faça logon via VNC e modifique a porta RDP. Consulte Resolve RDP port conflicts on a Windows instance | ||
GuestOS.WinDiskStatus | Verifica o status do disco do Windows. | GuestOS.SystemDisk.Corrupted | O disco do sistema (C:) apresenta anomalias, o que pode causar falhas na reinicialização ou problemas na instalação de drivers. Atributo no resultado retornado:
| Recupere o disco do sistema durante um período apropriado:
|
GuestOS.VirtIODriver.DiskIDConflicts | A instância possui IDs de disco duplicados devido a um driver virtio desatualizado, o que pode causar perda de dados durante operações de redefinição de disco. Exemplos de discos com o mesmo ID: Atributo no resultado retornado:
| Atualize o driver virtio prontamente. | ||
GuestOS.WinFirewall | Verifica o status do firewall do Windows. | GuestOS.WinFirewall.Enabled | O firewall está ativado, o que pode tornar os serviços inacessíveis. Atributos no resultado retornado:
| Modifique as configurações da política de firewall conforme necessário. Consulte Configure firewall rules for Windows. |
GuestOS.WinDriverStatus | Verifica o status dos drivers críticos do Windows. | GuestOS.DiskFilterDriver.Vestigital | Arquivos residuais de driver de filtro de disco podem impedir que a instância reconheça discos recém-anexados. Atributos no resultado retornado:
| Limpe os drivers de filtro de disco inválidos e reinicie a instância. Consulte How to check for residual disk driver entries in the registry of a Windows instance? |
GuestOS.VirtIODriver.Low | A versão do driver virtio é {VirtioVersion}, que está desatualizada e pode causar problemas como telas azuis, perda de pacotes de rede e perda de dados em disco. | Atualize a versão do driver virtio prontamente. | ||
Instance.Type.Xen | O tipo de instância está desatualizado (baseado em Xen), o que pode causar falhas na inicialização do SO ou problemas no gerenciador de dispositivos. Atributo no resultado retornado:
| Atualize para um tipo de instância de nova geração conforme necessário. Consulte Upgrade the instance types of subscription instances ou Change pay-as-you-go instance type. | ||
GuestOS.WinSystemProcess | Verifica o status dos processos críticos do sistema Windows. | GuestOS.RDPService.Unavailable | O serviço RDP está desativado ou corrompido, impedindo o acesso via RDP. | Reinicie ou reinstale o serviço RDP conforme necessário. Consulte How do I enable Remote Desktop Services on a Windows ECS instance? |
GuestOS.RDP.BlockedByFirewall | O firewall bloqueia o acesso RDP, o que pode impedir conexões RDP. Atributo no resultado retornado:
| Desative o firewall ou adicione uma regra para permitir o acesso RDP (porta 3389). Para permitir o acesso RDP no Windows, consulte Configure firewall rules for Windows. | ||
GuestOS.WSUS.Disconnected | O Windows Server Update Services (WSUS) não consegue se conectar, o que pode impedir atualizações do SO. | Reconfigure o WSUS conforme necessário. | ||
GuestOS.Metaserver.Disconnected | O serviço de metadados (metaserver) não consegue se conectar ou atinge o tempo limite, o que pode tornar os metadados da instância inacessíveis. | Verifique se o firewall bloqueia o endereço 100.100.100.200. Em caso afirmativo, permita-o antes de acessar o serviço de metadados. Consulte Instance metadata. | ||
GuestOS.WinLicence.Expired | A licença do Serviço de Área de Trabalho Remota expirou, causando mau funcionamento do RDP. | Faça logon via VNC e adquira a licença do Serviço de Área de Trabalho Remota ou desinstale o serviço conforme necessário. Para problemas de licença da Área de Trabalho Remota do Windows, consulte What do I do if I cannot connect to a Windows ECS instance by using RDP because no valid license is available for Remote Desktop Services? | ||
GuestOS.WinThirdPartSoftware | Verifica o status de instalação de software de terceiros. | GuestOS.Operation.InfluencedByAntivirusProcess | Um software antivírus de terceiros está instalado, o que pode causar falhas em operações de gerenciamento (como redefinição de senha e conexão remota) e exceções na instância. Exemplo de software antivírus instalado: Atributo no resultado retornado:
| Desinstale o software correspondente conforme necessário. |
Itens de diagnóstico e resultados do rastreamento de comportamento do usuário
Metric ID | Descrição da métrica | ID do item de resultado | Descrição do resultado | Operação recomendada |
Instance.UnexpectedSgCreationOrDeletion | Consulta operações de criação e exclusão de grupos de segurança em um período especificado, com base na função do RAM. Caso a função AliyunServiceRoleForECSSelfService não exista, o sistema a cria automaticamente. | Instance.UnexpectedSgCreationOrDeletion.Log | Exibe operações relacionadas à criação e exclusão de grupos de segurança. | Visualize os detalhes em ActionTrail. |
Instance.UnexpectedSgMember | Consulta operações de associação ou desassociação de instâncias a grupos de segurança em um período especificado, com base na função do RAM. Se a função AliyunServiceRoleForECSSelfService estiver ausente, ela será criada automaticamente. | Instance.UnexpectedSgMember.Log | Mostra operações referentes à associação ou desassociação de instâncias em grupos de segurança. | Visualize os detalhes em ActionTrail. |
Instance.UnexpectedFee | Consulta operações de faturamento de instâncias em um período especificado, utilizando a função do RAM. O sistema cria automaticamente a função AliyunServiceRoleForECSSelfService caso ela não exista. | Instance.UnexpectedFee.Log | Lista operações associadas ao faturamento de instâncias. | Visualize os detalhes em ActionTrail. |
Instance.UnexpectedCreationOrRelease | Consulta operações de criação e exclusão de instâncias em um período definido, com base na função do RAM. A função AliyunServiceRoleForECSSelfService é criada automaticamente se ainda não estiver presente. | Instance.UnexpectedCreationOrRelease.Log | Apresenta operações de criação e exclusão de instâncias. | Visualize os detalhes em ActionTrail. |
Instance.UnexpectedRunningStatus | Consulta operações que afetam o status de execução da instância em um período especificado, conforme a função do RAM. Caso a função AliyunServiceRoleForECSSelfService não exista, o sistema a provisiona automaticamente. | Instance.UnexpectedRunningStatus.Log | Exibe operações que impactam o status de execução da instância. |