Todos os produtos
Search
Central de documentação

Elastic GPU Service:FAQ for GPU-accelerated instances

Última atualização: Jun 27, 2026

Este tópico ajuda a solucionar problemas do Elastic GPU Service com um resumo das questões mais comuns durante o uso de GPUs.

Categoria

Perguntas relacionadas

Instância acelerada por GPU

Placa GPU

Memória da GPU

Driver da GPU

Monitoramento de GPU

Como visualizar o uso de recursos (vCPU, tráfego de rede, largura de banda e disco) de uma instância acelerada por GPU?

Outros

Como instalar o serviço cGPU?

O comando nvidia-smi -r trava após a instalação do serviço cGPU

Instâncias aceleradas por GPU

As instâncias aceleradas por GPU suportam emuladores Android?

Emuladores Android podem ser instalados apenas em algumas instâncias aceleradas por GPU.

Esses emuladores são suportados somente nas seguintes famílias de ECS Bare Metal Instance otimizadas para computação acelerada por GPU: ebmgn7e , ebmgn7i, ebmgn7, ebmgn6ia, ebmgn6e, ebmgn6v, ebmgn6i .

É possível alterar a configuração de uma instância acelerada por GPU?

Algumas instâncias aceleradas por GPU permitem alterações de configuração.

Os tipos de instância suportados estão listados em Restrições e verificações para alteração de tipo de instância.

Uma família de instâncias ECS padrão pode ser atualizada ou alterada para uma família de instâncias aceleradas por GPU?

Não. Famílias de instâncias ECS padrão não podem ser convertidas em famílias de instâncias aceleradas por GPU.

Consulte os tipos de instância suportados em Restrições e verificações para alteração de tipo de instância.

Como transferir dados entre uma instância acelerada por GPU e uma instância ECS padrão?

Nenhuma configuração especial é necessária para transferir dados.

Instâncias aceleradas por GPU funcionam como instâncias ECS padrão. Instâncias no mesmo grupo de segurança se comunicam pela rede interna por padrão, sem necessidade de configurações adicionais.

Qual é a diferença entre GPU e CPU?

A tabela a seguir compara GPUs e CPUs.

Comparação

GPU

CPU

Unidade Lógica Aritmética (ALU)

Muitas ALUs otimizadas para computação paralela em grande escala.

Poucas ALUs, porém poderosas.

Unidade de controle

Unidade de controle relativamente simples.

Unidade de controle complexa.

Cache

Cache pequeno que atende threads em vez de armazenar dados acessados.

Estruturas de cache grandes para armazenar dados, aumentar a velocidade de acesso e reduzir a latência.

Método de resposta

Integra todas as tarefas antes do processamento em lote.

Responde a tarefas individuais em tempo real.

Cenários

Indicado para cenários de computação paralela multithread com alta similaridade, uso intensivo de computação e alto throughput.

Adequado para cenários de computação serial logicamente complexa que exigem tempos de resposta rápidos.

Placas GPU

Por que o comando nvidia-smi não encontra a placa GPU após a compra de uma instância acelerada por GPU?

Causa: O comando nvidia-smi não localiza a placa GPU porque o driver Tesla ou GRID não foi instalado ou a instalação falhou.

Solução: Para utilizar os recursos de alto desempenho da instância acelerada por GPU, instale o driver correto para o tipo de instância:

Como visualizar os detalhes de uma placa GPU?

O método varia conforme o sistema operacional:

  • No Linux, execute o comando nvidia-smi para ver os detalhes da placa GPU.

  • No Windows, visualize os detalhes da placa GPU em Device Manager > Display Adapters.

Nota

Para visualizar informações como taxa de ociosidade da GPU, uso, temperatura e energia, acesse o console do CloudMonitor. Para mais informações, consulte Monitoramento de GPU.

Falha na inicialização da GPU (como RmInitAdapter failed!) ao usar GPU no Linux

  • Sintomas: O dispositivo GPU fica offline e o sistema não reconhece a placa GPU. Por exemplo, em um sistema Linux, ocorre um erro de falha na inicialização da GPU. Ao executar o comando sh nvidia-bug-report.sh, a mensagem de erro RmInitAdapter failed aparece no log gerado, conforme o exemplo a seguir:

    NVRM: _kgspBootGspRm: unexpected WPR2 already up, cannot proceed with booting GSP
    NVRM: _kgspBootGspRm: (the GPU is likely in a bad state and may need to be reset)
    NVRM: crashcatWayfinderGetReportQueue_V1: insufficiently-sized L1 wayfinder scratch location 0
    NVRM: RmInitAdapter: Cannot initialize GSP firmware RM
    NVRM: GPU 0000:00:09.0: RmInitAdapter failed! (0x62:0x40:2015)
    NVRM: GPU 0000:00:09.0: rm_init_adapter failed, device minor number 0
  • Causa: O componente GPU System Processor (GSP) pode estar em um estado anormal. Isso faz com que o dispositivo fique offline e impede que o sistema detecte a placa GPU.

  • Solução: Reinicie a instância pelo console. Essa ação redefine completamente a GPU e geralmente resolve o problema. Se o problema persistir, consulte Perda de dispositivo GPU devido a erros XID 119/XID 120 ao usar uma GPU para solução de problemas adicional. Recomendamos desativar o recurso GSP.

Memória da GPU

Por que uma instância com 48 GB de memória da GPU mostra cerca de 3 GB a menos no nvidia-smi?

O ECC (Error-Correcting Code) está ativado e utiliza aproximadamente 2-3 GB de memória da GPU em uma instância de 48 GB. Execute nvidia-smi para verificar o status do ECC (OFF = desativado, ON = ativado).

Como desativar o recurso ECC para liberar memória da GPU?

  1. Linha de comando: Interrompa todos os processos que utilizam a GPU. Execute nvidia-smi -e 0 para desativar o ECC. Em seguida, execute nvidia-smi -r para redefinir a GPU.

  2. Script de inicialização: Adicione nvidia-smi -e 0 e nvidia-smi -r na primeira linha do script de inicialização /etc/rc.local. Em alguns sistemas, o caminho é /etc/rc.d/rc.local. Depois, reinicie a instância.

O que fazer se ocorrer um erro indicando que a GPU está em uso por outro cliente ao desativar o ECC?

Esse erro indica que algum componente ou processo ainda utiliza a GPU. Certifique-se de que nenhum processo da GPU esteja em execução na máquina. Caso não consiga interrompê-los manualmente, crie um backup via snapshot. Em seguida, adicione os comandos nvidia-smi -e 0 e nvidia-smi -r ao script de inicialização /etc/rc.local. Em alguns sistemas, o caminho é /etc/rc.d/rc.local. Reinicie a instância para aplicar as alterações.

Drivers de GPU

Qual driver instalar para uma instância acelerada por vGPU?

Instâncias aceleradas por vGPU requerem um driver GRID.

Para cenários de computação de uso geral ou aceleração gráfica, carregue o driver GRID durante a criação da instância ou instale-o posteriormente com o Cloud Assistant:

Posso atualizar o CUDA para 12,4 ou o driver NVIDIA para 550 ou superior em uma instância acelerada por vGPU?

Não.

Instâncias aceleradas por vGPU utilizam o driver GRID fornecido pela plataforma, com versão fixa. Não é possível instalar drivers do site da NVIDIA. Para atualizar o CUDA ou o driver, utilize uma instância das séries gn ou ebm.

Qual driver instalar para usar ferramentas como OpenGL e Direct3D para aceleração gráfica em uma instância otimizada para computação acelerada por GPU?

Instale o driver de acordo com o sistema operacional:

Por que a versão do CUDA exibida após a instalação difere daquela selecionada durante a criação da instância acelerada por GPU?

O comando nvidia-smi exibe a versão mais alta do CUDA suportada pela instância acelerada por GPU, e não a versão selecionada durante a criação da instância.

Após instalar um driver GRID em uma instância acelerada por GPU Windows, o que fazer se uma tela preta aparecer ao usar uma conexão VNC pelo console?

  • Causa: O driver GRID assume a saída de vídeo. O VNC não consegue mais renderizar a partir dos gráficos integrados, resultando em uma tela preta. Esse comportamento é esperado.

  • Solução: Conecte-se à instância acelerada por GPU usando o Workbench. Para mais informações, consulte Conectar-se a uma instância Windows usando o Workbench.

Como obter uma licença GRID?

O método depende do sistema operacional:

Como atualizar um driver de GPU (Tesla ou GRID)?

Não é possível atualizar diretamente um driver de GPU. Desinstale a versão antiga, reinicie e, em seguida, instale a nova versão. Atualizar um driver Tesla ou GRID.

Importante

Realize a atualização fora dos horários de pico. Faça backup dos dados do disco criando um snapshot antes. Criar um snapshot.

Falha do sistema e erro kernel NULL pointer dereference após instalar o driver NVIDIA versão 570.124.xx (Linux) ou 572,61 (Windows)

  • Sintomas: Em alguns tipos de instância, o sistema reporta um erro kernel NULL pointer dereference durante a instalação do driver NVIDIA versão 570.124.xx (Linux) ou 572,61 (Windows), ou ao executar o comando nvidia-smi após a instalação. O log a seguir mostra o erro:

    Error log

    [  305.164082] BUG: kernel NULL pointer dereference, address: 00000000000000c4
    [  305.164303] #PF: supervisor read access in kernel mode
    [  305.164447] #PF: error_code(0x0000) - not-present page
    [  305.164626] PGD 0 P4D 0
    [  305.164724] Oops: 0000 [#1] SMP NOPTI
    [  305.164852] CPU: 29 PID: 23659 Comm: nv_open_q Kdump: loaded Tainted: G           OE     5.10.134-19.1.al8.x86_64 #1
    [  305.165241] Hardware name: Alibaba Cloud Alibaba Cloud ECS, BIOS 2.0.0 04/23/2024
    [  305.165450] RIP: 0010:pci_read_config_dword+0x5/0x40
    [  305.165630] Code: 44 89 c6 e9 5d fc ff ff b8 ff ff ff ff 66 89 02 b8 86 00 00 00 c3 cc cc cc cc 66 66 2e 0f 1f 84 00 00 00 00 00 0f 1f 44 00 00 <83> bf c4 00 00 00 03 48 89 d1 74 12 44 8b 47 38 48 8b 7f 10 89 f2
    [  305.166323] RSP: 0018:ffffbc6ac0f1b9f0 EFLAGS: 00010293
    [  305.166469] RAX: 0000000000000000 RBX: ffff9e9ba33e0020 RCX: 0000000000000002
    [  305.166724] RDX: ffffbc6ac0f1ba0c RSI: 0000000000000000 RDI: 0000000000000000
    [  305.166977] RBP: ffffbc6ac0f1ba10 R08: 0000000000000000 R09: 0000000000000000
    [  305.167243] R10: 00000000000922f8 R11: ffffffffac163048 R12: 0000000000000000
    [  305.167506] R13: 0000000000000001 R14: 0000000000000004 R15: 0000000000000000
    [  305.167766] FS:  0000000000000000(0000) GS:ffff9ef785480000(0000) knlGS:0000000000000000
    [  305.168060] CS:  0010 DS: 0000 ES: 0000 CR0: 0000000080050033
    [  305.168270] CR2: 00000000000000c4 CR3: 0000004130a12003 CR4: 0000000002770ee0
    [  305.168531] DR0: 0000000000000000 DR1: 0000000000000000 DR2: 0000000000000000
    [  305.168793] DR3: 0000000000000000 DR6: 00000000fffe07f0 DR7: 0000000000000400
    [  305.169052] PKRU: 55555554
    [  305.169157] Call Trace:
    [  305.169252]  ? __die+0x20/0x70
    [  305.169372]  ? no_context+0x5f/0x260
    [  305.169504]  ? exc_page_fault+0x68/0x130
    [  305.169651]  ? asm_exc_page_fault+0x1e/0x30
    [  305.169815]  ? pci_read_config_dword+0x5/0x40
    [  305.170080]  os_pci_read_dword+0x12/0x30 [nvidia]
    [  305.170357]  ? osPciReadDword+0x15/0x20 [nvidia]
    [  305.170637]  gpuReadPcieConfigCycle_GB202+0x66/0xd0 [nvidia]
    [  305.170962]  kbifSavePcieConfigRegistersFn1_GB202+0x65/0xc0 [nvidia]
    [  305.171297]  kbifSavePcieConfigRegisters_GH100+0xd2/0x1e0 [nvidia]
    [  305.171619]  kbifStateLoad_IMPL+0xa1/0xe0 [nvidia]
    [  305.171893]  gpuStateLoad_IMPL+0x267/0xd60 [nvidia]
    [  305.172129]  ? _rmGpuLocksAcquire.constprop.0+0x352/0xbf0 [nvidia]
    [  305.172375]  ? portSyncSpinlockAcquire+0x1d/0x50 [nvidia]
    [  305.172585]  ? _tlsThreadEntryGet+0x82/0x90 [nvidia]
    [  305.172780]  ? tlsEntryGet+0x31/0x80 [nvidia]
    [  305.172979]  gpumgrStateLoadGpu+0x5b/0x70 [nvidia]
    [  305.173209]  RmInitAdapter+0xf08/0x1c00 [nvidia]
    [  305.173433]  ? os_get_current_tick+0x28/0x70 [nvidia]
    [  305.173671]  rm_init_adapter+0xad/0xc0 [nvidia]
    [  305.173845]  nv_start_device+0x2a9/0x6f0 [nvidia]
    [  305.174328]  ? nv_open_device+0x9b/0x220 [nvidia]
    [  305.174791]  ? nvidia_open_deferred+0x3c/0x100 [nvidia]
    [  305.175248]  ? nvidia_modeset_resume+0x20/0x20 [nvidia]
    [  305.175705]  ? _main_loop+0x9e/0x160 [nvidia]
    [  305.176128]  ? nvidia_modeset_resume+0x20/0x20 [nvidia]
    [  305.176527]  ? kthread+0x118/0x140
    [  305.176869]  ? __kthread_bind_mask+0x60/0x60
    [  305.177230]  ? ret_from_fork+0x1f/0x30
    [  305.177575] Modules linked in: nvidia_drm(OE) nvidia_modeset(OE) nvidia(OE) ecc rfkill intel_rapl_msr intel_rapl_common intel_uncore_frequency_common isst_if_common skx_edac_common nfit intel_powerclamp crct10dif_pclmul crc32_pclmul ghash_clmulni_intel rapl snd_intel8x0 snd_ac97_codec ac97_bus snd_pcm erdma snd_timer ib_uverbs snd soundcore ib_core virtio_balloon pcspkr i2c_piix4 sunrpc vfat fat cirrus drm_kms_helper syscopyarea sysfillrect sysimgblt fb_sys_fops drm nvme libcrc32c virtio_net crc32c_intel net_failover nvme_core serio_raw i2c_core failover virtio_console t10_pi floppy [last unloaded: ecc]
    [  305.180787] CR2: 00000000000000c4
    [  305.181132] ---[ end trace 85d65b7e0a10dcf8 ]---
    [  305.181512] RIP: 0010:pci_read_config_dword+0x5/0x40
    [  305.181903] Code: 44 89 c6 e9 5d fc ff ff b8 ff ff ff ff 66 89 02 b8 86 00 00 00 c3 cc cc cc cc 66 66 2e 0f 1f 84 00 00 00 00 00 0f 1f 44 00 00 <83> bf c4 00 00 00 03 48 89 d1 74 12 44 8b 47 38 48 8b 7f 10 89 f2
    [  305.183045] RSP: 0018:ffffbc6ac0f1b9f0 EFLAGS: 00010293
    [  305.183463] RAX: 0000000000000000 RBX: ffff9e9ba33e0020 RCX: 0000000000000002
    [  305.183955] RDX: ffffbc6ac0f1ba0c RSI: 0000000000000000 RDI: 0000000000000000
    [  305.184443] RBP: ffffbc6ac0f1ba10 R08: 0000000000000000 R09: 0000000000000000
    [  305.184931] R10: 00000000000922f8 R11: ffffffffac163048 R12: 0000000000000000
    [  305.185415] R13: 0000000000000001 R14: 0000000000000004 R15: 0000000000000000
    [  305.185913] FS:  0000000000000000(0000) GS:ffff9ef785480000(0000) knlGS:0000000000000000
    [  305.186426] CS:  0010 DS: 0000 ES: 0000 CR0: 0000000080050033
    [  305.186870] CR2: 00000000000000c4 CR3: 0000004130a12003 CR4: 0000000002770ee0
    [  305.187363] DR0: 0000000000000000 DR1: 0000000000000000 DR2: 0000000000000000
    [  305.187866] DR3: 0000000000000000 DR6: 00000000fffe07f0 DR7: 0000000000000400
    [  305.188361] PKRU: 55555554
    [  305.188719] Kernel panic - not syncing: Fatal exception
    [  305.190378] Kernel Offset: 0x29000000 from 0xffffffff81000000 (relocation range: 0xffffffff80000000-0xffffffffbfffffff)
  • Solução: Evite usar a versão 570.124.xx (Linux) ou 572,61 (Windows) do driver. Recomendamos o uso da versão 570.133.20 (Linux) ou 572,83 (Windows) ou superior.

O comando nvidia-smi retorna o erro "No devices were found" ao selecionar NVIDIA Proprietary como tipo de módulo do kernel durante a instalação do driver

  • Sintomas: Em alguns tipos de instância, se você selecionar NVIDIA Proprietary como tipo de módulo do kernel durante a instalação do driver, o comando nvidia-smi retorna um erro No devices were found após a instalação.

    O outro tipo de módulo do kernel disponível nesta tela é MIT/GPL.

  • Causa: Nem todos os modelos de GPU são compatíveis com o driver NVIDIA Proprietary.

  • Configuração recomendada para o tipo de módulo do kernel:

    • Para GPUs de arquitetura Blackwell: Use obrigatoriamente o driver open-source (selecione MIT/GPL).

    • Para GPUs de arquitetura Turing, Ampere, Ada Lovelace e Hopper: Recomendamos o uso do driver open-source (selecione MIT/GPL).

    • Para GPUs de arquitetura Maxwell, Pascal e Volta: Selecione apenas NVIDIA Proprietary.

Monitoramento de GPU

Como visualizar o uso de recursos (vCPU, tráfego de rede, largura de banda e disco) de uma instância acelerada por GPU?

Utilize um dos métodos a seguir para visualizar dados de monitoramento, como uso de vCPU, memória, carga média do sistema, largura de banda interna, largura de banda pública, conexões de rede, uso e leituras de disco, uso da GPU, uso de memória da GPU e energia da GPU.

  • Console do produto

  • Centro de Despesas e Custos

    Na página View Usage Details, filtre por Time Period, Commodity Name, Billable Item, Billable Item e Time Unit. Clique em Export CSV para exportar os dados de uso. Detalhes de faturamento.

    Por exemplo, para visualizar o uso de tráfego de uma instância ECS, selecione ECS - Pay-As-You-Go em Product name, Outbound traffic em Billable item, Public traffic em Metering specification (o nome da especificação é ECS_FLOW) e Hour em Metering granularity.

    Nota

    Os detalhes de uso mostram o consumo bruto de recursos, que difere do uso faturável nos detalhes de faturamento. Esses resultados servem apenas como referência e não podem ser usados para conciliação.

Outros

Como instalar o serviço cGPU?

Instale o serviço cGPU por meio do runtime Docker no ACK. Este é o método recomendado tanto para usuários empresariais quanto para usuários individuais que concluíram a verificação de identidade. Gerenciar o componente de agendamento de GPU compartilhada.

O comando nvidia-smi -r trava após a instalação do serviço cGPU

  • Sintomas: Quando o serviço cGPU está carregado (verifique com lsmod | grep cgpu), o comando nvidia-smi -r trava ao redefinir a GPU. Um erro também aparece no log dmesg.

    [527717.881425] NVRM: Attempting to remove device 0000:08:00.0 with non-zero usage count!
  • Causa: O componente cGPU ainda utiliza o dispositivo GPU. Isso bloqueia a operação de redefinição de hardware.

  • Solução:

    1. Desinstalar o cGPU: Desinstale o componente cGPU. Após a desinstalação, o comando nvidia-smi -r volta a funcionar e retorna um resultado.

    2. Reiniciar a instância: Se o problema persistir após a desinstalação, reinicie a instância pelo console. Executar o comando reboot dentro da instância não é eficaz.

    Importante

    Não redefina a GPU executando comandos como nvidia-smi -r, desanexando o dispositivo ou reinstalando o driver enquanto o serviço cGPU estiver carregado. Sempre desinstale o serviço cGPU primeiro para evitar falhas.