Todos os produtos
Search
Central de documentação

Intelligent Computing LINGJUN:Use a avaliação de desempenho do CNP

Última atualização: Sep 02, 2026

O CNP (Cloud Native Application Performance Optimizer) é uma plataforma para avaliar, analisar e otimizar o desempenho de aplicações nativas da cloud. Ele automatiza a avaliação de desempenho de treinamento de clusters Lingjun e fornece recomendações de otimização.

Acesso à plataforma CNP

  1. Faça login no console Lingjun.

  2. No painel de navegação à esquerda, clique em Performance Evaluation > CNP Performance Evaluation Platform.

  3. Na plataforma CNP, inicie uma avaliação de desempenho ou visualize os resultados da avaliação.

  4. No canto inferior esquerdo da página, clique em Back para retornar rapidamente ao console Lingjun.

image.png

image.png

Iniciar avaliação

Etapa 1: Selecione um cluster

Na página de boas-vindas ou na página Performance Evaluation, clique em Start Evaluation para acessar a primeira etapa: Select a cluster.

image.png

  • Nome do cluster: selecione o cluster desejado para a avaliação entre os clusters disponíveis.

  • Autorize as informações de acesso do DLC: após preencher os campos, clique em Test Connectivity. Se a conexão for bem-sucedida, uma mensagem de sucesso será exibida; caso contrário, o motivo da falha aparecerá. Motivos comuns de falha:

    Enumeração de motivos de falha

    Operação sugerida

    Tempo limite de conexão

    Adicione o IP atual à lista de permissões de acesso do CNP e tente novamente

    Informações incorretas

    Pelo menos um dos itens AccessID, AccessKey, workspace ou Endpoint está incorreto. Verifique as informações e tente novamente.

    Falha ao obter token STS (D3001)

    Falha ao criar SLR (D3002)

    Falha ao criar instância Arms (D3003)

    Falha ao verificar service Arms (D3004)

    Ative o ARMS Service

    Falha ao recuperar informações do ARMS (D3005)

    Sem permissão para criar SLR (D3006)

    Autorize o SLR

Após a aprovação no teste de conectividade, clique em Next para prosseguir para a Etapa 2: Selecione uma solução de teste.

Etapa 2: Selecione uma solução de teste

Usar modelo

O sistema fornece dois modelos padrão de solução de teste. Selecione um com base no seu cenário de negócios.

image.png

Solução

Conteúdo do teste

Escala do cluster a ser testado

Solução A: Solução geral para cenários baseados em LLM

  • Teste de GPU única: MatMul (operador de matriz)

  • Teste de máquina única: Bert-base

  • Teste de modelo de IA: LLaMA-7B

  • Teste de GPU única: usa a escala máxima do seu cluster por padrão.

  • Teste de máquina única: usa a escala máxima do seu cluster por padrão.

  • Teste de modelo de IA: cria jobs de avaliação para 8 GPUs, 16 GPUs, 32 GPUs, 64 GPUs, 128 GPUs, 256 GPUs e 512 GPUs por padrão, respeitando a escala máxima do seu cluster. Por exemplo, se a escala máxima do seu cluster for de 100 GPUs, os jobs de avaliação serão criados apenas para 8 GPUs, 16 GPUs, 32 GPUs e 64 GPUs.

Solução B: Solução geral para cenários de reconhecimento de imagem

  • Teste de GPU única: MatMul (operador de matriz)

  • Teste de máquina única: Bert-base

  • Teste de modelo de IA: Swin-Transformer e Stable Diffusion

  • Teste de GPU única: usa a escala máxima do seu cluster por padrão.

  • Teste de máquina única: usa a escala máxima do seu cluster por padrão.

  • Teste de modelo de IA: cria jobs de avaliação para 8 GPUs, 16 GPUs, 32 GPUs e 64 GPUs por padrão, respeitando a escala máxima do seu cluster. Por exemplo, se a escala máxima do seu cluster for de 16 GPUs, os jobs de avaliação serão criados apenas para 8 GPUs e 16 GPUs.

Solução personalizada

Caso os modelos fornecidos não atendam aos seus requisitos, crie uma solução de teste personalizada.

  1. Teste de GPU única: personalize o número de nós. O caso de teste padrão é MatMul.

  2. Teste de máquina única: personalize o número de nós. O caso de teste padrão é Bert-base.

  3. Teste de modelo de IA: personalize o modelo e o número de GPUs no cluster de avaliação.

Nota
  • Os modelos compatíveis atualmente incluem: LLaMA-7B, Stable-Diffusion, Swin-Transformer, Bert-base e UNet.

  • As configurações padrão de parâmetros usam a configuração de linha de base. Visualize as configurações específicas na página.

image.png

Tempo estimado de avaliação

Após selecionar uma solução de teste, o sistema calcula o tempo estimado de avaliação com base no conteúdo do teste da solução. Observação: esta estimativa considera a escala máxima do cluster selecionado na primeira etapa. Se o seu cluster ativo não tiver atingido sua escala máxima, o tempo real de avaliação será maior.

Início rápido da avaliação

Depois de concluir as etapas um e dois, clique em One-Click Start Evaluation para iniciar a avaliação.

Visualize o progresso e os resultados da avaliação

Após a criação de um plano de teste, visualize seu status de execução e progresso em tempo real na página de lista de planos de avaliação. Localize o plano de teste e clique em Details na coluna Actions para visualizar o progresso da avaliação de cada etapa.

image.png

Teste de GPU única

  • Teste aprovado

    Se nenhuma GPU com suspeita de falha ou GPU em alerta for detectada entre as GPUs testadas, o teste de GPU única é aprovado.

    Nota
    • GPU com suspeita de falha: o job que testa a GPU falhou e a GPU pode estar defeituosa.

    • GPU em alerta: o TFLOPS da GPU excede a faixa de limiar normal em mais de 5% das iterações.

    • Lógica para cálculo da faixa de limiar normal: toma-se a mediana do TFLOPS de todas as GPUs em cada iteração como linha de base e compara-se 103% e 97% dessa linha de base com 4×sigma (4× desvio padrão). Os maiores valores são usados como limites superior e inferior da faixa de limiar normal.

    image.png

  • Resultados de teste anormais

    Se pelo menos uma GPU com suspeita de falha ou GPU em alerta for detectada entre as GPUs testadas, o teste de GPU única retorna resultados anormais.

    Na lista de jobs de avaliação, clique no ícone de mais (+) para visualizar detalhes das GPUs com suspeita de falha ou em alerta. Reporte os nós anormais à equipe de O&M para solução de problemas. Clique em Evaluation Details para visualizar os resultados da avaliação deste job.

    image.png

Progresso do teste de máquina única

  • Teste aprovado

    Se nenhum nó com suspeita de falha ou nó em alerta for detectado entre as zonas de borda testadas, o teste de máquina única é aprovado.

    Nota
    • Nó com suspeita de falha: o job do DLC no nó falhou e o nó pode estar defeituoso.

    • Nó em alerta: o throughput do nó excede a faixa de limiar normal em mais de 5% das iterações.

    • Lógica para cálculo da faixa de limiar normal: toma-se a mediana do throughput de todos os nós em cada iteração como linha de base e compara-se 103% e 97% dessa linha de base com 4× sigma (4× desvio padrão). Os maiores valores são usados como limiares máximo e mínimo da faixa de limiar normal.

    image.png

  • Resultados de teste anormais

    Se pelo menos uma zona de borda com suspeita de falha ou zona de borda em alerta for detectada entre as zonas de borda testadas, o teste de máquina única retorna resultados anormais.

    Na lista de jobs de avaliação, clique no ícone de mais (+) para visualizar detalhes dos nós com suspeita de falha ou em alerta e reporte os nós anormais à equipe de O&M para solução de problemas. Clique em Evaluation Details para visualizar os resultados da avaliação do job.

    image.png

Teste de modelo de IA

  • Progresso do teste

    Pendente: todos os jobs estão no estado pendente.

    Concluído: todos os jobs foram bem-sucedidos, falharam ou foram interrompidos.

    Interrompido: todos os jobs estão parados.

    Em execução: alguns jobs estão concluídos e outros estão pendentes ou em execução.

    image.png

  • Lista de jobs de teste

    Visualize todos os jobs incluídos na etapa de modelo de IA do Plano de Teste atual. Para parar um job em execução, clique em Stop. É possível excluir todos os jobs.

    Aviso

    Jobs excluídos e jobs com falha não são incluídos no painel de desempenho. Proceda com cautela.

Visualize o painel de desempenho dos resultados de teste

Entrada da operação

Visualize o painel de desempenho para planos de teste com status Completed. O painel abrange jobs de avaliação executados com sucesso na fase de teste de modelo de IA do plano de teste atual.

image.png

Conteúdo do painel

Escalabilidade do modelo de teste

image.png

Mostra como o throughput muda conforme a contagem de GPUs aumenta para cada modelo avaliado no plano de teste atual, refletindo a escalabilidade do modelo no cluster. Os resultados não são comparados entre modelos diferentes.

Fórmula: Pontuação de Escalabilidade = log₂(throughput do modelo / throughput da especificação mínima de avaliação)

Nota

Exemplo: este exemplo usa o modelo GPT3-175B (dados MOCK, apenas para fins de ilustração).

GPUs

Throughput

Pontuação de Escalabilidade

Pontuação Teórica de Escalabilidade

64

10

128

18

log₂(18 / 10)

log₂ 2

256

35

log₂(35 / 10)

log₂ 4

512

69

log₂(69 / 10)

log₂ 8

1024

137

log₂(137 / 10)

log₂ 16

Observação: quanto mais próxima a Pontuação de Escalabilidade estiver do valor da Pontuação Teórica de Escalabilidade, melhor será a escalabilidade de desempenho.

Detalhes do resultado da avaliação

Exibe throughput, MFU e latência de iteração para cada modelo nas contagens de GPUs avaliadas no plano de teste atual. O eixo Y representa a contagem de GPUs e o eixo X representa o valor da métrica.

image.png