O CNP (Cloud Native Application Performance Optimizer) é uma plataforma para avaliar, analisar e otimizar o desempenho de aplicações nativas da cloud. Ele automatiza a avaliação de desempenho de treinamento de clusters Lingjun e fornece recomendações de otimização.
Acesso à plataforma CNP
Faça login no console Lingjun.
No painel de navegação à esquerda, clique em Performance Evaluation > CNP Performance Evaluation Platform.
Na plataforma CNP, inicie uma avaliação de desempenho ou visualize os resultados da avaliação.
No canto inferior esquerdo da página, clique em Back para retornar rapidamente ao console Lingjun.


Iniciar avaliação
Etapa 1: Selecione um cluster
Na página de boas-vindas ou na página Performance Evaluation, clique em Start Evaluation para acessar a primeira etapa: Select a cluster.

Nome do cluster: selecione o cluster desejado para a avaliação entre os clusters disponíveis.
-
Autorize as informações de acesso do DLC: após preencher os campos, clique em Test Connectivity. Se a conexão for bem-sucedida, uma mensagem de sucesso será exibida; caso contrário, o motivo da falha aparecerá. Motivos comuns de falha:
Enumeração de motivos de falha
Operação sugerida
Tempo limite de conexão
Adicione o IP atual à lista de permissões de acesso do CNP e tente novamente
Informações incorretas
Pelo menos um dos itens AccessID, AccessKey, workspace ou Endpoint está incorreto. Verifique as informações e tente novamente.
Falha ao obter token STS (D3001)
Falha ao criar SLR (D3002)
Falha ao criar instância Arms (D3003)
Falha ao verificar service Arms (D3004)
Ative o ARMS Service
Falha ao recuperar informações do ARMS (D3005)
Sem permissão para criar SLR (D3006)
Autorize o SLR
Após a aprovação no teste de conectividade, clique em Next para prosseguir para a Etapa 2: Selecione uma solução de teste.
Etapa 2: Selecione uma solução de teste
Usar modelo
O sistema fornece dois modelos padrão de solução de teste. Selecione um com base no seu cenário de negócios.

|
Solução |
Conteúdo do teste |
Escala do cluster a ser testado |
|
Solução A: Solução geral para cenários baseados em LLM |
|
|
|
Solução B: Solução geral para cenários de reconhecimento de imagem |
|
|
Solução personalizada
Caso os modelos fornecidos não atendam aos seus requisitos, crie uma solução de teste personalizada.
Teste de GPU única: personalize o número de nós. O caso de teste padrão é MatMul.
Teste de máquina única: personalize o número de nós. O caso de teste padrão é Bert-base.
Teste de modelo de IA: personalize o modelo e o número de GPUs no cluster de avaliação.
Os modelos compatíveis atualmente incluem: LLaMA-7B, Stable-Diffusion, Swin-Transformer, Bert-base e UNet.
As configurações padrão de parâmetros usam a configuração de linha de base. Visualize as configurações específicas na página.

Tempo estimado de avaliação
Após selecionar uma solução de teste, o sistema calcula o tempo estimado de avaliação com base no conteúdo do teste da solução. Observação: esta estimativa considera a escala máxima do cluster selecionado na primeira etapa. Se o seu cluster ativo não tiver atingido sua escala máxima, o tempo real de avaliação será maior.
Início rápido da avaliação
Depois de concluir as etapas um e dois, clique em One-Click Start Evaluation para iniciar a avaliação.
Visualize o progresso e os resultados da avaliação
Após a criação de um plano de teste, visualize seu status de execução e progresso em tempo real na página de lista de planos de avaliação. Localize o plano de teste e clique em Details na coluna Actions para visualizar o progresso da avaliação de cada etapa.

Teste de GPU única
-
Teste aprovado
Se nenhuma GPU com suspeita de falha ou GPU em alerta for detectada entre as GPUs testadas, o teste de GPU única é aprovado.
NotaGPU com suspeita de falha: o job que testa a GPU falhou e a GPU pode estar defeituosa.
GPU em alerta: o TFLOPS da GPU excede a faixa de limiar normal em mais de 5% das iterações.
Lógica para cálculo da faixa de limiar normal: toma-se a mediana do TFLOPS de todas as GPUs em cada iteração como linha de base e compara-se 103% e 97% dessa linha de base com 4×sigma (4× desvio padrão). Os maiores valores são usados como limites superior e inferior da faixa de limiar normal.

-
Resultados de teste anormais
Se pelo menos uma GPU com suspeita de falha ou GPU em alerta for detectada entre as GPUs testadas, o teste de GPU única retorna resultados anormais.
Na lista de jobs de avaliação, clique no ícone de mais (+) para visualizar detalhes das GPUs com suspeita de falha ou em alerta. Reporte os nós anormais à equipe de O&M para solução de problemas. Clique em Evaluation Details para visualizar os resultados da avaliação deste job.

Progresso do teste de máquina única
-
Teste aprovado
Se nenhum nó com suspeita de falha ou nó em alerta for detectado entre as zonas de borda testadas, o teste de máquina única é aprovado.
NotaNó com suspeita de falha: o job do DLC no nó falhou e o nó pode estar defeituoso.
Nó em alerta: o throughput do nó excede a faixa de limiar normal em mais de 5% das iterações.
Lógica para cálculo da faixa de limiar normal: toma-se a mediana do throughput de todos os nós em cada iteração como linha de base e compara-se 103% e 97% dessa linha de base com 4× sigma (4× desvio padrão). Os maiores valores são usados como limiares máximo e mínimo da faixa de limiar normal.

-
Resultados de teste anormais
Se pelo menos uma zona de borda com suspeita de falha ou zona de borda em alerta for detectada entre as zonas de borda testadas, o teste de máquina única retorna resultados anormais.
Na lista de jobs de avaliação, clique no ícone de mais (+) para visualizar detalhes dos nós com suspeita de falha ou em alerta e reporte os nós anormais à equipe de O&M para solução de problemas. Clique em Evaluation Details para visualizar os resultados da avaliação do job.

Teste de modelo de IA
-
Progresso do teste
Pendente: todos os jobs estão no estado pendente.
Concluído: todos os jobs foram bem-sucedidos, falharam ou foram interrompidos.
Interrompido: todos os jobs estão parados.
Em execução: alguns jobs estão concluídos e outros estão pendentes ou em execução.

-
Lista de jobs de teste
Visualize todos os jobs incluídos na etapa de modelo de IA do Plano de Teste atual. Para parar um job em execução, clique em Stop. É possível excluir todos os jobs.
AvisoJobs excluídos e jobs com falha não são incluídos no painel de desempenho. Proceda com cautela.
Visualize o painel de desempenho dos resultados de teste
Entrada da operação
Visualize o painel de desempenho para planos de teste com status Completed. O painel abrange jobs de avaliação executados com sucesso na fase de teste de modelo de IA do plano de teste atual.

Conteúdo do painel
Escalabilidade do modelo de teste

Mostra como o throughput muda conforme a contagem de GPUs aumenta para cada modelo avaliado no plano de teste atual, refletindo a escalabilidade do modelo no cluster. Os resultados não são comparados entre modelos diferentes.
Fórmula: Pontuação de Escalabilidade = log₂(throughput do modelo / throughput da especificação mínima de avaliação)
Exemplo: este exemplo usa o modelo GPT3-175B (dados MOCK, apenas para fins de ilustração).
|
GPUs |
Throughput |
Pontuação de Escalabilidade |
Pontuação Teórica de Escalabilidade |
|
64 |
10 |
||
|
128 |
18 |
log₂(18 / 10) |
log₂ 2 |
|
256 |
35 |
log₂(35 / 10) |
log₂ 4 |
|
512 |
69 |
log₂(69 / 10) |
log₂ 8 |
|
1024 |
137 |
log₂(137 / 10) |
log₂ 16 |
Observação: quanto mais próxima a Pontuação de Escalabilidade estiver do valor da Pontuação Teórica de Escalabilidade, melhor será a escalabilidade de desempenho.
Detalhes do resultado da avaliação
Exibe throughput, MFU e latência de iteração para cada modelo nas contagens de GPUs avaliadas no plano de teste atual. O eixo Y representa a contagem de GPUs e o eixo X representa o valor da métrica.
