O Lingjun Intelligent Computing foi desenvolvido para cenários de inteligência artificial e oferece serviços de computação em nuvem pública estáveis, eficientes e altamente extensíveis. O Lingjun suporta dimensionamento de rede de alto desempenho para até 100.000 placas, permitindo que um único job escale para até 10.000 placas. O produto fornece recursos prontos para uso, incluindo gerenciamento de O&M e gestão de jobs de cluster. Ele entrega poder de computação em grande escala e alta densidade para LLM/AIGC, direção autônoma, busca e recomendação, inteligência científica, quantização financeira e outros setores. Combinado com monitoramento abrangente e recuperação automática de falhas, o serviço oferece uma base inovadora que integra alto desempenho, alta extensibilidade e alta estabilidade para seus negócios, garantindo vantagem competitiva na era da IA.
Principais vantagens
-
Cluster de ultra-grande escala para treinamento e inferência integrados
Projetado para LLMs de IA atuais e futuras, este recurso suporta a implantação e o gerenciamento rápidos de clusters com até 100.000 GPUs e é compatível com os principais frameworks de deep learning. O Lingjun adota uma arquitetura de rede de alto desempenho (HPN) para resolver desafios de escalabilidade. Uma rede de camada única suporta extensão na escala de milhares de GPUs, enquanto uma rede de duas camadas suporta extensão na escala de dezenas de milhares de GPUs. Com alta escalabilidade e forte estabilidade, fornece suporte robusto de poder de computação para o desenvolvimento de LLMs na era da AGI.
-
Estável e confiável
Com base em políticas de paralelismo de jobs, a estabilidade é aprimorada por meio de um design de autocura nas interações de serviços em nuvem e otimizações sistemáticas na arquitetura de hardware e no software da camada de plataforma. Isso permite detecção granular de eventos de falha, suportando monitoramento em tempo real e tratamento de status anormais em vários níveis, incluindo zonas de borda, placas GPU e serviços de agendamento. O sistema reduz a probabilidade de falhas e seu escopo de impacto, melhorando a robustez dos jobs. A recuperação de afinidade de falha ocorre em nível de minuto, com taxa de detecção superior a 98%, suportando efetivamente o treinamento de LLMs MoE com trilhões de parâmetros para alcançar mais de 99% de período de validade de treinamento.
-
Combinações flexíveis de armazenamento em múltiplos formatos
Ao utilizar o caminho de acesso a dados de alto throughput e baixa latência do RDMA e o sistema de arquivos paralelo distribuído CPFS, clusters de dezenas de milhares de placas obtêm amostras de treinamento de forma contínua e eficiente durante o processo. Recursos de cache de alto desempenho e baixa latência atendem aos requisitos de cenários como pré-carregamento de dados e armazenamento de checkpoints. Integrado a produtos como EBS e OSS, também atende a necessidades de armazenamento de dados com múltiplas especificações e tipos, incluindo blocos e objetos. Alterne rapidamente entre diferentes modos de acesso ao armazenamento por meio da troca de especificações, sem necessidade de rescindir contrato. O tráfego de armazenamento é separado do tráfego de computação. Há suporte para otimização de comunicação em nível de cluster para checkpoints assíncronos, evitando que o tráfego de armazenamento interfira no tráfego de computação e cause instabilidade na comunicação paralela.
-
Base de poder de computação
Fornece tipos de recursos de computação, incluindo instâncias bare metal (clusters) e instâncias de contêiner, para padronizar e escalar recursos de computação de IA. As instâncias bare metal oferecem capacidades equivalentes de comunicação e interconexão. Combinadas com CPUs de última geração, disponibilizam amplos recursos de disco local com suporte a GPU Direct Storage. Suportam interfaces Kubernetes padronizadas e soluções de rede de contêineres, podendo integrar contêineres seguros para virtualizar recursos de computação, armazenamento e rede. Isso entrega poder de computação inteligente agrupado para aplicações de plataforma de camada superior, com melhorias na utilização de recursos de até 3x em alguns cenários.
Recursos
Suporte à inovação contínua de IA com poder de computação paralela de dez mil placas
-
Cenários comuns
O Intelligent Computing Lingjun foi projetado para cenários futuros de computação paralela de IA, incluindo treinamento de modelos fundamentais em grande escala, treinamento e ajuste fino de modelos multimodais MoE e inferência paralela de modelos com até trilhões de parâmetros. Entregando centenas de exaflops (EFLOPS) de desempenho de ponto flutuante por segundo, seu design integrado de hardware e software proporciona maior desempenho e estabilidade dentro do mesmo espaço físico. Suporta inovação contínua em modelos fundamentais, direção autônoma, inteligência científica, fintech, busca e recomendação, entre outras indústrias.
-
Arquitetura não convergente de ultra-grande escala
Focada no desempenho de aplicações de IA e na estabilidade de jobs, esta arquitetura implementa controle de congestionamento de rede baseado em largura de banda física e topologia, combinando bibliotecas de comunicação para otimizar a carga de tráfego. A latência ponta a ponta chega a apenas 2 μs. Por meio da colaboração entre extremidade e rede, o cluster é otimizado sistematicamente em termos de design de arquitetura, topologia de rede, seleção de caminho e limitação de fluxo para alcançar extensão linear em ultra-grande escala. Isso entrega mais de 96% de grau de extensão explícita na escala de 10.000 GPUs com operação estável da rede em estado estacionário, suportando simultaneamente extensão convergente Scale-up & Scale-out em nível de cluster de 100.000 GPUs. Os recursos de intercâmbio de dados e interconexão dentro do cluster são coordenados, aproximando-se dos limites de desempenho de throughput por meio de ajustes sistemáticos para melhorar a robustez do sistema.
-
Regiões disponíveis
O Intelligent Computing Lingjun está disponível nas seguintes regiões: China (Hangzhou), China (Pequim), China (Xangai), China (Shenzhen), China (Guangzhou), China (Zhongwei), China (Hohhot), China (Zhangjiakou), China (Ulanqab), China (Heyuan), Hong Kong (China), Singapura, Japão (Tóquio), EUA (Atlanta), Alemanha (Frankfurt), Malásia (Johor), Malásia (Kuala Lumpur), Emirados Árabes Unidos (Dubai) e Tailândia (Bangkok). O serviço suporta os modelos de faturamento assinatura (período fixo) e pagamento conforme o uso. É necessário solicitar o uso de recursos junto à equipe de vendas da Alibaba Cloud.
Instâncias de computação inteligente de alto desempenho
-
Suporte a diversos tipos de placas GPU nas instâncias de computação acelerada do Lingjun
O Intelligent Computing Lingjun é um serviço de cluster bare metal voltado para cenários de computação acelerada. Baseado em instâncias de computação heterogênea do Lingjun, conta com GPUs (Unidades de Processamento Gráfico), interconexões de alta velocidade entre chips e interconexões de rede de alta velocidade. A arquitetura geral é projetada em torno da dimensão de domínio Scale-up: todas as GPUs dentro de uma instância de computação acelerada do Lingjun compartilham interconexões de alta velocidade entre chips, e cada placa GPU suporta comunicação de interconexão equivalente a RDMA na dimensão do cluster. Adicionalmente, as instâncias suportam implantação balanceada de GPUs, NVMe local e placas de interface de rede RDMA de alto desempenho, habilitando recursos como afinidade NUMA.
-
Suporte padronizado a Kubernetes e instâncias de contêiner Serverless com otimização para cenários de IA
A implantação do cluster já vem pronta. Utilize poder de computação GPU conteinerizado por meio de instâncias de contêiner ACS Serverless e serviços de cluster Kubernetes conforme necessário. O Kubernetes realiza a abstração e orquestração de recursos heterogêneos, como CPUs e GPUs. Para cenários de IA, o produto oferece aprimoramentos que incluem otimização de operadores, separação de PD, implantação paralela de EP com balanceamento de carga e agendamento consciente de cache. Também há suporte para montagem de armazenamento e uso de rede sob demanda.
-
Acesso a armazenamento de dados de alto desempenho
Para atender aos requisitos extremos de carregamento de dados em cenários de treinamento, como armazenamento rápido de checkpoints e serviços de computação inteligente, o Intelligent Computing Lingjun permite a montagem flexível de armazenamento de arquivos distribuídos de alto desempenho (CPFS) baseado em RDMA. Também suporta capacidades de offloading de endpoint VPC/EBS para garantir a interoperabilidade padrão entre produtos em nuvem.
Gerenciamento automatizado de cluster
-
Interação com filtros multidimensionais e gerenciamento automatizado de cluster
O Intelligent Computing Lingjun permite atribuir zonas de borda bare metal do Lingjun e utilizar recursos de agendamento de pool de recursos. O cluster suporta o uso de produtos Kubernetes nativos da Alibaba Cloud, como ACK para gerenciamento de clusters de contêineres, CPFS como armazenamento paralelo de arquivos de alto desempenho, EBS para discos de sistema e dados, PAI como plataforma de inteligência artificial e ARMS Prometheus para monitoramento. Todo o procedimento de implantação do cluster é concluído com um clique, deixando clusters de computação inteligente de alto desempenho prontos em minutos.
-
Sistema automático de recuperação de falhas garante estabilidade em jobs de computação paralela
O sistema de recuperação automática de falhas do Lingjun baseia-se em um framework de monitoramento abrangente, oferecendo capacidades de proteção ao cliente e processamento automatizado de autocura que cobrem falhas multidimensionais no SO do Lingjun, GPU, rede de alto desempenho, DPU, entre outros. Políticas granulares de consumo de falhas e migração a frio automática minimizam o tempo de inatividade do usuário. O Lingjun também possui uma plataforma de inspeção automatizada para avaliar a saúde geral dos clusters de computação inteligente. Ela fornece detecção periódica e multidimensional do status de saúde do cluster, abrangendo poder de computação heterogêneo de GPU e comunicação coletiva entre nós, suportando detecção contínua em vários modos, incluindo testes de nó único, nó duplo e cluster multinó. Isso proporciona prevenção proativa real (reduzindo a probabilidade de falhas) e tolerância a falhas pós-incidente (melhorando a eficiência na resolução de problemas e reduzindo a perda de poder de computação durante o treinamento), avançando progressivamente para uma estratégia de falhas shift-left.
Monitoramento abrangente de cluster
-
Capacidades de observabilidade e O&M
O Lingjun disponibiliza um painel de dados de monitoramento no console, incluindo recursos de computação heterogênea de GPU, monitoramento e alertas de rede RDMA de alto desempenho em nível de segundo e capacidades de localização de falhas. Também suporta exibição de logs operacionais e jobs de O&M, além de informações sobre recursos e ambiente, dando visibilidade completa ao usuário sobre o uso de recursos e o status de execução de todo o cluster. Com base nesses dados de monitoramento, o Lingjun oferece recursos básicos de O&M via interface gráfica, como reinicialização do sistema, diagnóstico de O&M de cluster e nó, além de funcionalidades de terminal web.
Compra e faturamento
Compra do produto: Faça login no console do Lingjun para adquirir recursos de zona de borda. Para mais informações, consulte Comprar um nó do Lingjun.
Faturamento do produto: O Intelligent Computing Lingjun suporta os métodos de faturamento assinatura (período fixo) e pagamento conforme o uso. Para mais detalhes, consulte Faturamento do produto.
Uso
Após adquirir nós de computação do Lingjun, crie um cluster para utilizar os recursos. Para instruções detalhadas, consulte Criar um cluster básico do Lingjun.