O PAI acelera o treinamento e a inferência de IA com cache de conjuntos de dados, treinamento distribuído e ferramentas de otimização de modelos.
Ferramentas de aceleração
O PAI oferece ferramentas de aceleração para cada etapa do fluxo de trabalho de IA:
|
Ferramenta |
Etapa |
Descrição |
|
EPL |
Treinamento |
Framework de treinamento distribuído em larga escala para TensorFlow. Compatível com paralelismo de dados, divisão de operadores, pipeline e paralelismo automático. |
|
PAI-Megatron-Patch |
Treinamento |
Acelera o treinamento de Transformers no PyTorch ao integrar técnicas de otimização a bibliotecas de modelos Transformer. |
|
PAI-Blade |
Inferência |
Otimização de inferência de uso geral para TensorFlow e PyTorch em GPUs, CPUs e dispositivos de borda. Aplica otimização de grafos, otimização de compilador de IA, precisão mista e compressão automática com uma única chamada de API. |
|
BladeLLM |
Inferência |
Motor de inferência de alto desempenho para grandes modelos de linguagem (LLMs). Otimiza a implantação com quantização de modelos, batching eficiente e gerenciamento de memória da GPU. |
|
Aceleração de cache local |
Carregamento de dados |
Armazena conjuntos de dados em cache nos nós de computação Lingjun para eliminar leituras repetidas do armazenamento remoto durante treinamentos com múltiplas épocas. Compatível com armazenamento OSS e CPFS. |
Primeiros passos
Escolha uma ferramenta conforme seu objetivo de otimização.
-
EPL
Framework de treinamento distribuído para TensorFlow com paralelismo automático. EPL para aceleração de treinamento distribuído.
-
PAI-Megatron-Patch
Otimiza o treinamento de Transformers no PyTorch com opções de aceleração. Aceleração de treinamento de Transformers (PAI-Megatron-Patch).
-
PAI-Blade
Otimização de inferência de uso geral que combina otimização de grafos, precisão mista e compressão. Visão geral da aceleração de inferência (Blade).
-
BladeLLM
Motor de inferência de LLMs de alto desempenho com quantização e batching eficiente. Motor de inferência de LLMs (BladeLLM).
-
Aceleração de cache local
Armazena conjuntos de dados em cache nos nós de computação Lingjun para acelerar treinamentos com múltiplas épocas. Aceleração de cache local.
Tutoriais práticos: Casos de uso de aceleração de IA.