Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Visão geral da execução de jobs de treinamento de modelos no Kubernetes

Última atualização: Jun 27, 2026

Execute jobs de treinamento autônomo do TensorFlow

Execute jobs de treinamento autônomo do TensorFlow em clusters do Container Service for Kubernetes (ACK). O ACK oferece recursos de gerenciamento para implantar e executar rapidamente esses jobs. Este tópico descreve como crie jobs de treinamento, configure recursos e executá-los. Consulte este conteúdo para começar a usar o treinamento autônomo do TensorFlow. Para obter mais informações, consulte Usar o Arena para envie jobs de treinamento autônomo do TensorFlow em um cluster Kubernetes.

Execute jobs de treinamento distribuído do TensorFlow

Execute jobs de treinamento distribuído do TensorFlow em clusters ACK. Aproveite os recursos de computação paralela do ACK em vários nós para aumentar a velocidade e a eficiência do treinamento distribuído. Este tópico apresenta termos básicos relacionados ao treinamento distribuído de modelos, descreve como configure um cluster para essa finalidade e explica como execute jobs de treinamento distribuído do TensorFlow em clusters ACK. Utilize estas informações para otimizar o desempenho dos seus jobs. Para obter mais informações, consulte Usar o Arena para envie jobs de treinamento distribuído do TensorFlow em um cluster Kubernetes.

Use o Arena para envie jobs de treinamento autônomo do PyTorch

O Arena é uma ferramenta projetada para simplificar o envio de tarefas de machine learning (ML). Use o Arena para envie jobs de treinamento autônomo do PyTorch no Kubernetes. Este tópico descreve como instale e configure o Arena e como usá-lo para envie jobs de treinamento autônomo do PyTorch. Execute comandos simples para envie e gerencie esses jobs e melhorar a eficiência do treinamento. Para obter mais informações, consulte Usar o Arena para envie jobs de treinamento autônomo do PyTorch.

Use o Arena para envie jobs de treinamento distribuído do PyTorch

Use o Arena para envie jobs de treinamento distribuído do PyTorch no Kubernetes. Este tópico descreve como usar o Arena para envie um job de treinamento distribuído do PyTorch executado em vários nós de um cluster Kubernetes. Modifique os parâmetros do job de treinamento para implementar o treinamento paralelo de modelos em um ambiente distribuído. Essa abordagem aumenta a eficiência do treinamento e possibilita o uso de modelos maiores. Para obter mais informações, consulte Usar o Arena para envie jobs de treinamento distribuído do PyTorch.

Treinamento elástico de modelos

Ative o treinamento elástico de modelos no ACK com base em recursos de computação escaláveis. Ajuste dinamicamente a quantidade de recursos de computação alocados aos jobs de treinamento conforme as cargas de trabalho reais. Este tópico descreve os benefícios do treinamento elástico de modelos, incluindo dimensionamento sob demanda, melhoria na utilização de recursos e otimização de custos. Configure políticas de treinamento elástico para gerencie e utilizar recursos de computação de maneira flexível e eficiente. Para obter mais informações, consulte Treinamento elástico de modelos no Kubernetes.

Execute jobs de treinamento distribuído com DeepSpeed

DeepSpeed é um framework usado para otimizar jobs de deep learning. Execute jobs de treinamento distribuído com DeepSpeed no Kubernetes. Este tópico apresenta os principais recursos do DeepSpeed, incluindo treinamento automático de precisão mista, fragmentação de modelos e otimizadores de modelos. Além disso, descreve como usar o DeepSpeed para envie jobs de treinamento distribuído em um cluster ACK. Consulte este conteúdo para melhorar a eficiência do treinamento de modelos e treinar modelos em grande escala. Para obter mais informações, consulte Treinamento distribuído com DeepSpeed.

Resumo

  • Treinamento autônomo do TensorFlow: orienta a execução de jobs de treinamento autônomo do TensorFlow no Kubernetes.

  • Treinamento distribuído do TensorFlow: fornece diretrizes para execute jobs de treinamento distribuído do TensorFlow no Kubernetes.

  • Arena: apresenta instruções sobre como usar o Arena para envie jobs de treinamento autônomo e distribuído do PyTorch, simplificando a implantação e o gerenciamento desses jobs.

  • Treinamento elástico de modelos: detalha como ative o treinamento elástico com base na capacidade de dimensionamento do Kubernetes para melhorar a utilização de recursos e reduzir custos.

  • Treinamento distribuído com DeepSpeed: orienta o uso do DeepSpeed para otimizar o treinamento distribuído e treinar modelos em grande escala.

Os recursos e ferramentas mencionados oferecem suporte abrangente para a execução eficiente de jobs de ML e deep learning no Kubernetes. Eles ajudam a melhorar a eficiência do treinamento, otimizar a utilização de recursos e reduzir custos operacionais.