Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Instalar o conjunto de IA

Última atualização: Jun 27, 2026

O conjunto de IA nativa da nuvem adiciona recursos de agendamento, aceleração de dados, orquestração de fluxo de trabalho e monitoramento aos clusters do Container Service for Kubernetes (ACK) para cargas de trabalho de IA e machine learning. Implante o conjunto pelo console do ACK e, opcionalmente, configure consoles de IA, backends de armazenamento de dados e mecanismos de fluxo de trabalho.

Pré-requisitos

Antes de começar, verifique se você tem:

Implantar o conjunto

  1. Acesse o console do ACK. No painel de navegação à esquerda, clique em Clusters.

  2. Na página Clusters, localize seu cluster e clique no nome dele. No painel à esquerda, escolha Applications > Cloud-native AI Suite.

  3. Na página Cloud-native AI Suite, clique em Deploy.

  4. Na página de implantação, selecione os componentes a instalar. Para detalhes sobre os componentes e compatibilidade com o cluster, consulte Referência de componentes.

    Se você selecionar Kube Queue , Console e Kubeflow Pipelines simultaneamente, a opção Arena será obrigatória.
  5. Clique em Deploy Cloud-native AI Suite. O sistema executa automaticamente uma verificação de ambiente e dependências e implanta os componentes selecionados após a aprovação.

Referência de componentes

A tabela a seguir lista todos os componentes, seus namespaces e os tipos de cluster compatíveis.

Configuração

Componente

Namespace

ACK Pro

ACK Serverless Pro

ACK Edge Pro

Elasticity

ack-alibaba-cloud-metrics-adapter

kube-system

Sim

Não

Sim

Acceleration (Aceleração de dados Fluid)

ack-fluid

fluid-system

Sim

Sim

Sim

Scheduling (agendamento de tarefas em lote, compartilhamento de GPU, agendamento de GPU ciente de topologia e agendamento de NPU)

ack-ai-installer

kube-system

Sim

Não

Sim

Kube Queue

ack-kube-queue

kube-queue

Sim

Sim

Sim

Arena (CLI)

ack-arena

kube-system

Sim

Sim

Sim

Console (Platform for AI)

ack-pai

pai-system

Sim

Não

Sim

Console (AI Dashboard)

ack-ai-dashboard

kube-ai

Sim

Não

Sim

Console (AI Developer Console)

ack-ai-dev-console

kube-ai

Sim

Não

Sim

Console Data Storage

ack-mysql

kube-ai

Sim

Não

Sim

Workflow (Kubeflow Pipelines)

ack-ai-pipeline

kube-ai

Sim

Não

Sim

Monitoring

ack-arena-exporter

kube-ai

Sim

Não

Sim

O ack-pai integra algoritmos e mecanismos otimizados pela Platform for AI (PAI), incluindo Data Science Workshop (DSW), Deep Learning Containers (DLC) e Elastic Algorithm Service (EAS). Esse componente melhora a elasticidade e a eficiência no desenvolvimento, treinamento e inferência de modelos de IA.

Para configurar parâmetros personalizados dos componentes de Scheduling, clique em Advanced na página de implantação.

Após a instalação, configure o cliente Arena separadamente se tiver selecionado Arena. Para mais informações, consulte Configurar o cliente Arena.

Para obter mais detalhes sobre componentes específicos, consulte Aceleração de dados Fluid, ack-ai-installer, ack-kube-queue e ack-ai-pipeline.

Configurar o console de IA

A partir de 22 de janeiro de 2025, o console de IA (AI Dashboard e AI Developer Console) está disponível apenas para usuários incluídos na lista de permissões. As implantações existentes antes dessa data não são afetadas. Usuários fora da lista de permissões podem instalar e configurar o console de IA pela comunidade open-source. Para mais informações, consulte data-on-ack .

Autorizar o console de IA

  1. Na seção Ecosystem Tools da página de implantação, selecione Console. Uma caixa de diálogo Note será exibida.

    • Se o status de autorização exibir Authorized, pule para Selecionar um método de acesso.

    • Caso o status de autorização mostre Unauthorized em vermelho e o botão OK esteja indisponível, conclua as etapas de autorização abaixo.

  2. Crie uma política personalizada no Resource Access Management (RAM).

    1. Acesse o console do RAM. No painel de navegação à esquerda, escolha Permissions > Policies.

    2. Clique em Create Policy.

    3. Na aba JSON, insira o seguinte conteúdo de política e clique em OK. Nomeie a política como k8sWorkerRolePolicy-{ClusterID}.

       {
          "Version": "1",
          "Statement": [
              {
                  "Effect": "Allow",
                  "Action": [
                      "cs:*",
                      "log:GetProject",
                      "log:GetLogStore",
                      "log:GetConfig",
                      "log:GetMachineGroup",
                      "log:GetAppliedMachineGroups",
                      "log:GetAppliedConfigs",
                      "log:GetIndex",
                      "log:GetSavedSearch",
                      "log:GetDashboard",
                      "log:GetJob",
                      "ecs:DescribeInstances",
                      "ecs:DescribeSpotPriceHistory",
                      "ecs:DescribePrice",
                      "eci:DescribeContainerGroups",
                      "eci:DescribeContainerGroupPrice",
                      "log:GetLogStoreLogs",
                      "ims:CreateApplication",
                      "ims:UpdateApplication",
                      "ims:GetApplication",
                      "ims:ListApplications",
                      "ims:DeleteApplication",
                      "ims:CreateAppSecret",
                      "ims:GetAppSecret",
                      "ims:ListAppSecretIds",
                      "ims:ListUsers"
                  ],
                  "Resource": "*"
              }
          ]
      }
  3. Anexe a política personalizada à função RAM do cluster.

    1. No console do RAM, no painel de navegação à esquerda, escolha Identities > Roles.

    2. Pesquise a função chamada KubernetesWorkerRole-{ClusterID}. Clique em Grant Permission na coluna Actions.

    3. No painel Grant Permission, pesquise a política personalizada k8sWorkerRolePolicy-{ClusterID}.

    4. Selecione a política e clique em Grant permissions.

  4. Retorne à caixa de diálogo Note no console do ACK e clique em Authorization Check. O status mudará para Authorized e o botão OK ficará disponível.

Selecionar um método de acesso

Na caixa de diálogo Note, selecione um método de acesso e clique em OK.

Método de acesso

Uso recomendado

Observações

Private IP

Produção

Acessa o console pela rede interna

Internal Domain

Produção

Utiliza um nome de domínio privado

Public Domain

Apenas testes

Adicione um mapeamento de host entre o nome de domínio público e o endereço IP público da instância SLB do NGINX Ingress ao seu arquivo hosts local

Para mais informações sobre como acessar o console por uma rede privada, consulte Acessar o console de operações de IA.

Configurar o armazenamento de dados do console

Ao selecionar Console em Interaction Mode, a opção Console Data Storage aparecerá. Escolha um dos seguintes métodos de armazenamento.

MySQL pré-instalado (apenas testes)

Se você não selecionar ApsaraDB RDS, o cluster usará um banco de dados MySQL integrado por padrão.

Importante

Esta opção é recomendada apenas para testes. Em caso de falha no cluster ou perda de armazenamento, poderá haver perda de dados.

Ao implantar este componente, o conjunto de IA nativa da nuvem cria um disco de 120 GB como um PersistentVolumeClaim (PVC) usando a StorageClass. O ACK não gerencia o ciclo de vida do disco. Exclua o disco manualmente quando ele não for mais necessário. Para mais informações, consulte Liberar um disco.

ApsaraDB RDS (produção)

Utilize o ApsaraDB RDS para cargas de trabalho de produção.

Se ocorrer um erro de conexão, consulte Solucionar problemas de falhas de conexão de instância .
Para alterar o método de armazenamento de dados posteriormente, desinstale e reinstale o conjunto de IA nativa da nuvem. Caso exista um Secret chamado kubeai-rds no namespace kube-ai , exclua-o antes de reinstalar.
  1. Adquira uma instância do ApsaraDB RDS e crie um banco de dados e uma conta. Para mais informações, consulte Início rápido do ApsaraDB RDS. Para detalhes de faturamento, veja Visão geral do faturamento.

  2. Clique em Deploy Cloud-native AI Suite na parte inferior da página de implantação.

  3. No console do ACK, clique no nome do cluster. No painel de navegação à esquerda, escolha Configurations > Secrets.

  4. Na lista suspensa Namespace, selecione kube-ai.

  5. Clique em Create from YAML.

  6. Insira o seguinte modelo YAML para criar um Secret chamado kubeai-rds e clique em Create.

    Parâmetro

    Descrição

    MYSQL_HOST

    O endpoint de conexão da sua instância do ApsaraDB RDS

    MYSQL_DB_NAME

    O nome do banco de dados criado

    MYSQL_USER

    O nome de usuário da conta do banco de dados

    MYSQL_PASSWORD

    A senha da conta do banco de dados

       apiVersion: v1
       kind: Secret
       metadata:
         name: kubeai-rds
         namespace: kube-ai
       type: Opaque
       stringData:
         MYSQL_HOST: "Your RDS endpoint"
         MYSQL_DB_NAME: "Database name"
         MYSQL_USER: "Database username"
         MYSQL_PASSWORD: "Database password"

Configurar o armazenamento de dados do fluxo de trabalho

Se você escolher Kubeflow Pipelines como mecanismo de fluxo de trabalho, a opção Workflow Data Storage será exibida. Selecione um dos métodos de armazenamento a seguir.

MinIO pré-instalado (apenas testes)

Caso não selecione OSS, o cluster utilizará uma instância integrada do MinIO por padrão.

Importante

Esta opção é recomendada apenas para testes. Se houver falha no cluster ou perda de armazenamento, os dados poderão ser perdidos.

Ao implantar este componente, o conjunto de IA nativa da nuvem cria um disco de 20 GB como um PVC usando a StorageClass. O ACK não gerencia o ciclo de vida do disco. Exclua o disco manualmente quando não for mais necessário. Para mais informações, consulte Liberar um disco.

Object Storage Service (testes e produção)

Use o Object Storage Service (OSS) para armazenamento persistente e escalável de dados de fluxo de trabalho.

  1. Se o namespace kube-ai não existir, crie-o:

    O namespace kube-ai é criado automaticamente quando você implanta o conjunto de IA nativa da nuvem. Verifique se ele já existe antes de criá-lo.
       kubectl create ns kube-ai
  2. No console do ACK, clique no nome do cluster. No painel de navegação à esquerda, escolha Configurations > Secrets.

  3. Na lista suspensa Namespace, selecione kube-ai.

  4. Clique em Create from YAML.

  5. Insira o seguinte modelo YAML e clique em Create. Isso criará um Secret chamado kubeai-oss.

    Parâmetro

    Descrição

    ENDPOINT

    O endpoint do OSS para sua região. O exemplo usa o endpoint da China (Pequim). Para a lista completa, consulte Regiões e endpoints do OSS

    ACCESS_KEY_ID

    O AccessKey ID de um usuário RAM com a permissão AliyunOSSFullAccess. Para mais informações, consulte Criar um par de AccessKey

    ACCESS_KEY_SECRET

    O AccessKey secret do usuário RAM

       apiVersion: v1
       kind: Secret
       metadata:
         name: kubeai-oss
         namespace: kube-ai
       type: Opaque
       stringData:
         ENDPOINT: "https://oss-cn-beijing.aliyuncs.com"
         ACCESS_KEY_ID: "****"
         ACCESS_KEY_SECRET: "****"
  6. Após criar o Secret, verifique se um bucket chamado mlpipeline-<clusterid> aparece no console do OSS. Isso confirma que o OSS está configurado como armazenamento de dados do fluxo de trabalho. Para informações sobre faturamento do OSS, consulte Visão geral do faturamento.

  7. Retorne à página de implantação do conjunto de IA nativa da nuvem e instale o componente Kubeflow Pipelines.

Verificar a implantação

Após a implantação, confirme se os componentes estão em execução:

  1. No console do ACK, clique no nome do cluster. No painel à esquerda, escolha Applications > Cloud-native AI Suite. A lista de componentes exibe todos os itens instalados com seus respectivos nomes e versões.

  2. Confirme se cada componente apresenta um status indicando implantação bem-sucedida. Execute operações de Deploy e Uninstall em componentes individuais. Caso haja uma versão mais recente disponível para um componente instalado, realize também uma operação de Upgrade.

  3. Se você instalou os consoles de IA, clique em AI Dashboard ou AI Developer Console no canto superior esquerdo da página Cloud-native AI Suite para verificar o acesso.