Implante modelos da Model Gallery, envie seus próprios modelos ou use modelos existentes com ajuste fino, mantendo controle total das configurações.
Etapa 1: Selecione um modelo
Selecione um modelo base ou com ajuste fino em uma das fontes disponíveis.
Fontes de modelos
Escolha modelos pré-treinados na galeria ou modelos já enviados ou ajustados na plataforma.
Modelos disponíveis na galeria: Qwen, GPT, DeepSeek, GLM, internlm, entre outros.
Configuração do modelo e nome de exibição
Tipo de modelo
Modelos base: Escolha um modelo base adequado ao seu caso de uso. Antes de implantar, revise as capacidades, limitações e especificações, incluindo a contagem de parâmetros e o tamanho da janela de contexto.
Modelos com ajuste fino: Modelos personalizados treinados na plataforma sobre um modelo base. Use-os quando precisar de comportamentos específicos para tarefas não oferecidas nativamente pelo modelo base.
Nome de exibição
Rótulo para identificar esta implantação no painel. Deve conter no máximo 64 caracteres.

Etapa 2: Configure os recursos
Defina os recursos de computação e as configurações de implantação do modelo.
Entre em contato para obter desconto >
Configuração de recursos
Região
Escolha uma região próxima aos usuários para minimizar a latência.
Regiões disponíveis: Singapura, Japão, Leste dos EUA, Indonésia, Frankfurt, Hong Kong, Malásia
Tipo de GPU
Selecione um tipo de GPU que atenda aos requisitos de computação do modelo. Os tipos de GPU variam em capacidade de memória e throughput; modelos maiores geralmente exigem GPUs com mais VRAM.
Opções: NVIDIA A10, L20, entre outras.
Se o tipo de GPU necessário estiver indisponível na região preferida, tente outra região ou selecione um tipo de GPU comparável, com desempenho de memória e computação equivalentes.
Réplicas
Defina o número de réplicas a executar nesta implantação.
Réplicas mínimas: Mantenha pelo menos uma réplica em execução contínua para evitar latência de inicialização a frio nas requisições recebidas. Definir esse valor como 0 reduz custos de ociosidade, mas causa atraso na inicialização quando a primeira requisição chega.
Réplicas máximas: Controla quantas réplicas a plataforma pode escalar sob carga, limitando o custo máximo.
Use múltiplas réplicas para distribuir requisições simultâneas entre instâncias, garantindo balanceamento de carga e alta disponibilidade.

Etapa 3: Revise e implante
Revise a configuração e os custos estimados antes de criar a implantação.
Resumo de custos
Custo de computação GPU
Overhead do sistema (atualmente $0)
Nota: Os custos de download e armazenamento do modelo não estão incluídos no resumo de custos.
Solução de problemas
1. Erro 403: As vendas deste recurso estão temporariamente suspensas
403: Sales of this resource are temporarily suspended.
Motivo: O tipo de GPU selecionado está temporariamente indisponível na região atual devido à alta demanda e à insuficiência de recursos.
-
Solução:
Mude para uma região diferente onde o mesmo tipo de GPU esteja disponível.
Se o tipo de GPU estiver indisponível em todas as regiões, selecione um tipo de GPU comparável com especificações semelhantes de memória e computação e tente novamente. Caso o problema persista, entre em contato com nossa equipe de suporte para obter assistência.
2. Erro: A conta possui saldo pendente
Account has an outstanding balance.
Motivo: O saldo da conta é insuficiente para cobrir o custo desta implantação.
-
Solução:
Acesse a seção Billing no painel da conta e adicione fundos ao saldo.
3. Erro: As informações da sua conta estão incompletas
Your account information is incomplete.
Motivo: A conta não concluiu o processo obrigatório de verificação de identidade ou de informações.
-
Solução:
Acesse a página Configurações da Conta Alibaba Cloud e conclua a verificação de identidade.