Todos os produtos
Search
Central de documentação

Function Compute:Tipos e especificações de instância

Última atualização: Jun 29, 2026

Instâncias básicas de CPU geralmente atendem a cenários de computação de uso geral no Function Compute, como serviços web e processamento de dados. No entanto, para cargas que exigem computação paralela em larga escala ou deep learning — como processamento de áudio e vídeo, inferência de inteligência artificial (IA) e edição de imagens —, as instâncias aceleradas por GPU aumentam significativamente a eficiência computacional.

Para instâncias GPU, o Function Compute oferece três tipos: instâncias elásticas, instâncias provisionadas e instâncias provisionadas + elásticas (modo misto). Selecione o tipo e as especificações mais adequados às necessidades do seu negócio para garantir operações estáveis, maximizar a utilização de recursos e otimizar o desempenho.

Seleção do tipo de instância

Funções de CPU aceitam apenas Instâncias Elásticas. Funções de GPU suportam três tipos de instância; alterne entre eles a qualquer momento sem interrupção do serviço.

Guia de decisão

Use as perguntas abaixo para identificar o tipo ideal de instância:

  • A carga de trabalho é sensível a latência e interativa? Por exemplo, um chatbot em tempo real ou uma API de geração de imagens. Em caso afirmativo, use Instâncias Provisionadas para eliminar cold starts e garantir tempos de resposta consistentes.

  • O tráfego segue uma linha de base previsível com picos ocasionais? Nesse cenário, adote o Modo Misto (Instâncias Provisionadas + Elásticas) para manter uma capacidade de base estável e absorver rajadas de tráfego.

  • O tráfego é variável, irregular ou de baixa frequência? Se sim, opte por Instâncias Elásticas e pague apenas pelo uso ativo.

Comparação entre tipos de instância

Instância Elástica

Instância Provisionada

Provisionada + Elástica (Modo Misto)

Aplica-se a

Funções de CPU (única opção); Funções de GPU

Apenas Funções de GPU

Apenas Funções de GPU

Cold start

Sim, se o mínimo de instâncias for 0. Defina o mínimo de instâncias como 1 ou mais para pré-alocar recursos e reduzir cold starts.

Nenhum. Todas as requisições dentro da capacidade alocada recebem resposta em tempo real.

Parcial. Requisições atendidas pelo pool provisionado não sofrem cold start; instâncias elásticas adicionais sim.

Modelo de faturamento

Pagamento conforme o uso

Assinatura

Assinatura (parte provisionada) + pagamento conforme o uso (parte elástica)

Mais indicado para

Tráfego variável ou de baixa frequência; cargas sensíveis a custo

Cargas sensíveis a latência ou com tráfego estável

Cargas com linha de base previsível e picos de tráfego imprevisíveis

Instância Elástica

As Instâncias Elásticas escalam automaticamente conforme o volume de requisições e são liberadas quando ociosas. Definir o número mínimo de instâncias como 0 adota um modelo puro de pagamento conforme o uso: você paga apenas pelo consumo ativo.

Comportamento de cold start: Cold starts ocorrem quando as instâncias escalam a partir de zero. Para reduzir a latência de cold start, defina o número mínimo de instâncias como 1 ou mais. Essa configuração pré-aloca recursos elásticos e permite que as instâncias atendam rapidamente às requisições recebidas.

Faturamento: Os custos incluem cobranças por instâncias nos estados ativo e de Hibernação Leve. Na Hibernação Leve, os recursos de vCPU não são cobrados e os recursos de GPU são faturados a um quinto da tarifa ativa. Se definir o número mínimo de instâncias como 1 ou mais, ative a Hibernação Leve para reduzir custos de ociosidade.

Use Instâncias Elásticas quando:

  • O tráfego for variável, irregular ou de baixa frequência

  • Você quiser pagar apenas pelo uso efetivo

  • A carga de trabalho tolerar latência ocasional de cold start (ou você a mitigar com um número mínimo de instâncias)

Instância Provisionada

Instâncias Provisionadas aplicam-se exclusivamente a Funções de GPU. Adquira antecipadamente um Pool de Recursos Provisionados e aloque um número e tipo específicos de instâncias à sua função. Essa abordagem elimina cold starts dentro da capacidade alocada e proporciona custos fixos e previsíveis.

Após adquirir um pool de recursos provisionados mensal, a plataforma fornece uma cota adicional de instâncias de reforço sem custo extra.

Comportamento de cold start: Nenhum. Todas as requisições dentro da capacidade alocada recebem resposta em tempo real. Máximo de requisições simultâneas = (Número de Instâncias Provisionadas alocadas) × (Concorrência da instância) + cota de instâncias de reforço. Requisições que excederem esse limite serão limitadas (throttled).

Faturamento: Taxa total de assinatura de todos os Pools de Recursos Provisionados adquiridos. Instâncias de reforço não são faturadas.

Instâncias Provisionadas estão disponíveis apenas para Funções de GPU nas séries Ada, Ada.2, Ada.3, Hopper ou Xpu.1.

Use Instâncias Provisionadas quando:

  • A carga de trabalho for sensível a latência e interativa (por exemplo, um chatbot em tempo real ou uma API de geração de imagens)

  • O tráfego for constante e previsível

  • For necessária capacidade garantida e tempos de resposta consistentes

Instâncias Provisionadas + Elásticas (Modo Misto)

O Modo Misto aplica-se apenas a Funções de GPU. Ele combina Instâncias Provisionadas e Elásticas: o pool provisionado atende primeiro ao tráfego de estado estacionário, e as instâncias elásticas escalam automaticamente quando as requisições excedem a capacidade provisionada. Isso garante uma linha de base assegurada com flexibilidade para absorver picos repentinos de tráfego.

Comportamento de cold start: Parcial. Requisições atendidas dentro do pool provisionado não sofrem cold start. Requisições que acionam o Auto Scaling para novas instâncias elásticas passam por um cold start.

Faturamento: A parte provisionada é debitada da cota do Pool de Recursos Provisionados adquirido. Instâncias elásticas iniciadas além da cota provisionada são faturadas no modelo de pagamento conforme o uso, com as mesmas tarifas das instâncias elásticas ativas e em Hibernação Leve.

Adote o Modo Misto quando:

  • O tráfego tiver uma linha de base previsível, mas com picos ocasionais

  • For desejado desempenho estável para carga normal, com capacidade de lidar com tráfego em rajadas

  • For necessário equilíbrio entre previsibilidade de custos e flexibilidade de dimensionamento

Especificações de instância

  • Instâncias de CPU

    vCPU (core)

    Tamanho da memória (MB)

    Tamanho máximo do pacote de código (GB)

    Duração máxima de execução da função (s)

    Tamanho máximo do disco (GB)

    Largura de banda máxima (Gbps)

    0,05 a 16

    Nota: O valor deve ser múltiplo de 0,05.

    128 a 32768

    Nota: O valor deve ser múltiplo de 64.

    10

    86400

    10

    Valores válidos:

    • 512 MB. Este é o valor padrão.

    • 10 GB.

    5

    Nota

    A proporção entre vCPUs e tamanho da memória (em GB) deve estar entre 1:1 e 1:4.

  • Especificações de hardware de instâncias GPU

    Tipo de instância

    Memória da GPU

    Poder de computação FP16

    Poder de computação FP32

    Máximo de placas por instância

    fc.gpu.tesla.1

    16 GB

    65 TFLOPS

    8 TFLOPS

    4 placas

    fc.gpu.ampere.1

    24 GB

    125 TFLOPS

    31,2 TFLOPS

    8 placas

    fc.gpu.ada.1

    48 GB

    119 TFLOPS

    60 TFLOPS

    fc.gpu.ada.2

    24 GB

    166 TFLOPS

    83 TFLOPS

    fc.gpu.ada.3

    48 GB

    148 TFLOPS

    73,5 TFLOPS

    fc.gpu.hopper.1

    96 GB

    148 TFLOPS

    44 TFLOPS

    fc.gpu.hopper.2

    141 GB

    148 TFLOPS

    44 TFLOPS

    fc.gpu.blackwell.1

    32 GB

    104,8 TFLOPS

    104,8 TFLOPS

    fc.gpu.xpu.1

    96 GB

    123 TFLOPS

    61,5 TFLOPS

    16 placas

  • Regras de configuração de vCPU e memória para instâncias GPU

    Nota

    Fórmula para recursos multiplaca: Total de vCPUs = vCPUs por placa × Número de placas, e Memória total = Memória por placa × Número de placas.

    Tipo de instância

    vCPU (por placa)

    Faixa de memória por placa

    Incremento de memória

    fc.gpu.tesla.1

    4 núcleos

    4 a 16 GB (4.096 a 16.384 MB)

    4 GB (4.096 MB)

    8 núcleos

    8 a 32 GB (8.192 a 32.768 MB)

    16 núcleos

    16 a 64 GB (16.384 a 65.536 MB)

    fc.gpu.ampere.1

    8 núcleos

    8 a 32 GB (8.192 a 32.768 MB)

    16 núcleos

    16 a 32 GB (16.384 a 32.768 MB)

    fc.gpu.ada.1

    fc.gpu.ada.2

    fc.gpu.ada.3

    4 núcleos

    16 a 32 GB (16.384 a 32.768 MB)

    8 núcleos

    32 a 64 GB (32.768 a 65.536 MB)

    16 núcleos

    64 a 120 GB (65.536 a 122.880 MB)

    fc.gpu.hopper.1

    4 núcleos

    16 a 32 GB (16.384 a 32.768 MB)

    8 núcleos

    32 a 64 GB (32.768 a 65.536 MB)

    16 núcleos

    64 a 96 GB (65.536 a 98.304 MB)

    24 núcleos

    96 a 120 GB (98.304 a 122.880 MB)

    fc.gpu.hopper.2

    4 núcleos

    16 a 32 GB (16.384 a 32.768 MB)

    8 núcleos

    32 a 64 GB (32.768 a 65.536 MB)

    16 núcleos

    64 a 128 GB (65.536 a 131.072 MB)

    24 núcleos

    96 a 248 GB (98.304 a 253.952 MB)

    fc.gpu.blackwell.1

    4 núcleos

    16 a 32 GB (16.384 a 32.768 MB)

    8 núcleos

    32 a 64 GB (32.768 a 65.536 MB)

    16 núcleos

    64 a 120 GB (65.536 a 122.880 MB)

    24 núcleos

    96 a 184 GB (98.304 a 188.416 MB)

    fc.gpu.xpu.1

    4 núcleos

    16 a 48 GB (16.384 a 49.152 MB)

    8 núcleos

    32 a 96 GB (32.768 a 98.304 MB)

    12 núcleos

    48 a 120 GB (49.152 a 122.880 MB)

  • Instâncias aceleradas por GPU também suportam as seguintes especificações de recursos.

    Tamanho da imagem (GB)

    Duração máxima de execução da função (s)

    Tamanho do disco

    Largura de banda máxima (Gbps)

    ACR Enterprise Edition (Standard Edition): 15

    ACR Enterprise Edition (Premium Edition): 15

    ACR Enterprise Edition (Basic Edition): 15

    ACR Personal Edition (Free): 15

    86400

    • 512 MB

    • 10 GB a 200 GB, em incrementos de 10 GB

    5

    Nota
    • Definir o tipo de instância como g1 equivale a defini-lo como fc.gpu.tesla.1.

    • Instâncias aceleradas por GPU da série Tesla são suportadas nas seguintes regiões: China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Shenzhen), Japão (Tóquio), EUA (Virgínia) e Singapura.

    • Instâncias aceleradas por GPU da série Ada são suportadas nas seguintes regiões: China (Beijing), China (Hangzhou), China (Shanghai), China (Shenzhen), Singapura e EUA (Virgínia).

Relação entre especificações de instância GPU e concorrência da instância

Uma GPU Ada.1 possui 48 GB de memória, enquanto uma GPU da série Tesla tem 16 GB. O Function Compute aloca toda a memória de uma placa GPU para um único contêiner GPU. Como a cota padrão de placas GPU é de no máximo 30 por região, até 30 contêineres GPU podem executar simultaneamente nessa região.

  • Se a concorrência da instância de uma função GPU for 1, a função poderá processar até 30 requisições de inferência simultaneamente na região.

  • Caso a concorrência da instância seja 5, a função conseguirá processar até 150 requisições de inferência simultaneamente na região.

Concorrência de instância única

Para melhorar a utilização de recursos, configure a concorrência de instância única conforme as necessidades da sua aplicação. Nessa configuração, várias tarefas executam em uma única instância e compartilham recursos de CPU e memória, aumentando a eficiência geral. Para mais informações, consulte Configurar concorrência de instância.

Duração de execução para instância única, concorrência única

Quando uma instância executa uma única requisição, a duração da execução é medida desde a chegada da requisição à instância até a conclusão da execução.

image

Duração de execução para instância única, múltipla concorrência

Quando uma instância executa várias requisições simultaneamente, a duração da execução é medida do momento em que a primeira requisição chega à instância até a conclusão da última requisição. Esse reaproveitamento de recursos ajuda a reduzir custos.

image

Referências

  • Para mais detalhes sobre métodos de faturamento e itens faturáveis do Function Compute, consulte Visão geral do faturamento.

  • Ao usar uma API para criar uma função, utilize o parâmetro instanceType para especificar o tipo de instância. Para mais informações, consulte CreateFunction.

  • Para saber como especificar o tipo e as especificações da instância no console, consulte Criação de função.