Instâncias básicas de CPU geralmente atendem a cenários de computação de uso geral no Function Compute, como serviços web e processamento de dados. No entanto, para cargas que exigem computação paralela em larga escala ou deep learning — como processamento de áudio e vídeo, inferência de inteligência artificial (IA) e edição de imagens —, as instâncias aceleradas por GPU aumentam significativamente a eficiência computacional.
Para instâncias GPU, o Function Compute oferece três tipos: instâncias elásticas, instâncias provisionadas e instâncias provisionadas + elásticas (modo misto). Selecione o tipo e as especificações mais adequados às necessidades do seu negócio para garantir operações estáveis, maximizar a utilização de recursos e otimizar o desempenho.
Seleção do tipo de instância
Funções de CPU aceitam apenas Instâncias Elásticas. Funções de GPU suportam três tipos de instância; alterne entre eles a qualquer momento sem interrupção do serviço.
Guia de decisão
Use as perguntas abaixo para identificar o tipo ideal de instância:
A carga de trabalho é sensível a latência e interativa? Por exemplo, um chatbot em tempo real ou uma API de geração de imagens. Em caso afirmativo, use Instâncias Provisionadas para eliminar cold starts e garantir tempos de resposta consistentes.
O tráfego segue uma linha de base previsível com picos ocasionais? Nesse cenário, adote o Modo Misto (Instâncias Provisionadas + Elásticas) para manter uma capacidade de base estável e absorver rajadas de tráfego.
O tráfego é variável, irregular ou de baixa frequência? Se sim, opte por Instâncias Elásticas e pague apenas pelo uso ativo.
Comparação entre tipos de instância
|
Instância Elástica |
Instância Provisionada |
Provisionada + Elástica (Modo Misto) |
|
|
Aplica-se a |
Funções de CPU (única opção); Funções de GPU |
Apenas Funções de GPU |
Apenas Funções de GPU |
|
Cold start |
Sim, se o mínimo de instâncias for 0. Defina o mínimo de instâncias como 1 ou mais para pré-alocar recursos e reduzir cold starts. |
Nenhum. Todas as requisições dentro da capacidade alocada recebem resposta em tempo real. |
Parcial. Requisições atendidas pelo pool provisionado não sofrem cold start; instâncias elásticas adicionais sim. |
|
Modelo de faturamento |
Pagamento conforme o uso |
Assinatura |
Assinatura (parte provisionada) + pagamento conforme o uso (parte elástica) |
|
Mais indicado para |
Tráfego variável ou de baixa frequência; cargas sensíveis a custo |
Cargas sensíveis a latência ou com tráfego estável |
Cargas com linha de base previsível e picos de tráfego imprevisíveis |
Instância Elástica
As Instâncias Elásticas escalam automaticamente conforme o volume de requisições e são liberadas quando ociosas. Definir o número mínimo de instâncias como 0 adota um modelo puro de pagamento conforme o uso: você paga apenas pelo consumo ativo.
Comportamento de cold start: Cold starts ocorrem quando as instâncias escalam a partir de zero. Para reduzir a latência de cold start, defina o número mínimo de instâncias como 1 ou mais. Essa configuração pré-aloca recursos elásticos e permite que as instâncias atendam rapidamente às requisições recebidas.
Faturamento: Os custos incluem cobranças por instâncias nos estados ativo e de Hibernação Leve. Na Hibernação Leve, os recursos de vCPU não são cobrados e os recursos de GPU são faturados a um quinto da tarifa ativa. Se definir o número mínimo de instâncias como 1 ou mais, ative a Hibernação Leve para reduzir custos de ociosidade.
Use Instâncias Elásticas quando:
O tráfego for variável, irregular ou de baixa frequência
Você quiser pagar apenas pelo uso efetivo
A carga de trabalho tolerar latência ocasional de cold start (ou você a mitigar com um número mínimo de instâncias)
Instância Provisionada
Instâncias Provisionadas aplicam-se exclusivamente a Funções de GPU. Adquira antecipadamente um Pool de Recursos Provisionados e aloque um número e tipo específicos de instâncias à sua função. Essa abordagem elimina cold starts dentro da capacidade alocada e proporciona custos fixos e previsíveis.
Após adquirir um pool de recursos provisionados mensal, a plataforma fornece uma cota adicional de instâncias de reforço sem custo extra.
Comportamento de cold start: Nenhum. Todas as requisições dentro da capacidade alocada recebem resposta em tempo real. Máximo de requisições simultâneas = (Número de Instâncias Provisionadas alocadas) × (Concorrência da instância) + cota de instâncias de reforço. Requisições que excederem esse limite serão limitadas (throttled).
Faturamento: Taxa total de assinatura de todos os Pools de Recursos Provisionados adquiridos. Instâncias de reforço não são faturadas.
Instâncias Provisionadas estão disponíveis apenas para Funções de GPU nas séries Ada, Ada.2, Ada.3, Hopper ou Xpu.1.
Use Instâncias Provisionadas quando:
A carga de trabalho for sensível a latência e interativa (por exemplo, um chatbot em tempo real ou uma API de geração de imagens)
O tráfego for constante e previsível
For necessária capacidade garantida e tempos de resposta consistentes
Instâncias Provisionadas + Elásticas (Modo Misto)
O Modo Misto aplica-se apenas a Funções de GPU. Ele combina Instâncias Provisionadas e Elásticas: o pool provisionado atende primeiro ao tráfego de estado estacionário, e as instâncias elásticas escalam automaticamente quando as requisições excedem a capacidade provisionada. Isso garante uma linha de base assegurada com flexibilidade para absorver picos repentinos de tráfego.
Comportamento de cold start: Parcial. Requisições atendidas dentro do pool provisionado não sofrem cold start. Requisições que acionam o Auto Scaling para novas instâncias elásticas passam por um cold start.
Faturamento: A parte provisionada é debitada da cota do Pool de Recursos Provisionados adquirido. Instâncias elásticas iniciadas além da cota provisionada são faturadas no modelo de pagamento conforme o uso, com as mesmas tarifas das instâncias elásticas ativas e em Hibernação Leve.
Adote o Modo Misto quando:
O tráfego tiver uma linha de base previsível, mas com picos ocasionais
For desejado desempenho estável para carga normal, com capacidade de lidar com tráfego em rajadas
For necessário equilíbrio entre previsibilidade de custos e flexibilidade de dimensionamento
Especificações de instância
-
Instâncias de CPU
vCPU (core)
Tamanho da memória (MB)
Tamanho máximo do pacote de código (GB)
Duração máxima de execução da função (s)
Tamanho máximo do disco (GB)
Largura de banda máxima (Gbps)
0,05 a 16
Nota: O valor deve ser múltiplo de 0,05.
128 a 32768
Nota: O valor deve ser múltiplo de 64.
10
86400
10
Valores válidos:
512 MB. Este é o valor padrão.
10 GB.
5
NotaA proporção entre vCPUs e tamanho da memória (em GB) deve estar entre 1:1 e 1:4.
-
Especificações de hardware de instâncias GPU
Tipo de instância
Memória da GPU
Poder de computação FP16
Poder de computação FP32
Máximo de placas por instância
fc.gpu.tesla.1
16 GB
65 TFLOPS
8 TFLOPS
4 placas
fc.gpu.ampere.1
24 GB
125 TFLOPS
31,2 TFLOPS
8 placas
fc.gpu.ada.1
48 GB
119 TFLOPS
60 TFLOPS
fc.gpu.ada.2
24 GB
166 TFLOPS
83 TFLOPS
fc.gpu.ada.3
48 GB
148 TFLOPS
73,5 TFLOPS
fc.gpu.hopper.1
96 GB
148 TFLOPS
44 TFLOPS
fc.gpu.hopper.2
141 GB
148 TFLOPS
44 TFLOPS
fc.gpu.blackwell.1
32 GB
104,8 TFLOPS
104,8 TFLOPS
fc.gpu.xpu.1
96 GB
123 TFLOPS
61,5 TFLOPS
16 placas
-
Regras de configuração de vCPU e memória para instâncias GPU
NotaFórmula para recursos multiplaca: Total de vCPUs = vCPUs por placa × Número de placas, e Memória total = Memória por placa × Número de placas.
Tipo de instância
vCPU (por placa)
Faixa de memória por placa
Incremento de memória
fc.gpu.tesla.1
4 núcleos
4 a 16 GB (4.096 a 16.384 MB)
4 GB (4.096 MB)
8 núcleos
8 a 32 GB (8.192 a 32.768 MB)
16 núcleos
16 a 64 GB (16.384 a 65.536 MB)
fc.gpu.ampere.1
8 núcleos
8 a 32 GB (8.192 a 32.768 MB)
16 núcleos
16 a 32 GB (16.384 a 32.768 MB)
fc.gpu.ada.1
fc.gpu.ada.2
fc.gpu.ada.3
4 núcleos
16 a 32 GB (16.384 a 32.768 MB)
8 núcleos
32 a 64 GB (32.768 a 65.536 MB)
16 núcleos
64 a 120 GB (65.536 a 122.880 MB)
fc.gpu.hopper.1
4 núcleos
16 a 32 GB (16.384 a 32.768 MB)
8 núcleos
32 a 64 GB (32.768 a 65.536 MB)
16 núcleos
64 a 96 GB (65.536 a 98.304 MB)
24 núcleos
96 a 120 GB (98.304 a 122.880 MB)
fc.gpu.hopper.2
4 núcleos
16 a 32 GB (16.384 a 32.768 MB)
8 núcleos
32 a 64 GB (32.768 a 65.536 MB)
16 núcleos
64 a 128 GB (65.536 a 131.072 MB)
24 núcleos
96 a 248 GB (98.304 a 253.952 MB)
fc.gpu.blackwell.1
4 núcleos
16 a 32 GB (16.384 a 32.768 MB)
8 núcleos
32 a 64 GB (32.768 a 65.536 MB)
16 núcleos
64 a 120 GB (65.536 a 122.880 MB)
24 núcleos
96 a 184 GB (98.304 a 188.416 MB)
fc.gpu.xpu.1
4 núcleos
16 a 48 GB (16.384 a 49.152 MB)
8 núcleos
32 a 96 GB (32.768 a 98.304 MB)
12 núcleos
48 a 120 GB (49.152 a 122.880 MB)
-
Instâncias aceleradas por GPU também suportam as seguintes especificações de recursos.
Tamanho da imagem (GB)
Duração máxima de execução da função (s)
Tamanho do disco
Largura de banda máxima (Gbps)
ACR Enterprise Edition (Standard Edition): 15
ACR Enterprise Edition (Premium Edition): 15
ACR Enterprise Edition (Basic Edition): 15
ACR Personal Edition (Free): 15
86400
512 MB
10 GB a 200 GB, em incrementos de 10 GB
5
NotaDefinir o tipo de instância como g1 equivale a defini-lo como fc.gpu.tesla.1.
Instâncias aceleradas por GPU da série Tesla são suportadas nas seguintes regiões: China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Shenzhen), Japão (Tóquio), EUA (Virgínia) e Singapura.
Instâncias aceleradas por GPU da série Ada são suportadas nas seguintes regiões: China (Beijing), China (Hangzhou), China (Shanghai), China (Shenzhen), Singapura e EUA (Virgínia).
Relação entre especificações de instância GPU e concorrência da instância
Uma GPU Ada.1 possui 48 GB de memória, enquanto uma GPU da série Tesla tem 16 GB. O Function Compute aloca toda a memória de uma placa GPU para um único contêiner GPU. Como a cota padrão de placas GPU é de no máximo 30 por região, até 30 contêineres GPU podem executar simultaneamente nessa região.
Se a concorrência da instância de uma função GPU for 1, a função poderá processar até 30 requisições de inferência simultaneamente na região.
Caso a concorrência da instância seja 5, a função conseguirá processar até 150 requisições de inferência simultaneamente na região.
Concorrência de instância única
Para melhorar a utilização de recursos, configure a concorrência de instância única conforme as necessidades da sua aplicação. Nessa configuração, várias tarefas executam em uma única instância e compartilham recursos de CPU e memória, aumentando a eficiência geral. Para mais informações, consulte Configurar concorrência de instância.
Duração de execução para instância única, concorrência única
Quando uma instância executa uma única requisição, a duração da execução é medida desde a chegada da requisição à instância até a conclusão da execução.
Duração de execução para instância única, múltipla concorrência
Quando uma instância executa várias requisições simultaneamente, a duração da execução é medida do momento em que a primeira requisição chega à instância até a conclusão da última requisição. Esse reaproveitamento de recursos ajuda a reduzir custos.
Referências
Para mais detalhes sobre métodos de faturamento e itens faturáveis do Function Compute, consulte Visão geral do faturamento.
Ao usar uma API para criar uma função, utilize o parâmetro
instanceTypepara especificar o tipo de instância. Para mais informações, consulte CreateFunction.Para saber como especificar o tipo e as especificações da instância no console, consulte Criação de função.