Todos os produtos
Search
Central de documentação

API Gateway:Criar uma instância de gateway

Última atualização: Jun 27, 2026

Uma instância do Cloud-native API Gateway oferece exposição de serviços, gerenciamento de tráfego, proteção de segurança e gerenciamento do ciclo de vida de APIs.

Configuração básica

Autorização inicial

Políticas de permissão do sistema:

AliyunServiceRoleForNativeApiGw: Permite o acesso a outros serviços da Alibaba Cloud, como Container Service for Kubernetes (ACK), Virtual Private Cloud (VPC), Server Load Balancer (SLB) e Microservices Engine (MSE).

AliyunServiceRolePolicyForNativeApiGwInvokeFC: Permite o acesso ao serviço Function Compute (FC).

  1. Faça login no console do Cloud-native API Gateway. No painel de navegação à esquerda, clique em Instance. Na página Instances, clique em Instance Creation. Na página de compra do Cloud-native API Gateway, configure os seguintes parâmetros:

    • Product Type: Selecione Pay-as-you-go ou Subscription. Consulte a visão geral de faturamento.

      • Pagamento conforme o uso: Faturamento por hora. O uso inferior a uma hora é arredondado para uma hora completa, e as faturas são liquidadas a cada hora.

      • Assinatura: Faturamento mensal. Uma assinatura anual equivale a 12 meses.

    • Region: Selecione a região onde residem seus serviços de backend. Não é possível alterar a região após a criação.

    • Gateway Name: Insira um nome personalizado (até 64 caracteres). Utilize um nome que combine ambiente e domínio de negócios, como test ou order-prod.

    • GatewaySpec: Faça uma avaliação de capacidade e selecione uma especificação de nó com base nos requisitos do seu negócio.

      Limiares de capacidade para diferentes especificações de nós

      Mantenha as métricas de capacidade abaixo do limiar de alerta para preservar as garantias de SLA. Para cargas de trabalho críticas, mantenha-se abaixo do limiar seguro para obter maior estabilidade.

      • Limiar seguro: O gateway mantém alto throughput e baixa latência mesmo se o tráfego dobrar.

      • Limiar de alerta: Acima deste nível, o gateway pode apresentar maior latência e riscos de estabilidade durante picos de tráfego.

      • Gateways de nó único não possuem garantia de SLA e destinam-se apenas a testes. Cargas de produção exigem especificações com múltiplos nós.

      Especificação do gateway

      Conexões de cliente

      Novas conexões HTTPS

      Utilização de CPU

      Uso de memória

      Limiar seguro

      Limiar de alerta

      Limiar seguro

      Limiar de alerta

      Limiar seguro

      Limiar de alerta

      Limiar seguro

      Limiar de alerta

      apigw.dev.x1

      12.000

      24.000

      400

      800

      30%

      60%

      75%

      75%

      apigw.small.x1

      24.000

      48.000

      800

      1.600

      30%

      60%

      75%

      75%

      apigw.small.x2

      48.000

      96.000

      1.600

      3.200

      30%

      60%

      75%

      75%

      apigw.small.x4

      96.000

      192.000

      3.200

      6.400

      30%

      60%

      75%

      75%

      apigw.medium.x1

      192.000

      384.000

      6.400

      12.800

      30%

      60%

      75%

      75%

      apigw.medium.x2

      384.000

      768.000

      12.800

      25.600

      30%

      60%

      75%

      75%

      apigw.medium.x3

      576.000

      1.152.000

      19.200

      38.400

      30%

      60%

      75%

      75%

      apigw.large.x1

      768.000

      1.536.000

      25.600

      51.200

      30%

      60%

      75%

      75%

      apigw.large.x2

      1.536.000

      3.072.000

      51.200

      102.400

      30%

      60%

      75%

      75%

      apigw.large.x3

      2.304.000

      4.608.000

      76.800

      153.600

      30%

      60%

      75%

      75%

      apigw.large.x4

      3.072.000

      6.144.000

      102.400

      204.800

      30%

      60%

      75%

      75%

    • Resource Group: Selecione um grupo de recursos existente ou use o padrão. Grupos de recursos permitem gerenciar recursos, permissões e monitoramento como uma unidade. Para criar um, clique em Create Resource Group.

    • Network Type: Selecione Internet, Private Network ou Public + private network.

      • Internet: O acesso pela rede pública gera taxas de tráfego faturadas via Cloud Data Transfer (CDT) no modelo BGP (Multi-ISP). Tráfego de rede pública.

      • Private Network: Não há cobrança de taxas de tráfego para acesso pela rede privada.

      • Public + private network: O acesso público gera taxas de tráfego CDT (modelo BGP Multi-ISP). O acesso privado é gratuito.

    • VPC: Selecione a VPC onde o gateway será executado. O gateway e os serviços de backend devem compartilhar a mesma VPC.

    • Seleção de zona de disponibilidade: Escolha entre Auto-assign ou Manual select.

      • Auto-assign: Selecione os vSwitches para os nós do gateway. O sistema implanta os nós em duas zonas de disponibilidade automaticamente.

      • Manual select: Selecione manualmente a Availability zone e os vSwitches para os nós do gateway.

  2. Clique em Buy Now, revise a configuração na página Confirm Order e clique em Open now.

    A criação da instância do gateway leva de 1 a 5 minutos.
  3. Na página Instance, verifique se o status da instância é Running.

Recursos avançados

Configure recursos avançados durante a criação da instância para habilitar a análise de logs ou a compactação Gzip. A aceleração de hardware Gzip só pode ser ativada no momento da criação. O serviço de log pode ser ativado a qualquer momento.

Ativar aceleração de hardware Gzip

A aceleração de hardware Gzip transfere a compactação e descompactação de dados para hardware dedicado, reduzindo a carga da CPU e melhorando a eficiência de processamento.

Etapas

  1. Na página de compra, conclua a Configuração básica e defina os seguintes parâmetros adicionais. Em seguida, clique em Open now.

    • Region: A aceleração de hardware Gzip está disponível nas seguintes regiões: China (Hangzhou), China (Beijing), China (Shanghai), China (Shenzhen), China (Ulanqab), China (Hong Kong) e Singapura.

      Dentro dessas regiões suportadas, algumas zonas de disponibilidade podem não oferecer suporte a este recurso. A disponibilidade depende das opções exibidas na página de compra do produto.
    • GatewaySpec: Selecione uma especificação apigw.medium.x1 ou superior.

    • Gzip hardware acceleration: Marque a caixa de seleção para ativar a aceleração de hardware Gzip.

      image

  2. Após a criação da instância, clique no nome ou ID dela para acessar a página de detalhes. No painel de navegação à esquerda, clique em Parameters. Na seção Gateway Engine Parameters, edite o parâmetro EnableGzipHardwareAccelerate.

    Se você não marcou a caixa de seleção Gzip hardware acceleration durante a compra, não será possível ativar essa configuração.
  3. Depois de ativar esse recurso, os clientes devem ser capazes de processar dados compactados com Gzip e incluir o cabeçalho Accept-Encoding: gzip nas solicitações.

Referência de desempenho

Economia de tráfego com Gzip

A taxa de compactação Gzip (tamanho compactado / tamanho original) depende das características dos dados. Taxas menores indicam melhor compactação.

Textos com padrões repetitivos (letras, palavras, pontuação) compactam bem, resultando em taxas baixas. Dados de alta entropia (imagens, vídeos, arquivos já compactados) resultam em taxas altas com benefício limitado.

Com base em dados de produção de instâncias com Gzip ativado em regiões principais, a maioria atinge uma taxa de compactação de 10% a 50%, economizando mais de 50% de tráfego em média.

Economia de recursos com aceleração de hardware

O teste de estresse a seguir compara o uso de CPU entre uma instância de nó único com Gzip via hardware e uma instância de quatro nós com Gzip via software, ambas sob o mesmo QPS.

Neste exemplo, os dados sendo compactados são um arquivo de texto JSON de aproximadamente 120 KB.

QPS

Uso de CPU (Gzip via hardware)

Uso de CPU (Gzip via software)

2.000

9%

11%

5.000

26%

28%

10.000

56%

56%

13.000

69%

72%

O uso de CPU de Enabled Gzip hardware acceleration/single node é comparável ao de Software Gzip/4 nodes, economizando aproximadamente 75% dos recursos da instância.

Ativar entrega de logs do gateway

Ative o Simple Log Service (SLS) durante a criação da instância para coletar, armazenar e analisar logs do gateway.

Ao concluir a Configuração básica, marque a caixa de seleção Use Simple Log Service (SLS). O sistema provisiona o SLS automaticamente e ativa o recurso de entrega de logs do gateway para você.

Após ativar a entrega de logs, visualize os logs do gateway navegando até Observation and Analysis > Logs.

Descrições dos campos de log

Campo

Tipo

Descrição

__time__

long

O momento em que o log foi gerado.

cluster_id

string

O ID da instância do AI Gateway.

ai_log

json

Um objeto JSON que contém campos de log para Model API, Agent API e MCP API. Este campo fica vazio para outros tipos de API.

  • api: O nome da AI API.

  • cache_status: Indica se uma solicitação atingiu o cache quando o cache de conteúdo está ativado para uma Model API.

  • consumer: A identidade do consumidor. Este campo é preenchido quando a autenticação de consumidor está ativada.

  • fallback_from: A rota da qual a solicitação sofreu fallback. Este campo é preenchido quando uma política de fallback está ativada para uma Model API.

  • input_token: O número de tokens de entrada na solicitação LLM.

  • llm_first_token_duration: O tempo até o primeiro token (TTFT) para a solicitação LLM.

  • llm_service_duration: O tempo de resposta de ponta a ponta para a solicitação LLM.

  • model: O nome do modelo usado na solicitação LLM.

  • output_token: O número de tokens de saída na resposta LLM.

  • response_type: O tipo de resposta da solicitação LLM, como streaming ou não-streaming.

  • safecheck_status: O resultado da Moderação de Conteúdo para a solicitação LLM.

  • token_ratelimit_status: Indica se a solicitação foi bloqueada pelo limitador de taxa baseado em tokens.

authority

string

O valor do cabeçalho Host na solicitação.

bytes_received

long

O tamanho do corpo da solicitação em bytes, excluindo o cabeçalho.

bytes_sent

long

O tamanho do corpo da resposta em bytes, excluindo o cabeçalho.

downstream_local_address

string

O endereço do pod do gateway.

downstream_remote_address

string

O endereço do cliente que se conecta ao gateway.

duration

long

O tempo total de processamento da solicitação em milissegundos, medido desde o recebimento do primeiro byte do cliente pelo gateway até o envio do último byte da resposta.

method

string

O método HTTP.

path

string

O caminho na solicitação HTTP.

protocol

string

A versão do protocolo HTTP.

request_duration

long

O tempo em milissegundos desde o recebimento do primeiro byte da solicitação do cliente pelo gateway até o recebimento do último byte.

request_id

string

Um ID exclusivo que o gateway gera para cada solicitação. Este ID está incluído no x-request-id header. Use este campo para registrar logs e solucionar problemas de solicitações.

requested_server_name

string

O nome do servidor usado para a conexão SSL.

response_code_details

string

Contexto adicional para o código de resposta. Por exemplo, via_upstream indica que o serviço de backend retornou o código de resposta, e route_not_found indica que o gateway não encontrou uma rota correspondente.

response_tx_duration

long

O tempo em milissegundos desde o recebimento do primeiro byte do serviço upstream pelo gateway até o envio do último byte para o cliente.

route_name

string

O nome da rota.

start_time

string

A hora de início da solicitação. O horário está em UTC.

trace_id

string

O ID de rastreamento.

upstream_cluster

string

O cluster upstream.

upstream_host

string

O endereço IP do host upstream.

upstream_local_address

string

O endereço local usado para conectar ao serviço upstream.

upstream_service_time

long

O tempo de processamento da solicitação em milissegundos para o serviço upstream. Esta duração inclui a latência de rede e o tempo de processamento do próprio serviço.

upstream_transport_failure_reason

string

O motivo da falha na conexão upstream.

user_agent

string

O valor do cabeçalho User-Agent na solicitação.

x_forwarded_for

string

O valor do x-forwarded-for header, que normalmente contém o endereço IP real do cliente.

Próximas etapas