O Auto Scaling do Database Autonomy Service (DAS) monitora dados de desempenho em tempo real das instâncias de banco de dados para detectar anomalias de tráfego e dimensionar automaticamente armazenamento, especificações de computação e largura de banda, sem intervenção manual.
Quando usar o Auto Scaling
O Auto Scaling do DAS foi projetado para cargas de trabalho com demanda imprevisível ou variável. A tabela a seguir compara o Auto Scaling ao gerenciamento manual de capacidade.
|
Auto Scaling |
Gerenciamento manual |
|
|
Padrão de tráfego |
Picos imprevisíveis, surtos periódicos ou alta carga intermitente |
Cargas de trabalho estáveis e previsíveis |
|
Ação de dimensionamento |
Automática, acionada por limiares ou previsão baseada em ML |
Alterações manuais de especificação |
|
Tempo de resposta |
Detecção e dimensionamento em tempo real |
Depende da velocidade de resposta da equipe de O&M |
|
Redução de escala |
Reversão automática após a normalização do tráfego |
Manual |
|
Mais indicado para |
Lançamentos de produtos, vendas relâmpago, picos diários de acesso e eventos virais |
Cargas de trabalho de longa duração com tráfego conhecido e estável |
Como funciona
O Auto Scaling do DAS utiliza um sistema de ciclo fechado composto por seis módulos que operam em sequência:
Coleta de dados de desempenho — Coleta métricas de desempenho em tempo real, configurações de especificação e informações de sessão das instâncias de banco de dados em execução.
Centro de decisão — Analisa os dados de desempenho atuais e a lista de sessões para determinar a ação apropriada: ativar limitação de SQL (quando consultas lentas são a causa raiz) ou prosseguir com o dimensionamento (quando o tráfego realmente excede a capacidade).
Modelo algorítmico — Módulo central. Executa detecção de anomalias no tráfego de negócios e gera recomendações de especificações de capacidade.
Recomendação e validação de especificações — Valida se as especificações recomendadas correspondem ao tipo de implantação da instância, ao ambiente operacional e às especificações disponíveis na região atual.
Gerenciamento — Distribui e aplica as alterações de especificação.
Rastreamento de status — Mede o desempenho antes e depois das alterações de especificação para avaliar os resultados.

Recursos
O Auto Scaling do DAS oferece três capacidades de dimensionamento.
Expansão automática de armazenamento
A expansão automática de armazenamento evita situações de disco cheio ao aumentar a capacidade antes que o limite seja atingido.
Condições de acionamento:
A expansão de armazenamento é acionada quando uma das seguintes condições é atendida:
A utilização do disco excede o limiar configurado (padrão: 90%). Configure um limiar personalizado para substituir esse padrão.
O algoritmo de previsão de séries temporais prevê que o espaço em disco será esgotado em curto prazo, com base nas tendências históricas de uso.
Regras de expansão:
Cada expansão aumenta o espaço em disco em no mínimo 5 GB e no máximo 15%.
Notificações enviadas:
Recomendações de especificação — descreve o tamanho atual do disco e o tamanho expandido recomendado
Status da tarefa — relata o progresso e o resultado da expansão

Dimensionamento automático de especificações
O dimensionamento automático de especificações altera automaticamente as especificações da instância (núcleos de CPU e memória) em resposta a picos de tráfego e reverte para as especificações originais após a normalização do tráfego.
Como a decisão de dimensionamento é tomada:
O módulo de detecção de anomalias monitora várias métricas de desempenho simultaneamente — incluindo QPS (consultas por segundo), TPS (transações por segundo), sessões ativas e IOPS — para identificar picos de tráfego genuínos. Em seguida, o centro de decisão determina a ação apropriada:
Se consultas SQL lentas estiverem congestionando a fila de tarefas, a limitação de SQL é aplicada como medida de emergência em vez do scale-up.
Se o tráfego real de negócios exceder a capacidade atual, o processo de dimensionamento prossegue.
Scale-out versus scale-up:
|
Método |
Quando se aplica |
Como funciona |
|
Scale-out (horizontal) |
Tráfego com predominância de leituras |
Adiciona nós somente leitura para distribuir a carga de leitura |
|
Scale-up (vertical) |
Tráfego com predominância de gravações |
Atualiza as especificações da instância; atualiza primeiro o nó secundário e depois executa um failover entre primário e secundário para minimizar o impacto |
O algoritmo de recomendação de especificações usa um modelo treinado, combinado com dados de desempenho atuais e históricos, para recomendar as especificações de destino mais adequadas, evitando provisionamento excessivo e alterações repetidas desnecessárias.
Reversão:
Após o término da anomalia de tráfego, o DAS detecta que as métricas retornaram ao normal dentro da janela de observação e reverte automaticamente para as especificações originais armazenadas nos metadados.
Parâmetros configuráveis:
Nível de abruptidade — sensibilidade da detecção de anomalias
Duração da carga de tráfego — janela de observação para acionamento e reversão
Especificações máximas — limite superior para scale-up
Opção de reverter após o dimensionamento

Ajuste automático de largura de banda
O ajuste automático de largura de banda detecta anomalias no uso de tráfego de entrada e saída e atualiza as especificações de largura de banda quando a capacidade atual é insuficiente. Após a normalização do tráfego, o DAS reverte para as especificações originais de largura de banda.

Mecanismos de banco de dados compatíveis
|
Recurso |
Mecanismos de banco de dados compatíveis |
|
Dimensionamento automático de especificações |
ApsaraDB RDS for MySQL High-availability Edition (SSDs padrão ou ESSDs); ApsaraDB RDS for MySQL High-availability Edition de uso geral (discos locais); ApsaraDB RDS for MySQL Enterprise Edition de uso geral; PolarDB for MySQL Cluster Edition; ApsaraDB for Redis Community Edition; ApsaraDB for Redis Enhanced Edition (Tair) otimizada para memória |
|
Expansão automática de armazenamento |
ApsaraDB RDS for MySQL High-availability Edition (SSDs padrão ou ESSDs); ApsaraDB RDS for MySQL Cluster Edition; ApsaraDB RDS for PostgreSQL High-availability Edition (SSDs padrão ou ESSDs); ApsaraDB MyBase for MySQL High-availability Edition (SSDs padrão ou ESSDs); ApsaraDB MyBase for MySQL High-availability Edition (discos locais) |
|
Ajuste automático de largura de banda |
ApsaraDB for Redis (discos locais) |
Tecnologias principais
O Auto Scaling do DAS baseia-se em cinco tecnologias-chave desenvolvidas pela equipe de banco de dados da Alibaba Cloud:
Monitoramento em tempo real em toda a rede — Coleta dados de desempenho de instâncias de banco de dados em toda a rede com latência de alguns segundos. Processa mais de 10 milhões de métricas de monitoramento por segundo em tempo real, fornecendo a base de dados para todas as decisões de dimensionamento.
Fluxos de tarefas de gerenciamento unificado — Executa operações de O&M em toda a rede da Alibaba Cloud para aplicar alterações de dimensionamento de forma confiável.
Algoritmo de detecção de anomalias em séries temporais — Usa machine learning para realizar detecção periódica, identificar pontos de inflexão e detectar intervalos contínuos de anomalias. Abrange mais de 700.000 instâncias de banco de dados online. Para previsões do dia seguinte, mais de 99% das instâncias apresentam erro de previsão inferior a 5%. Para previsões de 14 dias, mais de 94% atingem o mesmo limiar.
Modelo de previsão de tempo de resposta (RT) baseado em deep learning — Prevê o RT do banco de dados com base em métricas de desempenho como utilização de CPU, leituras lógicas, leituras físicas e IOPS. Esse modelo reduziu o uso de memória do buffer pool em 27 TB nos bancos de dados da Alibaba Cloud, o que representa aproximadamente 17% da memória total.
PolarDB for MySQL de próxima geração — Banco de dados relacional construído sobre arquitetura de cloud computing, em que os nós de computação são separados dos nós de armazenamento. Essa separação oferece suporte técnico robusto ao Auto Scaling, evitando sobrecargas adicionais causadas por replicação e armazenamento de dados, o que melhora significativamente a experiência do usuário.
Exemplo
O exemplo a seguir mostra como o Auto Scaling do DAS responde a dois eventos sucessivos de tráfego em uma instância ApsaraDB RDS for MySQL, configurada com janela de observação de 15 minutos e limiar de utilização de CPU de 80%.

Evento 1 — 07:10: A utilização de CPU e as sessões ativas aumentam devido a um pico de tráfego. A CPU atinge 80%. A análise de tráfego indica que a carga de trabalho tem predominância de leituras, então o DAS adiciona dois nós somente leitura. A CPU cai para 60% e a instância se estabiliza.
Evento 2 — 09:00: A CPU volta a subir com o aumento do volume de negócios. A análise de tráfego mostra que a carga de trabalho agora tem predominância de gravações, então o DAS atualiza as especificações de computação em vez de adicionar nós somente leitura. A CPU cai para 50% e a instância se estabiliza novamente.
Este exemplo demonstra como o centro de decisão seleciona o método de dimensionamento apropriado com base nas características do tráfego, em vez de adotar uma abordagem única para todos os cenários.