Todos os produtos
Search
Central de documentação

Realtime Compute for Apache Flink:Ativar ajuste automático de desempenho

Última atualização: Aug 13, 2026

O Realtime Compute for Apache Flink oferece dois modos de ajuste automático — Autopilot e ajuste agendado — para reduzir o gerenciamento manual de recursos. O ajuste manual exige alocar recursos antes do início do job, reajustar as alocações durante a execução para maximizar a utilização e reagir a picos de backpressure ou latência. Ambos os modos automatizam essas decisões, mantendo a eficiência dos jobs sem necessidade de intervenção constante.

Escolha um modo de ajuste

Modo de ajuste

Quando usar

Como funciona

Referências

Autopilot

Cargas de trabalho variáveis ou imprevisíveis, quando você deseja que o sistema responda automaticamente a alterações de CPU, memória ou latência.

O sistema monitora métricas em tempo real continuamente e ajusta paralelismo, CPU e memória sem intervenção manual.

Ative e configure o Autopilot

Ajuste agendado

O tráfego segue um padrão previsível (por exemplo, picos diários e horários fora de pico) e é possível planejar as alterações de recursos com antecedência.

Você define planos de recursos baseados em tempo. O sistema os aplica nos horários de acionamento configurados.

Configure e aplique um plano de ajuste agendado

Nota

Os dois modos são mutuamente exclusivos. Desative o modo ativo antes de alternar para o outro.

Limitações e considerações

Checkpointing desalinhado: Não é possível modificar o paralelismo do job quando o checkpointing desalinhado está ativado.

Clusters de sessão: O Autopilot não oferece suporte a jobs executados em clusters de sessão.

Jobs desenvolvidos em YAML: O ajuste automático não é compatível com jobs desenvolvidos em YAML.

Paralelismo codificado: Evite codificar o paralelismo diretamente em jobs Flink SQL com conectores personalizados ou em jobs da DataStream API. Valores codificados substituem as configurações de ajuste automático.

Limite de planos de recursos: É possível criar no máximo 20 planos de recursos.

Planos mutuamente exclusivos: Apenas um plano de ajuste agendado pode ser aplicado por vez. Interrompa o plano ativo antes de aplicar outro diferente.

Reinicializações de job: O ajuste automático pode reiniciar jobs, interrompendo momentaneamente o consumo de dados.

Nota

Para o Ververica Runtime (VVR) 8.0.1 e versões posteriores, o sistema tenta primeiro uma atualização dinâmica de configuração antes de reiniciar o deployment. As atualizações dinâmicas reduzem o tempo de inatividade em 30%–98% em comparação com uma reinicialização completa. Atualmente, apenas o paralelismo do job pode ser atualizado dinamicamente. Para obter detalhes, consulte

Atualizações dinâmicas de configuração

.

Comportamento de modificação de recursos: Quando o ajuste automático aplica alterações, o sistema compara as configurações anterior e posterior para determinar o método de atualização. Se houver mudanças de CPU ou memória, o deployment será reiniciado. Se apenas o paralelismo for alterado, uma atualização dinâmica será aplicada para minimizar o tempo de inatividade.

Gargalos de desempenho: O Autopilot não resolve todos os gargalos de desempenho de streaming. Ele funciona melhor quando as alterações de tráfego são suaves, não há skew de dados e o throughput do operador escala linearmente com o paralelismo. Fora dessas condições, você pode observar:

  • Falhas nas alterações de paralelismo ou reinicializações repetidas do job sem atingir um estado estável.

  • Desempenho degradado em funções escalares definidas pelo usuário (UDFs), funções de agregação definidas pelo usuário (UDAFs) ou funções com valor de tabela definidas pelo usuário (UDTFs).

Problemas em sistemas externos: O Autopilot não detecta problemas em sistemas externos. Se um sistema externo falhar ou responder lentamente, o Autopilot poderá aumentar o paralelismo do job, adicionando carga a um sistema já sobrecarregado. Problemas comuns em sistemas externos incluem:

  • Partições insuficientes no DataHub ou baixo throughput no ApsaraMQ for RocketMQ.

  • Baixo desempenho do operador de sink.

  • Deadlocks em bancos de dados do ApsaraDB RDS.

Ative e configure o Autopilot

Estratégias do Autopilot

Selecione uma estratégia com base nas características da sua carga de trabalho:

Estratégia

Mais indicada para

Como funciona

Estratégia adaptativa (recomendada)

Cargas de trabalho variáveis, alta sensibilidade à latência, skew de dados ou distribuição desigual de carga.

Ajusta continuamente a configuração de recursos com base em métricas em tempo real, respondendo rapidamente às mudanças na demanda.

Stable strategy

Cargas de trabalho estáveis e previsíveis, onde reinicializações são custosas e se prefere a convergência para um plano fixo.

Visa um plano de recursos fixo ou agendado durante todo o ciclo de execução do job. Após a convergência das configurações, o sistema gera um plano de recursos que você pode salvar e reutilizar. Reinicializações de job ou atualizações a quente reiniciam o processo de convergência.

Procedimento

  1. Acesse a página de configuração do Autopilot.

    1. Faça login no console do Realtime Compute for Apache Flink.

    2. Localize o workspace desejado e clique em Console na coluna Actions.

    3. No painel de navegação à esquerda, escolha O&M > Deployments e clique no nome do deployment desejado.

    4. Na aba Resources, selecione a subaba Autopilot Mode.

  2. Ative o Autopilot. A mensagem Autopilot Mode Applying aparece abaixo da aba Resources. Para desativar o Autopilot, desligue o botão ou clique em Turn Off Autopilot.

  3. Na seção Configurations, clique em Edit, selecione uma estratégia e configure os parâmetros.

    (Recomendada) Estratégia adaptativa

    Parâmetros da estratégia adaptativa

    Parâmetro Descrição
    Max CPU Número máximo de núcleos de CPU que o job pode utilizar. Padrão: 64 núcleos.
    Max Memory Quantidade máxima de memória que o job pode utilizar. Padrão: 256 GiB.
    Max Parallelism Paralelismo máximo do job. Padrão: 1.024. Quando integrado ao ApsaraMQ for Kafka, Message Queue, Simple Log Service ou outros serviços de fila de mensagens, o sistema limita automaticamente esse valor à contagem de partições caso o valor configurado seja superior.
    Min Parallelism Paralelismo mínimo do job. Padrão: 1.
    Scale Up Rules Condições que disparam um scale-up. O atendimento de qualquer condição isolada aciona a ação. Condições configuráveis: < br > - Atrasos permanecem acima de um limiar por uma duração especificada. < br > - A taxa média de ocupação de um operador permanece acima de um limiar por uma duração especificada. < br > - A utilização de memória de um TaskManager permanece acima de um limiar por uma duração especificada. < br > - Ocorre um erro de falta de memória (OOM). < br > - O tempo gasto pelo TaskManager ou JobManager em coleta de lixo por segundo permanece acima de um limiar por uma duração especificada. < br >
    Nota

    Defina os limiares com base em dados históricos ou comece com valores mais flexíveis e refine-os ao longo do tempo. Os percentuais de limiar variam de 0 a 100%. Definir uma duração adequada ajuda a filtrar flutuações breves e evita scale-ups causados por picos transitórios. O OOM é apenas ativado ou desativado — não requer limiar.

    Scale Down Rules Condições que disparam um scale-down. O atendimento de qualquer condição isolada aciona a ação. Condições configuráveis: <br>- A taxa média de ocupação de um operador permanece abaixo de um limiar por uma duração especificada. <br>- A utilização de memória de um TaskManager permanece abaixo de um limiar por uma duração especificada.
    Advanced Rules Atualmente em fase de testes e indisponível para uso geral. Entre em contato conosco para ativar as regras avançadas.

    Estratégia estável

    Parâmetros da estratégia estável

    Parâmetro

    Descrição

    Cooldown Minutes

    Intervalo mínimo entre reinicializações acionadas pelo Autopilot. Padrão: 10 minutos.

    Max CPU

    Número máximo de núcleos de CPU que o job pode utilizar. Padrão: 16 núcleos.

    Max Memory

    Quantidade máxima de memória que o job pode utilizar. Padrão: 64 GiB.

    Max Delay

    Atraso máximo permitido na source. Padrão: 1 minuto.

    More Configurations

    Parâmetros avançados (consulte a tabela abaixo).

    Estratégia estável: parâmetros avançados

    Parâmetro

    Descrição

    Padrão

    mem.scale-down.interval

    Intervalo mínimo entre scale-downs de memória. Quando a utilização de memória permanece abaixo do limiar definido dentro dessa janela, o sistema ajusta ou recomenda uma redução de memória.

    4 horas

    parallelism.scale.max

    Paralelismo máximo. -1 significa ilimitado. Quando integrado ao ApsaraMQ for Kafka, Message Queue, Simple Log Service ou outros serviços de fila de mensagens, o sistema limita automaticamente esse valor à contagem de partições.

    -1

    parallelism.scale.min

    Paralelismo mínimo.

    1

    delay-detector.scale-up.threshold

    Atraso máximo permitido na source antes de disparar um scale-up. Se a capacidade de processamento insuficiente fizer o atraso atingir esse valor, o sistema aumenta o paralelismo ou desacopla operadores para melhorar o throughput.

    1 minuto

    slot-usage-detector.scale-up.threshold

    Limiar superior de taxa de uso para recursos de computação/IO de operadores que não são de source. O Flink aumenta o paralelismo quando a proporção de tempo de processamento de um operador permanece acima desse valor.

    0.8

    slot-usage-detector.scale-down.threshold

    Limiar inferior de taxa de uso para recursos de computação/IO de operadores que não são de source. O Flink reduz o paralelismo quando a proporção de tempo de processamento de um operador permanece abaixo desse valor.

    0.2

    slot-usage-detector.scale-up.sample-interval

    Intervalo no qual o Flink amostra as taxas de ocupação de operadores que não são de source e compara com os limiares de scale-up e scale-down.

    3 minutos

    resources.memory-scale-up.max

    Tamanho máximo de memória do TaskManager e do JobManager. Quando um TaskManager e o JobManager executam o Autopilot ou aumentam o paralelismo, o limite superior de memória é 16 GiB.

    16 GiB

  4. Clique em Save.

Salve um plano de recursos

Quando um job que utiliza a stable strategy converge, o sistema gera um plano de recursos que você pode salvar e aplicar. Dois tipos de plano estão disponíveis:

Tipo de plano

Descrição

O que acontece ao aplicar

Plano de recursos fixo

Uma única configuração de recursos, sem dimensão temporal.

A configuração de recursos do deployment é atualizada com os valores salvos e aplicada na próxima inicialização.

Scheduled plan (preview público)

Múltiplas configurações de recursos, cada uma vinculada a um período de tempo.

O modo de ajuste muda automaticamente para ajuste agendado. Os recursos não são ajustados após o job executar de forma estável.

Para salvar e aplicar um plano de recursos fixo:

No banner Autopilot Mode Applying, clique em Details. No painel exibido, defina Recommended Plan como Specified resource e clique em Save. Na caixa de diálogo de confirmação, clique em Confirm.

Para salvar e aplicar um plano agendado:

Consulte Salve e aplique um plano agendado.

Configure e aplique um plano de ajuste agendado

Crie e aplique um plano agendado

  1. Acesse a página de configuração de plano agendado.

    1. Faça login no console do Realtime Compute for Apache Flink.

    2. Localize o workspace desejado e clique em Console na coluna Actions.

    3. No painel de navegação à esquerda, escolha O&M > Deployments e clique no nome do deployment desejado.

    4. Na aba Resources, selecione a subaba Scheduled Mode.

  2. Clique em New Plan.

  3. Na seção Resources do painel New Plan, configure o plano:

    • Trigger Period: Selecione No Repeat, Every Day, Every Week ou Every Month. Para períodos semanais ou mensais, especifique as datas em que o plano entra em vigor.

    • Trigger Time Defina o horário em que o plano entra em vigor.

    • Mode: Selecione Basic ou Expert. Para obter detalhes, consulte Configure job resources.

    • Outros parâmetros: Consulte Runtime parameter configuration.

  4. (Opcional) Clique em New Resource Setting Period para adicionar mais períodos de tempo ao plano e configurar seus horários de acionamento e definições de recursos.

    Importante

    O intervalo entre os horários de acionamento deve ser superior a 30 minutos.

  5. Na seção Resource Plans da subaba Scheduled Mode, localize o plano e clique em Apply na coluna Actions.

Salve e aplique um plano agendado

Quando um job que utiliza a stable strategy do Autopilot converge, o sistema gera automaticamente um plano agendado com base no uso observado de recursos. Você pode visualizar, modificar, salvar e aplicar esse plano.

  1. Acesse a página de configuração do Autopilot.

    1. Faça login no console do Realtime Compute for Apache Flink.

    2. Localize o workspace desejado e clique em Console na coluna Actions.

    3. No painel de navegação à esquerda, escolha O&M > Deployments e clique no nome do deployment desejado.

    4. Clique na aba Resources.

  2. No banner Autopilot Mode Applying, clique em Details. No painel exibido, defina Recommended Plan como Scheduled plan.

  3. Configure o plano:

    Ação

    Descrição

    Observações

    Especifique Max Change Count

    Define o número máximo de alterações de recursos aplicadas ao plano agendado.

    Faixa permitida: 2–5.

    Clique em Merge time periods

    Mescla períodos de tempo com base na contagem máxima de alterações especificada.

    Dimensione os recursos para cima ou para baixo antes de mesclar para atender aos seus requisitos de negócio.

  4. Revise e modifique as configurações de recursos mescladas. Para obter detalhes, consulte Configure job resources.

  5. Clique em Save no canto inferior esquerdo.

  6. Na caixa de diálogo, insira um Scheduled plan name ou selecione Apply this plan immediately e clique em Confirm. Após a aplicação do plano, o modo de ajuste muda automaticamente para ajuste agendado. O Autopilot deixa de ajustar os recursos assim que o job executa de forma estável.

Exemplo

Este exemplo utiliza um padrão de tráfego diário: horário de pico das 09:00:00 às 19:00:00 com 30 unidades de computação (CUs) e horário fora de pico das 19:00:00 às 09:00:00 do dia seguinte com 10 CUs. A configuração de ajuste agendado é a seguinte.

O painel de configuração de ajuste agendado Morning Peak and Evening Peak contém duas regras com os mesmos parâmetros de recursos: Job Manager CPU 1 núcleo, Memória 4 GiB; Task Manager CPU 1 núcleo, Memória 4 GiB; Slot Count por TaskManager é 4; System Checkpoint Interval 0,1 s; Minimum Interval entre dois checkpoints do sistema 0,1 s; State Data Expiration Time 0 h; Flink Restart Strategy é failure-rate.

Próximos passos

  • Utilize o recurso de diagnóstico inteligente de deployments para monitorar a integridade do deployment e garantir a estabilidade do negócio. Para obter detalhes, consulte Perform intelligent job diagnostics.

  • Melhore o desempenho de deployments Flink SQL por meio de configurações de deployment e otimização de consultas. Para obter detalhes, consulte Optimize Flink SQL.