Use um nó Flink JAR Streaming para executar tarefas em tempo real do Flink a partir de um pacote JAR. No DataWorks, selecione um recurso Flink JAR carregado como ponto de entrada do job, configure a classe de ponto de entrada e os parâmetros de execução e, em seguida, desenvolva e implante uma tarefa de processamento de dados em tempo real. Este tópico descreve como desenvolver e configurar um nó Flink JAR Streaming no DataWorks.
Pré-requisitos
Você associou um mecanismo de computação Flink totalmente gerenciado na Administração. Para mais informações, consulte Associar um recurso de computação Flink totalmente gerenciado.
Você carregou um recurso Flink JAR. Para mais informações, consulte Recursos e funções do Flink.
Você criou um nó Flink JAR Streaming. Para mais informações, consulte Criar nós para fluxos de trabalho agendados.
-
Você concedeu as seguintes permissões de OpenAPI ao usuário RAM ou à função RAM que o DataWorks usa para chamar a OpenAPI do Realtime Compute for Apache Flink. Essas permissões são necessárias para enviar e implantar tarefas de nó em um cluster Flink.
{ "Version": "1", "Statement": [ { "Effect": "Allow", "Action": ["stream:CreateDeployment", "stream:UpdateDeployment", "stream:GetDeployment", "stream:DeleteDeployment"], "Resource": ["*"] } ] }
Limitações
Este nó não pode fazer parte de um fluxo de trabalho; desenvolva-o e execute-o como um nó independente.
Somente grupos de recursos serverless são compatíveis. Grupos de recursos exclusivos legados para agendamento não têm suporte.
Etapa 1: Configurar o nó Flink JAR Streaming
Na página de edição do nó Flink JAR Streaming, configure os seguintes parâmetros.
Parâmetros principais
No painel esquerdo da página de edição do nó, defina os parâmetros abaixo.
Parâmetro | Descrição |
JAR file | Obrigatório. Selecione um recurso Flink JAR no Gerenciamento de Recursos. |
Entry point class | Classe de ponto de entrada do seu programa. Caso o pacote JAR não especifique uma classe principal, insira o nome totalmente qualificado da classe de ponto de entrada. |
Entry point main arguments | Argumentos principais do job, transmitidos ao método main. Vários argumentos são aceitos. |
Additional dependencies | Selecione um arquivo Flink carregado como dependência adicional na lista suspensa. Nota Se o destino de implantação no recurso de computação Flink estiver definido como um cluster Session, as dependências adicionais não terão efeito. |
Configurar recursos do Flink
Na seção Flink resource information do painel Real-Time configuration, localizado no lado direito da página de edição, configure os parâmetros a seguir conforme o Resource Mode. Para mais detalhes, consulte Configurar recursos do job.
Parâmetro | Descrição |
Flink cluster | Nome do recurso de computação Flink totalmente gerenciado associado na Administração. |
Flink engine version | Selecione uma versão do mecanismo de acordo com seus requisitos de negócio. |
Resource Group | Selecione um grupo de recursos serverless que possua conectividade de rede com o Flink. |
Resource Mode | Dois modos são compatíveis. Para mais informações, consulte Configurar recursos do job.
|
Job Manager cpu | Conforme as melhores práticas do Flink, o JobManager requer pelo menos 0,5 núcleo de cpu e 2 GiB de memória para operação estável. Recomenda-se 1 núcleo de cpu e 4 GiB de memória, com limite máximo de 16 núcleos de cpu. |
Job Manager Memory | A configuração de memória do JobManager impacta sua capacidade de lidar com tarefas de agendamento e gerenciamento. O intervalo recomendado varia de 2 GiB a 64 GiB. |
Task Manager cpu | A configuração de cpu do TaskManager influencia diretamente sua capacidade de processamento de tarefas. Recomenda-se no mínimo 0,5 núcleo de cpu e 2 GiB de memória, sendo ideal 1 núcleo de cpu e 4 GiB de memória, até o limite de 16 núcleos de cpu. |
Task Manager Memory | A memória configurada para o TaskManager determina o volume de dados e o desempenho no processamento de tarefas. O tamanho mínimo é de 2 GiB e o máximo de 64 GiB. |
Concurrency | Define o número de execuções paralelas de tarefas em um job Flink. Uma concorrência maior pode aumentar a velocidade de processamento e a utilização de recursos. Defina este parâmetro considerando os recursos do cluster e as características do job. |
Number of slots per TaskManager | A quantidade de slots por TaskManager define quantas tarefas podem ser executadas simultaneamente. Ajuste essa configuração para otimizar a utilização de recursos e a capacidade de processamento paralelo. |
(Opcional) Configurar parâmetros de script
Na seção Script Parameters do painel Real-Time configuration à direita, clique em Add parameters e edite o Parameter name e o Parameter Value.
(Opcional) Configurar parâmetros de execução do Flink
Na seção Flink running parameters do painel Real-Time configuration à direita, configure os parâmetros listados abaixo. Para mais informações, consulte Configurar implantação do job.
Parâmetro | Descrição |
System Checkpoint Interval | Especifica o intervalo em que o Flink realiza checkpoints de sistema periodicamente. Um intervalo menor reduz o tempo de recuperação de falhas, mas aumenta a sobrecarga do sistema. Se não especificado, os checkpoints de sistema ficam desativados. |
Minimum time interval between two system checkpoints | Define o tempo mínimo de pausa que o Flink deve aguardar entre checkpoints consecutivos, evitando que execuções excessivamente frequentes afetem o desempenho do sistema. |
State data expiration time | Indica a duração máxima que os dados de estado em um job Flink podem ser retidos sem acesso ou atualização. O valor padrão é 36 horas. Importante O valor padrão segue as melhores práticas em nuvem e difere do valor padrão open source (0, que significa que os dados de estado nunca expiram). |
Others | Outros parâmetros de execução do Flink são aceitos. Exemplo: |
Após concluir a configuração da tarefa, clique em Save para salvar a tarefa do nó.
Etapa 2: Iniciar o nó Flink JAR Streaming
-
Implante o nó Flink JAR Streaming.
As tarefas precisam ser implantadas no Operation Center antes da execução. Siga as instruções na tela para implantar o nó Flink JAR Streaming. Para mais informações, consulte Implantação de nós e fluxos de trabalho.
-
Inicie o nó Flink JAR Streaming.
Depois de implantar a tarefa, clique em Go to operation and maintenance abaixo de Deploy to production environment. No Operation Center, acesse , localize a tarefa desejada e clique em Start na coluna Operation para iniciar e monitorar a tarefa em tempo real.