O Edge Node Service (ENS) reduz a latência de acesso ao implantar aplicações mais próximas dos usuários finais. Para manter uma entrega de serviço confiável, também é necessário planejar a alta disponibilidade. Este tópico aborda os principais recursos para criar aplicações de computação de borda resilientes.
Responsabilidades compartilhadas
A continuidade do serviço na nuvem é uma responsabilidade compartilhada entre a Alibaba Cloud e seus clientes.
A Alibaba Cloud garante a estabilidade do ENS e assegura que sua disponibilidade atenda aos compromissos estabelecidos no acordo de nível de serviço (SLA).
Os clientes são responsáveis por projetar a arquitetura de seus serviços para que o failover possa ser executado quando necessário, mantendo assim a continuidade do serviço.
Recomendamos a implementação das seguintes soluções para alcançar a continuidade do serviço em suas aplicações de computação de borda.
Melhores práticas
Recuperação de desastres com múltiplas instâncias
Para obter alta disponibilidade, as aplicações devem suportar cargas elevadas e evitar interrupções causadas por pontos únicos de falha (SPOFs). Utilize o Edge Load Balancer (ELB) para distribuir o tráfego entre várias instâncias do ENS. Para mais informações, consulte O que é o ELB?. Caso uma instância do ENS falhe, o ELB redireciona o tráfego para outras instâncias, preservando a continuidade do serviço.
Recuperação de desastres primário/secundário entre regiões
Alternância entre serviço primário e secundário da aplicação
Ao implantar uma aplicação em um nó de borda, implante backups em outros nós de borda ou em outras regiões da Alibaba Cloud para se proteger contra falhas no nível da região.
Se ocorrer uma falha no nível da região, o Global Traffic Manager (GTM) poderá redirecionar automaticamente o nome de domínio para aplicações em outras regiões, garantindo a continuidade do serviço. Para mais informações, consulte O que é o Global Traffic Manager?
É possível implantar o serviço secundário em outras regiões do ENS ou em regiões próximas da Alibaba Cloud. Observe que a ativação do serviço secundário pode aumentar a latência de acesso para os usuários.
Backup e restauração de dados
O redirecionamento de tráfego ajuda a prevenir interrupções durante falhas no nível da região. No entanto, os serviços de dados na região afetada podem ficar indisponíveis.
Para manter o funcionamento correto dos serviços após um failover, projete uma solução de sincronização de dados que replique as informações da região primária para a secundária durante a operação normal.
Por exemplo, você pode executar as seguintes operações:
Grave dados nos serviços de armazenamento tanto da região atual quanto da região secundária. Essa abordagem mantém os dados quase idênticos entre as regiões, mas pode aumentar a latência de gravação.
Grave os dados primeiro na região primária e depois replique-os de forma assíncrona para a região secundária. Isso evita latência adicional de gravação, porém os dados na região secundária podem ficar desatualizados em relação à primária durante um failover.
Também é necessário projetar um mecanismo de restauração. Após a recuperação da região primária, sincronize todos os novos dados registrados pelo serviço secundário durante o período de falha de volta para a região primária. Isso evita perda de dados quando os usuários forem revertidos para o serviço primário.
Arquitetura de implantação
Combine as práticas anteriores para maximizar a disponibilidade do serviço. A figura a seguir ilustra uma arquitetura de implantação que utiliza ELB, alternância primário/secundário e backup e restauração de dados.
Utilize esses recursos de acordo com os requisitos do seu negócio.
O serviço primário está implantado em um nó de borda na Suíça. Ele utiliza múltiplas instâncias com ELB para evitar interrupções causadas por SPOFs.
O serviço secundário está implantado em um nó de borda próximo na Alemanha e também usa múltiplas instâncias com ELB. Como alternativa, implante o serviço secundário em uma região próxima da Alibaba Cloud. Durante a operação normal, os dados são sincronizados da região primária para a secundária, mantendo a consistência das informações quando ocorrer um failover.
-
O GTM está integrado ao sistema de resolução de nomes de domínio.
O GTM realiza verificações de integridade periódicas no serviço primário na frequência especificada.
Se o serviço primário estiver íntegro, o nome de domínio será resolvido para ele.
Caso o serviço primário apresente problemas e o número de verificações de integridade com falha atinja o limiar definido, o GTM alterna o nome de domínio para o serviço secundário, executando um failover automático.
Durante uma falha no serviço primário, o tráfego é redirecionado para o serviço secundário e os dados são gravados em seu serviço de armazenamento. Após a resolução da falha, sincronize os dados do serviço secundário de volta para o serviço primário.