Uma malha de serviço de modelos oferece uma infraestrutura escalável e de alto desempenho para gerenciar, implantar e agendar vários serviços de modelo. Ela simplifica a implantação de modelos, o controle de versão, o roteamento e o balanceamento de carga das solicitações de inferência.
O que é uma malha de serviço de modelos
A malha de serviço de modelos é um padrão arquitetônico para implantar e gerenciar serviços de modelos de machine learning em ambientes distribuídos.
Esse padrão implanta os modelos como serviços escaláveis e usa a malha para gerenciá-los e roteá-los. A malha abstrai os serviços de modelo em unidades orquestráveis e escaláveis, simplificando a implantação, o dimensionamento e o controle de versão. Além disso, fornece recursos essenciais como balanceamento de carga, Auto Scaling e recuperação de falhas para garantir alta disponibilidade e confiabilidade. Os modelos podem ser dimensionados automaticamente e ter sua carga balanceada com base no payload da solicitação de inferência.
A malha também disponibiliza recursos avançados, como divisão de tráfego, testes A/B e lançamentos graduais, proporcionando maior controle sobre o tráfego dos serviços de modelo. É possível alternar entre diferentes versões de modelos e revertê-las com facilidade. A malha suporta roteamento dinâmico e direciona as solicitações ao serviço de modelo apropriado conforme as propriedades da requisição, como tipo de modelo, formato de dados ou outros metadados.
Desenvolvedores podem implantar, gerenciar e dimensionar modelos de machine learning por meio da malha, obtendo alta disponibilidade, elasticidade e flexibilidade para diversos cenários de negócios.