O EAS oferece recursos de observabilidade que incluem logs em tempo real, coleta de logs do SLS, monitoramento de service, painéis de monitoramento, alertas de monitoramento e monitoramento via Prometheus. Esses recursos cobrem todo o fluxo, desde a detecção e solução de problemas até análises de longo prazo.
Visão geral
Logs, monitoramento e alertas desempenham funções distintas na resposta a incidentes:
Logs: Registram a saída detalhada do service — mensagens de inicialização, processamento de requisições e stack traces de erros — para identificar a causa raiz de um problema.
Monitoramento: Revela tendências do service por meio de métricas e gráficos (QPS, latência, taxa de erro, uso de recursos) para detectar anomalias e planejar capacidade.
Alertas: Aplicam limiares às métricas de monitoramento e notificam quando algo sai do esperado, incentivando ações rápidas.
Fluxo típico de solução de problemas: um alerta é disparado → o monitoramento restringe a métrica afetada e a janela de tempo → os logs revelam a causa raiz.
Logs
O EAS oferece os seguintes recursos de registro e log. Escolha a opção mais adequada ao seu caso de uso:
Consultas de logs históricos: Consulte logs anteriores na aba Log da página de detalhes do service. Esse recurso permite filtragem por instância, busca por palavras-chave e filtro por intervalo de tempo, sendo ideal para recuperação e análise de logs.
-
Rastreamento de logs em tempo real: Selecione uma instância na lista Service Instance e clique em Real-time Logs para transmitir a saída contínua do contêiner. Essa opção é recomendada para depuração interativa e cenários que exigem visibilidade em tempo real, como acompanhar a saída de inferência token por token.
NotaOs logs em tempo real não estão disponíveis para services criados antes do lançamento desse recurso. Recrie o service para utilizá-los.
Coleta de logs do SLS: Colete logs do service EAS no SLS por três métodos de integração: a aba Insights para configuração rápida, o Access Center do Cloud Monitor 2.0 para integração em lote e o Logtail do SLS para configuração manual. Essas opções atendem desde a configuração rápida de um único service até coletas personalizadas avançadas. Para mais detalhes, consulte Configure log collection.
-
Persistência de registros de chamadas: Salve todos os registros de requisição e resposta do service no MaxCompute ou no SLS para auditoria, análise de chamadas ou solução de problemas. Para ativar, acesse a seção Features durante a implantação do service e ative Save Call Records. Em seguida, selecione um destino de armazenamento:
MaxCompute: Selecione um MaxCompute Project existente (se não houver nenhum, consulte Create a MaxCompute project) e configure o nome da MaxCompute Table. O sistema cria essa tabela automaticamente no projeto selecionado durante a implantação do service.
Simple Log Service: Selecione um Simple Log Service Project existente (se não houver nenhum, consulte Create a project) e configure o nome do logstore. O sistema cria esse Logstore automaticamente no projeto selecionado durante a implantação do service.
Monitoramento
O EAS disponibiliza cinco recursos de monitoramento. Escolha com base no escopo de monitoramento e na origem das métricas:
Monitoramento de service (por service): Visualize métricas básicas de execução, como QPS, latência, taxa de erro e uso de recursos de um único service, com alternância entre as dimensões Service e Instance. Funciona imediatamente — basta abrir a aba Monitoring na página de detalhes do service. Para mais detalhes, consulte View service monitoring metrics.
Painel de monitoramento (agregação no nível da região): Agrega métricas de service de todos os workspaces da conta atual na região selecionada em um painel unificado, facilitando verificações de integridade de múltiplos services e planejamento de capacidade. A troca de workspaces não altera o escopo dos dados. Para mais detalhes, consulte Monitoring dashboard.
Métricas de monitoramento personalizadas (por service, reportadas pelo usuário): Reporte métricas de negócio, como contagem de tokens de inferência, tamanho do batch e taxa de acerto, para orientar o Auto Scaling. Requer instrumentação no código do seu service. Para mais detalhes, consulte Custom monitoring and auto scaling metrics.
Monitoramento Prometheus (nível da conta, integração com sistemas externos): Conecte as métricas de monitoramento do EAS ao Prometheus por meio do Access Center do Cloud Monitor 2.0, consulte métricas com PromQL e integre com Grafana ou outros sistemas de monitoramento. Inclui métricas avançadas, como métricas do framework de inferência e métricas de computação GPU. Custos adicionais se aplicam. Para mais detalhes, consulte Monitor EAS inference services with Prometheus.
Rastreamento (por service, ARMS): Rastreamento de cadeia de chamadas baseado no ARMS para identificar gargalos de desempenho entre componentes. Algumas imagens oficiais suportam ativação com um clique; para outras imagens, integre o probe do ARMS ao comando de execução. Para mais detalhes, consulte Enable tracing for LLM applications in EAS.
Alertas
O EAS suporta dois cenários de alerta. Escolha com base na origem do gatilho de notificação:
Alertas de métrica: Notificam quando métricas de monitoramento — como taxa de erro, latência ou uso de recursos — ultrapassam um limiar configurado. Crie regras a partir das métricas de monitoramento do service. Para mais detalhes, consulte Configure service monitoring alerts.
Eventos do CloudMonitor: Escutam eventos do ciclo de vida do service — como conclusão de implantação, dimensionamento e encerramentos inesperados de instâncias — e enviam notificações. Para mais detalhes, consulte View EAS events in CloudMonitor.
Perguntas frequentes
P: Por que os logs não aparecem na aba Log da página de detalhes do service?
Causas comuns:
A instância do service ainda não terminou de iniciar — ela ainda está baixando a imagem ou inicializando.
O processo do service não está gravando logs no stdout ou stderr.
A janela de tempo da consulta é muito restrita ou a instância selecionada não possui logs. Amplie o intervalo de tempo ou mude para All instances e tente novamente.
P: Qual a relação entre a aba Log do console e a coleta de logs do SLS?
Ambos servem para consultas de logs posteriores, mas atendem a necessidades diferentes. A aba Log do console funciona imediatamente e é adequada para solução rápida de problemas de um único service em uma janela de tempo recente. Já a coleta de logs do SLS suporta retenção de longo prazo, análise de correlação entre services e arquivamento para conformidade, sendo que a integração pela aba Insights também funciona sem configuração adicional. Ative ambos e escolha o que melhor se adapta ao cenário.