O STAROps é uma plataforma inteligente de O&M baseada em modelos de linguagem grandes e tecnologias de agentes de IA. Ela integra dados de observabilidade entre domínios ao raciocínio de LLMs para permitir a definição de objetivos operacionais em linguagem natural. Os agentes de IA gerenciam autonomamente o planejamento, a execução e a verificação, oferecendo operações autônomas 24 horas por dia, 7 dias por semana, que protegem a resiliência dos negócios em tempo real.
O que significa STAR?
Cada letra da sigla STAR representa um princípio fundamental de design da plataforma:
S — Sense: observabilidade holística. O STAROps elimina silos de dados ao coletar logs, métricas, rastros e dados de topologia por meio de um modelo unificado (UModel). Ele cria um gêmeo digital do sistema em tempo real, captura mudanças de estado com granularidade de microssegundos e fornece contexto preciso e atualizado para decisões orientadas por IA.
T — Target: operações orientadas a metas. Em vez de apenas reagir a alertas, o STAROps foca as atividades de O&M no alcance de objetivos. Defina seus propósitos de negócios e operacionais em linguagem natural. A plataforma avalia continuamente desvios em relação às metas em várias dimensões e identifica fatores que impactam os resultados.
A — Autonomy: operações autônomas. A coordenação de múltiplos agentes conduz um ciclo completo de percepção-decisão-execução-verificação sem intervenção humana repetida, viabilizando operações autônomas ininterruptas. Ações de alto risco mantêm a aprovação Human-in-the-Loop (HIL) para equilibrar autonomia e segurança.
R — Resilience: resiliência dos negócios. O STAROps substitui a abordagem reativa de combate a incidentes por uma proteção proativa. Inspeções contínuas detectam riscos antecipadamente. Quando ocorrem incidentes, a plataforma executa automaticamente a correção (dimensionamento, rollback ou redirecionamento de tráfego) e verifica os resultados, o que reduz significativamente o Tempo Médio de Recuperação (MTTR). Além disso, ela captura a experiência operacional em um grafo de conhecimento para permitir que as capacidades de resiliência evoluam ao longo do tempo.
Capacidades principais
O STAROps oferece três capacidades essenciais:
AI Chat
Analise alertas, consulte dados, interprete métricas e investigue logs em linguagem natural para transformar operações tediosas de linha de comando em insights instantâneos. Inicie sessões em diversos portais, incluindo STAROps, CloudMonitor e Log Service.
Missions
As Missions permitem planos de O&M assíncronos e de longa duração, abrangendo dias ou meses, acionados por agendamentos ou eventos. Elas convertem intervenções manuais repetitivas em processos automatizados confiáveis. Um mecanismo integrado de Human-in-the-Loop (HIL) garante que operações de alto risco exijam aprovação explícita.
Digital Employees
O SRE Agent é o executor inteligente do STAROps. Crie agentes de SRE específicos para sua empresa com responsabilidades, permissões, ferramentas e habilidades personalizadas para seus cenários de negócios. Essa abordagem reduz custos de customização e acelera a produtividade em P&D e operações. Cada funcionário digital atua tanto como assistente conversacional quanto como executor de tarefas de longa duração.
Pontos fortes principais
|
Benefício |
Descrição |
|
Plataforma de dados unificada |
Armazenamento unificado de dados de observabilidade para logs, topologias, métricas e rastros. Suporta ingestão diária na escala de petabytes, armazenamento na escala de EB e análise em segundos sobre centenas de bilhões de registros. A implantação multizona oferece 99,99% de confiabilidade. |
|
Gêmeo digital de operações |
Baseado no UModel, o gêmeo digital modela uniformemente aplicações, serviços, recursos, topologias, alarmes e relações de mudança. Oferece suporte a extensões personalizadas, inferência de topologia em tempo real e análise causal. |
|
Operador de análise de dados em streaming |
Operadores de análise de uso geral e potencializados por IA cobrem detecção de anomalias em métricas, clusterização de logs, análise de rastros, profiling de desempenho e rastreamento de mudanças. Esses operadores aumentam a eficácia da análise de causa raiz (RCA) e reduzem os custos de inferência. |
|
Solução de integração flexível |
Disponibiliza diversas opções de integração, como OpenAPI, integração de páginas e integração com IM (DingTalk e Feishu), para conectar fluxos de trabalho existentes de maneira flexível. |
Garantia de segurança e conformidade
Política de autorização refinada: A autorização hierárquica de funções do RAM para operadores e funcionários digitais controla o que as pessoas podem fazer e o que os agentes podem acessar. Isso aplica o princípio de menor privilégio e mitiga riscos de operações não autorizadas.
Intervenção manual: Conecte ferramentas via MCP com Human-in-the-Loop (HIL) configurado. Operações de escrita de alto risco exigem confirmação manual, e um mecanismo de bloqueio intercepta ações anômalas para evitar erros operacionais e comportamentos maliciosos.
Auditoria de comportamento do agente: Mantém registros completos do histórico de conversas, artefatos de runtime, chamadas de ferramentas, comandos CLI e acessos a dados. Todo o ciclo de vida do comportamento do agente torna-se evidência de auditoria rastreável e repetível para revisões de conformidade e segurança.
Criptografia de dados ponta a ponta: Todos os dados em trânsito são criptografados via HTTPS/TLS. Os dados de observabilidade são criptografados em repouso usando o KMS, e os artefatos dos agentes recebem a mesma proteção, garantindo privacidade e integridade dos dados em todo o pipeline.
Cenários típicos
Inspeção inteligente agendada de clusters Kubernetes: verifique automaticamente a saúde do cluster diariamente, gera relatórios estruturados e compara diferenças históricas.
Garantia de alta disponibilidade para serviços críticos: monitora continuamente os serviços principais e realiza automaticamente a análise de causa raiz (RCA) quando um alerta é disparado.
Diagnóstico de falhas orientado por linguagem natural: restrinja o escopo de troubleshooting por meio de diálogos em múltiplas rodadas e realize análises de correlação usando a topologia do UModel.
Verificações regulares de qualidade de dados: monitora a saúde do pipeline de dados conforme agendamento e notifica você automaticamente sobre exceções.
Geração automatizada de relatórios de O&M: agrega dados operacionais semanal ou mensalmente e produz relatórios estruturados.