Todos os produtos
Search
Central de documentação

STAROps:O que é o STAROps

Última atualização: Jul 02, 2026

O STAROps é uma plataforma inteligente de O&M baseada em modelos de linguagem grandes e tecnologias de agentes de IA. Ela integra dados de observabilidade entre domínios ao raciocínio de LLMs para permitir a definição de objetivos operacionais em linguagem natural. Os agentes de IA gerenciam autonomamente o planejamento, a execução e a verificação, oferecendo operações autônomas 24 horas por dia, 7 dias por semana, que protegem a resiliência dos negócios em tempo real.

O que significa STAR?

Cada letra da sigla STAR representa um princípio fundamental de design da plataforma:

  • S — Sense: observabilidade holística. O STAROps elimina silos de dados ao coletar logs, métricas, rastros e dados de topologia por meio de um modelo unificado (UModel). Ele cria um gêmeo digital do sistema em tempo real, captura mudanças de estado com granularidade de microssegundos e fornece contexto preciso e atualizado para decisões orientadas por IA.

  • T — Target: operações orientadas a metas. Em vez de apenas reagir a alertas, o STAROps foca as atividades de O&M no alcance de objetivos. Defina seus propósitos de negócios e operacionais em linguagem natural. A plataforma avalia continuamente desvios em relação às metas em várias dimensões e identifica fatores que impactam os resultados.

  • A — Autonomy: operações autônomas. A coordenação de múltiplos agentes conduz um ciclo completo de percepção-decisão-execução-verificação sem intervenção humana repetida, viabilizando operações autônomas ininterruptas. Ações de alto risco mantêm a aprovação Human-in-the-Loop (HIL) para equilibrar autonomia e segurança.

  • R — Resilience: resiliência dos negócios. O STAROps substitui a abordagem reativa de combate a incidentes por uma proteção proativa. Inspeções contínuas detectam riscos antecipadamente. Quando ocorrem incidentes, a plataforma executa automaticamente a correção (dimensionamento, rollback ou redirecionamento de tráfego) e verifica os resultados, o que reduz significativamente o Tempo Médio de Recuperação (MTTR). Além disso, ela captura a experiência operacional em um grafo de conhecimento para permitir que as capacidades de resiliência evoluam ao longo do tempo.

Capacidades principais

O STAROps oferece três capacidades essenciais:

AI Chat

Analise alertas, consulte dados, interprete métricas e investigue logs em linguagem natural para transformar operações tediosas de linha de comando em insights instantâneos. Inicie sessões em diversos portais, incluindo STAROps, CloudMonitor e Log Service.

Missions

As Missions permitem planos de O&M assíncronos e de longa duração, abrangendo dias ou meses, acionados por agendamentos ou eventos. Elas convertem intervenções manuais repetitivas em processos automatizados confiáveis. Um mecanismo integrado de Human-in-the-Loop (HIL) garante que operações de alto risco exijam aprovação explícita.

Digital Employees

O SRE Agent é o executor inteligente do STAROps. Crie agentes de SRE específicos para sua empresa com responsabilidades, permissões, ferramentas e habilidades personalizadas para seus cenários de negócios. Essa abordagem reduz custos de customização e acelera a produtividade em P&D e operações. Cada funcionário digital atua tanto como assistente conversacional quanto como executor de tarefas de longa duração.

Pontos fortes principais

Benefício

Descrição

Plataforma de dados unificada

Armazenamento unificado de dados de observabilidade para logs, topologias, métricas e rastros. Suporta ingestão diária na escala de petabytes, armazenamento na escala de EB e análise em segundos sobre centenas de bilhões de registros. A implantação multizona oferece 99,99% de confiabilidade.

Gêmeo digital de operações

Baseado no UModel, o gêmeo digital modela uniformemente aplicações, serviços, recursos, topologias, alarmes e relações de mudança. Oferece suporte a extensões personalizadas, inferência de topologia em tempo real e análise causal.

Operador de análise de dados em streaming

Operadores de análise de uso geral e potencializados por IA cobrem detecção de anomalias em métricas, clusterização de logs, análise de rastros, profiling de desempenho e rastreamento de mudanças. Esses operadores aumentam a eficácia da análise de causa raiz (RCA) e reduzem os custos de inferência.

Solução de integração flexível

Disponibiliza diversas opções de integração, como OpenAPI, integração de páginas e integração com IM (DingTalk e Feishu), para conectar fluxos de trabalho existentes de maneira flexível.

Garantia de segurança e conformidade

  • Política de autorização refinada: A autorização hierárquica de funções do RAM para operadores e funcionários digitais controla o que as pessoas podem fazer e o que os agentes podem acessar. Isso aplica o princípio de menor privilégio e mitiga riscos de operações não autorizadas.

  • Intervenção manual: Conecte ferramentas via MCP com Human-in-the-Loop (HIL) configurado. Operações de escrita de alto risco exigem confirmação manual, e um mecanismo de bloqueio intercepta ações anômalas para evitar erros operacionais e comportamentos maliciosos.

  • Auditoria de comportamento do agente: Mantém registros completos do histórico de conversas, artefatos de runtime, chamadas de ferramentas, comandos CLI e acessos a dados. Todo o ciclo de vida do comportamento do agente torna-se evidência de auditoria rastreável e repetível para revisões de conformidade e segurança.

  • Criptografia de dados ponta a ponta: Todos os dados em trânsito são criptografados via HTTPS/TLS. Os dados de observabilidade são criptografados em repouso usando o KMS, e os artefatos dos agentes recebem a mesma proteção, garantindo privacidade e integridade dos dados em todo o pipeline.

Cenários típicos

  • Inspeção inteligente agendada de clusters Kubernetes: verifique automaticamente a saúde do cluster diariamente, gera relatórios estruturados e compara diferenças históricas.

  • Garantia de alta disponibilidade para serviços críticos: monitora continuamente os serviços principais e realiza automaticamente a análise de causa raiz (RCA) quando um alerta é disparado.

  • Diagnóstico de falhas orientado por linguagem natural: restrinja o escopo de troubleshooting por meio de diálogos em múltiplas rodadas e realize análises de correlação usando a topologia do UModel.

  • Verificações regulares de qualidade de dados: monitora a saúde do pipeline de dados conforme agendamento e notifica você automaticamente sobre exceções.

  • Geração automatizada de relatórios de O&M: agrega dados operacionais semanal ou mensalmente e produz relatórios estruturados.