O Alibaba Cloud Linux 4 Agentic Edition, também conhecido como Agentic OS, é um sistema operacional Agent-first da Alibaba Cloud, desenvolvido especialmente para AI Agents.
Introdução à imagem
O Agentic OS é um sistema operacional derivado, projetado para Agents com base no sistema operacional desenvolvido internamente pela Alibaba Cloud, o Alibaba Cloud Linux. Ele fornece o melhor ambiente operacional para Agents e melhora a experiência dos clientes da Alibaba Cloud que utilizam essas tecnologias. O Agentic OS é totalmente compatível com todos os recursos do Alinux4 (otimização de kernel, suporte cloud native, etc.) e constrói uma nova arquitetura de SO alinhada ao estilo cognitivo e ao modo de trabalho do Agent.
|
Camada |
Componentes |
Descrição |
|
Camada de encapsulamento de interação |
cosh |
Alternativa ao shell padrão que hospeda nativamente bash/zsh e recebe tarefas em linguagem natural no mesmo terminal. |
|
OS Skills |
Por meio do mecanismo integrado de pacotes de skills, o Agent interage com a camada de runtime e a camada básica do sistema usando instruções de Skill para obter "capacidades práticas", como implantação, operação e manutenção, diagnóstico e observabilidade. |
|
|
Camada de runtime |
AgentSecCore |
Produto de segurança criado especificamente para AI Agents. Foca nas principais ameaças do ciclo de vida do Agent, como injeção de prompt, execução dinâmica de código, segurança de skills, desvio de intenção e riscos do ambiente do sistema. Crie um mecanismo de defesa multidimensional, profundo e de ciclo fechado no lado do SO ("percepção-decisão-bloqueio-rastreamento") e suporta integração não intrusiva em frameworks de Agent como cosh e OPENCLAW. |
|
AgentSight |
Ferramenta de observabilidade para AI Agents baseada na tecnologia eBPF, utilizável sem intrusão e sem necessidade de modificações.,Monitora em tempo real os AI Agents executados em sistemas Linux, capturando suas chamadas de API LLM, consumo de tokens e comportamento de processos. |
|
|
Tokenless |
Reduz o consumo de tokens na interação entre o Agent e o LLM em duas dimensões: compressão de contexto e filtragem de comandos. Intervém automaticamente por meio de plug-ins e mecanismos de Hook, com suporte a múltiplos frameworks de Agent como cosh, OpenClaw, Hermes, Claude Code, Codex, Qoder e Qwen Code. |
|
|
AgentMemory |
Servidor MCP de memória do Agent baseado em arquivos que fornece um espaço de memória persistente, pesquisável e protegido por sandbox para AI Agents. Por meio da leitura e escrita semântica de memória no sistema de arquivos, combinada com recuperação híbrida BM25/vetorial e mecanismos automáticos de captura e recordação, garante a continuidade do contexto entre sessões. |
|
|
ws-ckpt |
Ferramenta de snapshot e rollback do workspace do AI Agent que permite criar snapshots manualmente antes de operações críticas ou ative snapshots automáticos ao final de cada rodada de perguntas e respostas. Suporta rollback com um clique para qualquer estado histórico, garantindo a reversibilidade do processo de execução. |
|
|
SkillFS |
Sistema de arquivos de montagem sob demanda do Agent Skill baseado em FUSE que expõe ao Agent apenas o subconjunto de Skills necessário no momento. As demais Skills são descobertas sob demanda. O arquivo SKILL.md é compilado dinamicamente de acordo com a versão alvo durante a leitura, e a Skill pode ser ocultada ou revertida para um snapshot confiável com base em decisões de segurança. |
|
|
Camada básica do sistema |
Alinux4 |
Compatível com todos os recursos do Alinux4 (otimização de kernel, suporte cloud native, etc.). |
Escopo de aplicação
Escopo de aplicação do Agentic OS:
-
Aplicável a várias famílias de especificações de instância, incluindo servidores bare metal elásticos. Para mais informações, consulte Instance family overview.
Suporte exclusivo à arquitetura de CPU X86.
Memória da instância recomendada >= 2 GB.
Indicado para diversas cargas de trabalho em cenários de Agent, incluindo frameworks mainstream como OpenClaw, qwenpaw, Claude Code, entre outros.
Custos
O Agentic OS é uma imagem de sistema operacional gratuita. No entanto, ao utilizá-la, é necessário pagar por outros recursos, como chamadas de modelos grandes, vCPU, memória, armazenamento, largura de banda de rede pública, snapshots, etc.
Estabilidade e compatibilidade
O Agentic OS é construído sobre a camada base do sistema do Alibaba Cloud Linux 4 Standard Edition e compartilha o mesmo kernel alnx4. A Agentic Edition adiciona componentes relacionados a AI Agents (incluindo cosh, AgentSecCore, AgentSight, OS Skills, etc.) sobre essa base, sem afetar a estabilidade das funções originais do sistema.
Operações padrão do Linux (como gerenciamento de pacotes yum/dnf, gerenciamento de service systemctl, shell bash, etc.) na Agentic Edition comportam-se da mesma forma que na versão padrão, garantindo compatibilidade retroativa. Scripts existentes de operação e manutenção e hábitos de uso podem ser mantidos.
O Agentic OS possui ferramentas de diagnóstico integradas. Use anolisa doctor para diagnosticar problemas de componentes e anolisa status para visualize o status de integridade dos componentes. O AgentSight fornece observabilidade de AI Agents baseada em eBPF para ajudar na solução de problemas comuns de desempenho e estabilidade do Linux.
Principais vantagens
Economia extrema de tokens: Encapsula conhecimentos complexos de especialistas em SO em Skills padronizadas, reduzindo significativamente a sobrecarga de tokens necessária para compreender o ambiente de execução e realizar tentativas e erros. Isso cria um ciclo fechado sem atrasos entre a intenção e a execução.
Linguagem natural redefine a interação humano-computador: Pela primeira vez, o cosh atua como portal padrão de interação. Os usuários podem usar linguagem natural para conduzir o sistema operacional na conclusão de tarefas diárias de operação e manutenção, como implantação de ambientes e instalação de ferramentas. Adeus à memorização de linhas de comando complexas e bem-vindo a uma mudança fundamental nos métodos operacionais.
Criptografia de segurança de link completo de Skills para construir uma linha de defesa endógena: Implementa assinatura digital e proteção por criptografia para cada Skill, impondo autenticação de identidade e verificação de integridade antes da chamada. Combinado com sandbox de segurança em nível de hardware para isolar comportamentos anormais, garante que o Agent execute com segurança em um ambiente controlado, auditável e com privilégios mínimos, diretamente do nível do kernel do SO.
Introdução aos componentes principais
O Alibaba Cloud Linux 4 Agentic Edition (Agentic OS) contém os seguintes componentes principais: cosh, AgentSecCore, AgentSight, OS Skills, Tokenless, ws-ckpt e AgentMemory. Todos são atualmente open source. Link do repositório: https://github.com/alibaba/anolisa.
Cosh
O cosh é o shell interativo padrão do Alibaba Cloud Linux 4 Agentic Edition (Agentic OS), substituindo o bash como primeira entrada após o login no sistema.
O conceito central de design do cosh é "host Shell nativo + aprimoramento de Agent". Ele hospeda diretamente uma sessão real de bash ou zsh. Comandos Shell são executados conforme a semântica nativa, sem prefixos e sem necessidade de retornar a um ambiente bash independente. Ao solucionar problemas ou processar tarefas maiores, o usuário descreve a intenção em português ou inglês, e o Agent assume a execução levando consigo o contexto mais recente do terminal; comandos iniciados com barra (/) controlam a própria sessão. Os três tipos de entrada são desviados automaticamente no mesmo prompt, eliminando a necessidade de trocar de ambiente durante todo o processo.
Mantendo total compatibilidade com bash/zsh, o cosh adiciona recursos como compreensão de linguagem natural, chamada de Skills, integração de ferramentas MCP e controle de aprovação multinível. Ele consolida ainda mais as operações de manutenção do sistema em uma interface de comando estruturada cross-distribuição, o cosh-cli, e abre o runtime do Agent como uma interface de integração headless, o cosh-core. O cosh abstrai capacidades complexas de nível de sistema em interações de linguagem natural e integra instruções de OS Skills, o que reduz a barreira de uso do sistema operacional e permite que tanto usuários humanos quanto Agents conduzam o SO a concluir tarefas de maneira simples.
O cosh fornece principalmente as seguintes capacidades:
|
Capacidade |
Descrição |
|
Experiência de shell nativo |
Sessões bash/zsh hospedadas diretamente; programas interativos, pipes, redirecionamentos, controle de jobs, perfis de usuário e Ctrl+C funcionam com semântica nativa. |
|
Tarefas em linguagem natural |
Descreva objetivos de troubleshooting ou operação e manutenção em português ou inglês. O Agent carrega automaticamente as evidências mais recentes do terminal para execução e retorna os resultados via streaming no próprio terminal. |
|
Análise proativa |
Quando um comando falha ou gera saída de diagnóstico, avalia se vale a pena intervir e sugere o próximo passo. Suporta os modos smart, auto e manual. |
|
Aprovação multinível |
Antes de chamar a ferramenta, segue os modos recommend, auto ou trust para determinar execução automática ou exibir cartão de aprovação. Força confirmação manual para operações irreversíveis, como reinicialização e desligamento da máquina. |
|
Skills e MCP |
Carrega skills conforme quatro níveis de prioridade: workspace, usuário, extensão e sistema; acessa ferramentas externas fornecidas pelo service MCP. |
|
Retomada de sessão |
Sessões são isoladas e persistidas por workspace, suportando listagem, recuperação e compressão para facilitar troubleshooting de longa duração. |
|
Operações de SO estruturadas |
O cosh-cli fornece operações de pacotes de software, service de sistema, snapshots de workspace e auditoria de segurança com um contrato JSON unificado, abstraindo diferenças entre distribuições. |
|
Integração headless |
O cosh-core disponibiliza o runtime do Agent via protocolo JSONL para integração com outros front-ends e processos automatizados. |
OS Skills
OS Skills é um manual de usuário do sistema operacional escrito pelo Agentic OS para AI Agents.
A documentação tradicional de sistemas operacionais é voltada para usuários humanos e depende de descrições em linguagem natural, capturas de tela e consensos implícitos da indústria. Quando o Agent lê esse tipo de documento, precisa consumir uma grande quantidade de tokens para compreendê-lo. As instruções de OS Skills reorganizam o conhecimento do sistema operacional em um formato estruturado que o Agent pode entender e executar diretamente — a SKILL. O Agent não precisa mais "ler o documento e depois operar"; ele "consegue agir assim que lê".
O manual de OS Skills cobre duas áreas principais:
|
Área do manual |
Domínio de conhecimento correspondente |
Conteúdo abordado |
|
system-admin |
Gestão de sistema |
Gestão de usuários e permissões, gestão de service de sistema, upgrade de kernel e outras operações básicas de administração do sistema. |
|
security |
Segurança do sistema |
Inspeção de baseline de segurança do sistema, varredura e correção de vulnerabilidades, etc. |
|
system-ops |
Operação e manutenção do sistema |
Fornece capacidades de diagnóstico para problemas comuns de desempenho e estabilidade do Linux. |
Ao receber a intenção do usuário, o Agent corresponde automaticamente à Skill apropriada e a executa, sem necessidade de especificar manualmente o caminho de chamada.
AgentSecCore
O AgentSecCore é um kernel de segurança em nível de sistema operacional para a plataforma de execução de AI Agents. No contexto em que AI Agents ganham progressivamente capacidades de execução no nível do SO (incluindo leitura e escrita de arquivos, acesso à rede, gestão de processos, etc.), os limites tradicionais de segurança de aplicações deixam de ser aplicáveis. O AgentSecCore constrói um sistema de defesa profunda para Agents a partir do nível do SO, garantindo que eles executem com segurança em um ambiente controlado, auditável e com privilégios mínimos.
O AgentSecCore estabeleceu um sistema de defesa profunda em três camadas em torno de dois pilares: "segurança de intenção" e "segurança em nível de sistema". Mesmo que uma camada anterior seja violada, as camadas subsequentes ainda conseguem conter a ameaça. A arquitetura, de baixo para cima, é:
|
Camada |
Capacidade de proteção |
Implementação técnica |
|
Primeira camada: definir limites antes da execução (prevenção) |
Prompt Scanner Code Scanner Skill Ledger |
Motor de detecção de injeção de prompt e jailbreak (progressão em três níveis: regras + ML + recuperação vetorial). Interceptor de segurança pré-execução de código (28 regras de detecção, suporta Shell/Python). Motor à prova de adulteração de integridade de Skills (assinatura de snapshot + cadeia de versões append-only + varredura de segurança em quatro etapas). |
|
Segunda camada: sensoriamento (detecção) durante a execução |
Observabilidade segura |
Abrange os três domínios de isolamento de sandbox, hardening de sistema e integridade de ativos. Eventos de segurança estruturados são persistidos e relatórios resumidos de segurança são gerados sob demanda. |
|
Terceira camada: base como última linha de defesa (contenção) |
Inspeção de baseline de segurança Isolamento e monitoramento em nível de SO |
Varre automaticamente a base de regras de hardening de segurança em nível de SO para detectar danos causados por agents ao nível de segurança do sistema, gerando relatórios de desvio e sugestões de correção. Baseado em primitivas de segurança do kernel Linux (Namespace/Cgroup/seccomp/Capability), fornece isolamento de sandbox em nível de processo, monitoramento e interceptação de chamadas de sistema e controle granular de permissões. |
AgentSight
O AgentSight é um componente de observabilidade em nível de sistema operacional para a plataforma de execução de AI Agents. Ele resolve o problema do consumo de tokens durante a execução do Agent exceder em muito as expectativas, além da falta de percepção e métodos de rastreamento por parte dos usuários. Permite coleta de dados granular e análise correlacionada de todo o fluxo de operação do Agent sem invadir a lógica de negócio.
O AgentSight fornece principalmente as três capacidades a seguir:
Análise de consumo de tokens: Medição abrangente e atribuição do consumo de tokens durante a execução do Agent. Suporta consultas flexíveis por período ou pelas últimas N horas, permite dividir as source de consumo por múltiplas dimensões (agents, tarefas, funções, etc.) e a granularidade da análise pode chegar a uma única chamada LLM.
Auditoria comportamental: Registro completo do link de chamadas LLM e comportamentos de execução de processos do Agent. Preserva integralmente metadados como provider e versão do modelo de cada chamada, captura sincronamente parâmetros de linha de comando dos processos e suporta filtragem e estatísticas resumidas visuais por tempo, sessão e outras dimensões.
Visualização em Dashboard: Oferece uma interface web visual que suporta acesso direto via navegador local após implantação remota. Permite visualize tendências de consumo de tokens em tempo real, monitorar o status de processos do Agent e fornecer capacidades de reinicialização em caso de anomalias. Também suporta visualização aprofundada camada por camada do trace completo de cada sessão, incluindo entrada do usuário, prompts do modelo, processo de inferência e distribuição de consumo de tokens em cada etapa.
ws-ckpt
O ws-ckpt é a ferramenta de snapshot e rollback em nível de arquivo do Agentic OS (AI Agent Workspace Checkpoint) para workspaces de AI Agents.
AI Agents fazem muitas modificações nos arquivos do workspace ao executar tarefas. Se uma operação for incorreta ou os resultados não forem os esperados, os usuários frequentemente enfrentam dificuldades para recuperar o estado anterior. O mecanismo de snapshot do ws-ckpt fornece capacidades leves de gestão de snapshots para o workspace. Usuários podem crie snapshots manualmente antes de operações críticas ou ative snapshots automáticos ao final de cada rodada de perguntas e respostas. Quando necessário, restaure qualquer estado histórico com um clique, tornando as operações do Agent reversíveis e rastreáveis.
O conceito central de design do ws-ckpt é "fazer um seguro do trabalho do Agent". Usuários podem crie snapshots manualmente via linguagem natural ou CLI antes de execute operações perigosas, ou ative snapshots automáticos ao final de cada rodada de perguntas e respostas durante tarefas frequentes de modificação de arquivos. O sistema conclui automaticamente a inicialização quando um snapshot é criado pela primeira vez, sem configuração adicional.
O ws-ckpt fornece principalmente as seguintes capacidades:
|
Capacidade |
Descrição |
|
Snapshot manual |
Usuários crie snapshots do workspace manualmente via linguagem natural ou comandos CLI antes de operações críticas. |
|
Snapshot automático |
Ative o switch de snapshot automático ao final de cada rodada de perguntas e respostas quando execute tarefas frequentes de modificação de arquivos (atualmente suporta OpenClaw e Hermes). |
|
Rollback com um clique |
Suporta rollback para qualquer snapshot histórico, restaurando o estado completo dos arquivos do workspace para um ponto específico no tempo. |
|
Gestão de snapshots |
Oferece visualização de lista de snapshots e exclusão, além de suportar identificação e descrição personalizadas definidas pelo usuário. |
|
Interação dual-mode |
Suporta tanto interação em linguagem natural (conversa via Agent) quanto modos de operação por comandos CLI. |
Tokenless
O Tokenless é o componente de otimização de tokens do Agentic OS, que reduz o consumo de tokens na interação entre Agent e LLM em duas dimensões: compressão de contexto e filtragem de comandos.
À medida que as tarefas assumidas pelos Agents se tornam cada vez mais complexas, a expansão das definições de ferramentas, a redundância de respostas estruturadas e o ruído na saída de comandos preenchem rapidamente a janela de contexto. Isso não só aumenta o custo de raciocínio, mas também elimina o espaço para comunicação de informações efetivas. O Tokenless constrói um pipeline inteligente de otimização entre o Agent e o LLM: no front-end, as informações descritivas definidas pela ferramenta são automaticamente simplificadas, e campos de baixo valor na resposta são identificados e filtrados; no estágio intermediário, dados estruturados são codificados compactamente para reduzir ainda mais o volume; no back-end, conteúdos interferentes na saída da execução de comandos são filtrados inteligentemente. Os três trabalham juntos para reduzir significativamente a sobrecarga de tokens sem alterar a semântica do comportamento do Agent.
O Tokenless foi projetado para permitir que Agents usem menos tokens para concluir a mesma tarefa. Todo o processo de otimização intervém automaticamente por meio de plug-ins e mecanismos de Hook, sendo completamente transparente para o framework de Agent upstream sem modificar o código de negócio. Todos os efeitos de compressão são registrados quantitativamente, fornecendo suporte de dados para avaliar os benefícios da otimização.
O Tokenless suporta sete frameworks de Agent: cosh, OpenClaw, Hermes Agent, Claude Code, Codex, Qoder CLI e Qwen Code. Entre eles, o cosh é integrado por padrão e entra em vigor automaticamente após a instalação via rpm, sem configuração adicional. Os outros frameworks completam o registro de plug-in com um clique através de scripts/install.sh em cada diretório de adaptador.
O Tokenless fornece principalmente as seguintes capacidades:
|
Capacidade |
Descrição |
|
Compressão de contexto |
Simplifica definições de ferramentas de Function Calling, filtra informações interferentes em respostas de comandos CLI e codifica/comprime compactamente dados estruturados. |
|
Rastreamento de estatísticas |
Registra automaticamente comparações antes e depois da compressão e resume as economias por tipo. |
|
Integração transparente |
Intervenção automática via plug-ins e Hooks, com intrusão zero no framework do Agent. |
AgentMemory
O Agent-Memory é o servidor MCP de memória baseado em arquivos do Agentic OS, que fornece aos AI Agents um espaço de memória persistente, pesquisável e protegido por sandbox.
Agents enfrentam o problema de fragmentação de memória ao executar tarefas entre sessões: cada nova conversa começa do zero, e resultados de análises anteriores, registros de decisão e preferências do usuário não podem ser reutilizados. O Agent-Memory usa o sistema de arquivos como modelo de memória e constrói um pipeline de acesso padronizado entre o Agent e o repositório de memória: no lado do armazenamento, o Agent lê e escreve conteúdo de memória como se operasse arquivos, suportando isolamento de namespace e sandboxing de caminho; no lado da recuperação, utiliza busca híbrida BM25 e vetores densos para recordar fragmentos de memória relevantes conforme a semântica; no lado da governança, fornece controle de versão git e backup de snapshot para garantir que a memória seja rastreável e reversível. Os três trabalham juntos para permitir que a memória do Agent ultrapasse os limites da sessão e alcance a continuidade do contexto.
O Agent-Memory foi projetado para permitir que Agents usem menos tokens para concluir tarefas entre sessões. Todo o service expõe 37 ferramentas padrão via protocolo MCP, suporta qualquer cliente MCP stdio como Claude Code, Cursor e Continue, e é completamente transparente para o framework de Agent upstream sem modificar o código de negócio. O sandbox de segurança em nível de kernel (openat2) protege o repositório de memória contra travessia de caminho ou escape de link simbólico, e a detecção de injeção de prompt com empacotamento de escape garante que o conteúdo de memória injetado no LLM seja seguro e controlável.
O Agent-Memory fornece principalmente as seguintes capacidades:
|
Capacidade |
Descrição |
|
Memória baseada em arquivos |
Leitura e escrita de memória baseadas na semântica do sistema de arquivos, suporte a isolamento de namespace e sandbox de caminho, além de 11 ferramentas de operação de arquivos como leitura, escrita, anexação, edição, busca e exclusão. |
|
Busca semântica híbrida |
Recuperação fusionada BM25 + vetor denso + RRF, suporta provedores de embedding OpenAI e Ollama, e inclui segmentação de palavras trigram amigável ao chinês. |
|
Integração transparente |
O OpenClaw fornece 37 ferramentas padrão via protocolo MCP. Instale plug-ins no OpenClaw com um clique através de scripts/install.sh, com intrusão zero no framework do Agent. |