全部產品
Search
文件中心

Cloud Monitor:什麼是CloudMonitor2.0

更新時間:Aug 19, 2026

阿里雲CloudMonitor2.0是融合Log ServiceSLS、CloudMonitorCMS、應用即時監控服務ARMS產品後全新升級的一站式可觀測平台,可將指標、鏈路、日誌、事件彙集於統一視圖。基於 UModel 建模與觀測圖譜,結合可視化和警示能力,實現資源自動關聯與智能診斷,提供從基礎設施到應用程式層的全鏈路、端到端的統一觀測,快速發現並解決潛在問題,提高營運效率。廣泛適用於微服務、容器、雲產品等複雜情境。

CloudMonitor2.0藉助AI增強跨域智能洞察,能夠即時分析和預測系統效能,提前識別異常情況,並提供智能化的故障診斷和最佳化建議,協助企業在 AI-native 時代以更智能、更高效、更低成本的方式構建全棧可觀測體系,為業務穩定性與安全性保駕護航。

功能體驗

阿里雲Playground提供了CloudMonitor2.0主要功能的示範環境,便於您快速瞭解及體驗CloudMonitor2.0。

請訪問 Playground Demo,預設進入工作空間。

產品優勢

一站式融合觀測

CloudMonitor2.0深度整合了原CloudMonitor(CMS)、Log Service(SLS)和應用即時監控服務(ARMS)的核心能力,將指標、日誌、鏈路、事件等多種資料來源融於一體。您無需再部署和維護多套獨立的監控工具,即可在一個統一的平台上實現從底層基礎設施到上層應用的全方位、端到端觀測,顯著降低了監控體系的複雜度和管理成本。

資料統一建模

基於 UModel (Universal Observability Model)將指標(Metrics)、日誌(Logs)、鏈路(Traces)、變更(Changes)等資料孤島全面打通,構建起IT系統的全景數字視圖。讓人、程式和AI都能夠理解和分析可觀測資料,從而構建真正的全棧可觀測能力,提升問題定位效率。

AI 驅動智能分析

以統一的可觀測資料模型為基石,通過使用機器學習技術進行深度模式識別與關聯分析,實現精準的異常檢測、趨勢預測和智能警示降噪。同時利用大語言模型的能力,將複雜的可觀測資料轉化為深度洞察,實現革命性的“對話式營運”——用自然語言與智能助手對話,快速定位、分析和處理問題。

開放相容,擁抱主流生態

CloudMonitor2.0全面擁抱開源技術生態,原生支援Prometheus、Grafana、OpenTelemetry,Elasticsearch等業界主流標準和工具。這使得您現有的監控資產和技術棧可以平滑遷移和接入,無論是雲原生應用還是混合雲環境,都能實現無縫的統一監控,為您提供了一個靈活、開放、無廠商鎖定的解決方案。

新舊版本相容性說明

CloudMonitor 2.0 與 ARMS 舊版警示管理的通知體系互相獨立。ARMS 舊版的通知策略採用匹配規則路由模式,CloudMonitor 2.0 的通知對象採用直接關聯模式(連絡人、IM 機器人、Webhook、排班表)。兩套系統資料結構不同,通知策略和通知對象不能互相可見。

CloudMonitor 2.0 不支援從 ARMS 舊版同步通知策略。建議在CloudMonitor 2.0 的Prometheus 監控模組下統一建立警示規則與通知對象。ARMS 控制台已提供進入CloudMonitor 2.0 的入口。

基本概念

在使用CloudMonitor前,您需要瞭解以下基本概念。

術語

說明

工作空間(WorkSpace)

工作空間(WorkSpace)是CloudMonitor2.0中用於表示一組資源集合的抽象層,為企業團隊提供統一的管理和資源分組資料隔離能力,所選地區用於儲存工作區接入的資料和配置資訊。通過使用工作空間,可以建立多個獨立的資源環境,每個資源環境都可以擁有自己的對象集(如雲端服務、基礎設施、服務端和前端應用、中介軟體等),每個組內的資源是相互隔離的,這可防止不同組之間的資源衝突,提高資源使用的安全性。

  • WorkSpace的地區就是背後資料來源的地區,嚴格本地區封閉,同時也是EntityStore的儲存地區。

  • WorkSpaceName:全域唯一,類似於ProjectName。使用者可以在建立時填寫,如果不填寫,則由系統自動產生。WorkSpace 建立後不支援修改,不可以重名(在API調用過程中作為唯一標識)。

  • WorkSpaceDisplayName:由使用者填寫,可以修改,可以重名。

  • default WorkSpace:預設工作區,名稱格式為 default-cms-{uid}-{regionId}。default WorkSpace 綁定的 SLS Project 名稱與 default WorkSpace id 類似(如default-cms-{uid}-{regionId}),但SLS Project 名稱可能在上述格式基礎上添加了隨機字串,並不完全嚴格遵循此格式。

  • 使用者在region建立的第一個WorkSpace一定是default WorkSpace。

應用(App)

可觀測App是對WorkSpace下的資料來源進行讀寫操作的載體,在WorkSpace中可以開啟或隱藏,App通常是對於某一特定情境的可觀測領域知識的呈現。具有以下特點:

  • APP是輕量級的,可以選擇開啟和關閉(是否在控制台左側導覽列顯示),關閉後也可隨時開啟。不同的使用者(子帳號層級)可以選擇開啟不同的APP。

  • APP是無狀態的,每個WorkSpace中的所有功能都是包含全量APP,如果使用者對APP關聯資料來源沒有許可權,則APP開啟後無資料。

  • APP可以關聯並訪問多個資料來源,通過切換資料來源,透出和IaaS層的關係。

  • 接入中心的接入流程定義了APP的初始化和資料來源的建立。

  • APP中可以引用另一個APP,如explorer、警示等被嵌入到其他各種app中,也可以作為獨立APP存在。

實體(Entity)

實體Entity是指可觀測的實體物件,例如一個容器叢集或者一台ECS伺服器,對應一個實體Entity。

模型(Umodel)

UModel是一個可觀測資料模型定義規範,用於定義各類可觀測對象的模型,包括日誌、指標、Trace、實體等,以及這些可觀測對象之間的關聯關係,以實現可觀測資料的統一定義和管理。

功能特性

功能特性

描述

全棧資料擷取與監控

  • 基礎設施監控

    • 雲資源監控:支援ECS、RDS、SLB、Container Service(ACK/ASK)、Kubernetes Pod等雲產品的效能指標(CPU、記憶體、磁碟、網路流量等)即時採集。

    • 網路效能監測:提供網路延遲、丟包率、DNS解析、TCP/UDP串連狀態等網路層監控能力。

  • 應用效能監控(APM)

    • 分布式鏈路追蹤:追蹤微服務調用鏈,支援Java、Python、Go等主流語言,展示介面耗時、錯誤率、依賴拓撲等。

    • 代碼級診斷:通過線程分析、慢SQL檢測、堆疊追蹤定位應用效能瓶頸。

  • 日誌監控

    • 日誌採集與儲存:支援從伺服器、容器、Function Compute(FC)等情境採集日誌,相容Log4j、Logback等日誌架構。

    • 日誌即時分析:提供SQL文法查詢、關鍵詞警示、日誌群集(如錯誤記錄檔彙總統計)。

智能分析與診斷

  • 異常檢測與警示

    • 動態閾值警示:基於機器學習演算法自動學習指標歷史規律,識別異常波動(如CPU使用率突增)。

    • 多條件組合警示:支援跨指標關聯警示(如“CPU>90%且網路丟包率>5%”觸發警示)。

  • 根因分析(RCA)

    • 智能關聯分析:自動關聯異常指標、日誌錯誤與調用鏈資料,產生故障根因報告(如某API介面逾時引發下遊服務雪崩)。

    • 時序資料回溯:提供歷史資料對比功能,快速定位異常時間點與影響範圍。

可視化與報表

  • 自訂監控看板

    • 拖拽式儀錶盤:支援折線圖、柱狀圖、拓撲圖等可視化組件,靈活組合展示跨資源、跨服務的關鍵計量。

    • 情境化模板庫:預置電商大促、容器叢集、資料庫效能等監控模板,一鍵產生業務全景視圖。

  • 業務大屏

    • 即時資料投屏:支援全屏展示核心業務指標(如訂單量、支付成功率),適配營運作戰室情境。

    • 多租戶視圖隔離:按團隊或業務線分配資料查看許可權,保障資料安全。

警示與通知管理

  • 多渠道警示觸達

    • 通知通道:支援DingTalk、企業微信、簡訊、郵件、Webhook等警示推送,支援分時段靜默(如非工作時間僅通知值班人員)。

    • 警示升級策略:設定分級警示(如“提醒→嚴重→致命”),未及時響應時自動升級通知對象。

  • 警示閉環管理

    • 警示歷史與統計:記錄警示處理狀態(已確認、已恢複),產生MTTR(平均修複時間)分析報表。

    • 與營運工具整合:警示自動觸發工單系統(如DingTalk宜搭)、營運自動化指令碼(如重啟服務)。

開放與整合能力

  • 生態無縫對接

    • 阿里雲服務整合:與Log Service(SLS)、應用即時監控服務(ARMS)、雲效DevOps等深度聯動,實現資料自動關聯(如日誌查詢直接跳轉至異常鏈路)。

    • 第三方工具相容:支援Prometheus、OpenTelemetry、Telegraf等開源協議,相容Grafana可視化、Jenkins持續整合。

  • API與SDK支援

    • OpenAPI管理:通過API實現監控配置自動化(如大量建立警示規則、匯出監控資料)。

    • 自訂指標上報:支援使用者通過SDK上報業務指標(如訂單量、活動PV/UV),擴充監控範圍。

安全與高可用

  • 資料安全保障

    • 端到端加密:監控資料在傳輸(HTTPS)與儲存(加密儲存)過程中全程加密。

    • 許可權管控:基於RAM角色實現精微調權限管理(如“唯讀訪問”“警示配置許可權”)。

    • 安全合規保障,符合各類國際國內安全標準,確保監控過程中的資料轉送和儲存安全可靠。

  • 服務可靠性

    • 全球分布式採集點:監測節點覆蓋全球主要區域,避免網路抖動導致資料丟失。

    • 資料冗餘儲存:監控資料多副本儲存,保障資料可恢複性。

成本最佳化功能

  • 資源流量分析

    • 閑置資源識別:自動標籤長期低負載的ECS執行個體、未綁定的EIP等資源,產生釋放建議。

    • 費用分攤報表:按專案、部門或標籤統計雲資源消耗,支援成本分攤與預算管控。

  • 自適應資料採樣

    • 按需調整採集頻率:對非關鍵計量降低採集頻率(如從1分鐘調整為5分鐘),減少資料存放區成本。

跨地區統一管理

支援對分布在多個地區的資源實施集中監控和管理,簡化營運工作流程。

應用情境

情境

情境描述

方案優勢

情境一:全棧統一監控與即時觀測圖譜

企業需同時監控混合雲環境中的物理伺服器、容器叢集、微服務應用及資料庫等資源,但傳統工具分散導致營運效率低。CloudMonitor2.0通過統一採集指標(如CPU、記憶體)、鏈路(如API調用鏈)、日誌(如錯誤記錄檔)及事件(如配置變更),構建端到端觀測圖譜,實現跨資源、跨服務的全域狀態可視化。

  • 多來源資料融合:支援50+資料來源接入,涵蓋基礎設施、中介軟體、應用程式層,消除資料孤島。

  • 可視化儀錶盤:自訂視圖展示資源拓撲、服務依賴關係及關鍵效能指標(KPI)。

  • 跨域關聯分析:自動關聯異常指標與相關日誌、鏈路資訊,快速定位根因。

情境二:智能異常檢測與故障預測

在流量突增或複雜架構下,人工識別潛在故障難度高。CloudMonitor2.0基於機器學習模型分析歷史資料,即時預測系統容量瓶頸、服務響應延遲等風險,並提前觸發預警。

  • 根因定位:通過指標、鏈路、剖析等資料即時檢測、Realtime Compute,可覆蓋耗時、錯誤率、異常、OOM 等多種情境。

  • 影響面分析:支援業務影響面:終端使用者、前端應用、頁面請求、應用影響面:應用、介面、資料庫、容器 / ECS。

  • Copilot自助探索:通過產生式 AI 自助擷取檢測報告、解決方案等。

  • 警示收斂:跨產品跨執行個體進行警示收斂,防止多次警示,同一根因的警示事件統一收斂。

情境三:從用戶端到服務端,端到端全鏈路追蹤(APM)

微服務架構下,單次使用者請求可能涉及數十個服務調用和前後端調用,效能瓶頸難以追蹤。CloudMonitor2.0結合全鏈路追蹤與代碼級診斷,向上連結使用者體驗、向下連結基礎設施,構建全棧觀測圖譜,精準分析慢查詢、死結等問題。

  • 全棧觀測圖譜:覆蓋各類觀測對象,如服務、介面、雲產品執行個體等,涵蓋豐富的觀測資料,如指標、事件、中繼資料等,並提供跨域的實體關聯關係。

  • 關聯資料查詢與分析:向上:動態、即時擷取上遊訪問終端,關聯分析業務影響面。向下:動態、即時擷取下遊依賴服務(中介軟體、資料庫等)、容器等全量監控資訊。

  • 動態架構感知:提供全景、全域拓撲,動態產生完整 CMDB,且具備自動探索能力。

情境四:安全合規與威脅洞察

企業需即時監控登入異常、資料泄露等安全事件,並滿足等保合規審計要求。CloudMonitor2.0通過日誌即時分析、行為模式識別,快速發現潛在威脅。

  • 即時威脅檢測:基於規則引擎與AI模型識別異常登入、SQL注入等攻擊行為。

  • 合規審計報告:自動產生資源動作記錄報表,支援等保、GDPR等合規要求。

  • 自動化響應:聯動安全性群組或WAF,自動阻斷高危IP訪問。

情境五:資源最佳化與成本管理

雲資源使用不透明易導致資源浪費。CloudMonitor2.0分析資源使用率,推薦Auto Scaling策略與閑置資源釋放方案。

  • 利用率分析:識別低負載ECS執行個體、未掛載磁碟等資源,產生最佳化清單。

  • 成本預測:基於歷史消費趨勢,預估月度賬單並提供降本建議。

  • 自動化彈性:根據流量自動擴縮容Kubernetes叢集或Serverless服務。

情境六:智能警示與自動化營運

傳統警示易出現誤判或資訊過載。CloudMonitor2.0通過警示降噪、動態閾值及分級通知機制,提升警示精準度,並支援自動化修複動作。

  • 警示彙總:合并同類事件,避免週期性通知。

  • 多通道觸達:按嚴重程度分級推送至DingTalk、郵件或簡訊。

  • 自動化指令碼:觸發預置指令碼完成服務重啟、故障節點隔離等操作。

情境七:開源可觀測組件託管與智能化營運

企業在混合雲或多雲環境中廣泛使用開源可觀測工具(如Prometheus、Grafana、OpenTelemetry),但面臨以下挑戰:

  1. 營運複雜度高:自建Prometheus叢集需管理資料擷取、儲存、警示等全鏈路,部署和擴容成本高。

  2. 資料孤島問題:OpenTelemetry鏈路資料與Prometheus指標、Grafana大盤分散儲存,缺乏統一分析能力。

  3. 智能化能力缺失:開源工具依賴人工配置警示規則和根因分析,難以應對AI-native架構的動態性。

  • 降本增效:託管服務免除90%的營運工作量,資源使用率提升30%。

  • 全棧觀測:覆蓋從基礎設施(Prometheus指標)、應用效能(OpenTelemetry鏈路)到使用者體驗(Grafana可視化)的全鏈路觀測。

  • 開放相容:支援與開源生態無縫整合(如Prometheus Operator、Grafana外掛程式),滿足企業混合雲技術棧需求。

可觀測應用列表

應用類型

應用程式名稱

描述(中文)

常駐

警示中心

集中管理所有警示資訊

常駐

所有功能

集中管理所有應用及其相關服務

常駐

接入中心

提供各種觀測對象和資料的接入與管理

常駐

實體探索

探索不同觀測對象的狀態和效能

常駐

雲產品監控

提供阿里雲服務的基礎監控指標查詢與警示服務

應用可觀測

應用監控

對應用程式效能進行即時監控與故障診斷

應用可觀測

使用者體驗監控

專註於Web、移動端App和小程式情境的監控

應用可觀測

AI應用可觀測

提供AI應用的全棧一體化可觀測能力

營運監控

Prometheus服務

Prometheus全託管雲端服務,實現高效能監控系統

營運監控

問題響應

將警示事件彙總成問題並進行管理

營運監控

雲撥測

類比使用者請求,主動式監控網路品質、服務可用性及使用者體驗

營運監控

資料庫可觀測

為資料庫服務提供一站式可觀測能力

營運監控

日誌審計

記錄並審查動作記錄

雲產品洞察

PAI洞察

為人工智慧平台PAI提供一站式全棧可觀測能力

雲產品洞察

容器洞察

深入分析 Kubernetes 叢集的運行狀態

雲產品洞察

ECS 洞察

彈性計算服務的進階監控功能

智能探索與分析

UModel Explorer

Entity & Umodel 調試工具

智能探索與分析

Data Explorer

探索和分析各種監控指標、資料

智能探索與分析

事件中心

統一管理各類事件資訊

智能探索與分析

儀錶盤

展示關鍵計量的綜合儀表板

智能探索與分析

日誌探索

提供日誌資料探索/分析服務