阿里雲CloudMonitor2.0是融合Log ServiceSLS、CloudMonitorCMS、應用即時監控服務ARMS產品後全新升級的一站式可觀測平台,可將指標、鏈路、日誌、事件彙集於統一視圖。基於 UModel 建模與觀測圖譜,結合可視化和警示能力,實現資源自動關聯與智能診斷,提供從基礎設施到應用程式層的全鏈路、端到端的統一觀測,快速發現並解決潛在問題,提高營運效率。廣泛適用於微服務、容器、雲產品等複雜情境。
CloudMonitor2.0藉助AI增強跨域智能洞察,能夠即時分析和預測系統效能,提前識別異常情況,並提供智能化的故障診斷和最佳化建議,協助企業在 AI-native 時代以更智能、更高效、更低成本的方式構建全棧可觀測體系,為業務穩定性與安全性保駕護航。
功能體驗
阿里雲Playground提供了CloudMonitor2.0主要功能的示範環境,便於您快速瞭解及體驗CloudMonitor2.0。
請訪問 Playground Demo,預設進入工作空間。
產品優勢
一站式融合觀測
CloudMonitor2.0深度整合了原CloudMonitor(CMS)、Log Service(SLS)和應用即時監控服務(ARMS)的核心能力,將指標、日誌、鏈路、事件等多種資料來源融於一體。您無需再部署和維護多套獨立的監控工具,即可在一個統一的平台上實現從底層基礎設施到上層應用的全方位、端到端觀測,顯著降低了監控體系的複雜度和管理成本。
資料統一建模
基於 UModel (Universal Observability Model)將指標(Metrics)、日誌(Logs)、鏈路(Traces)、變更(Changes)等資料孤島全面打通,構建起IT系統的全景數字視圖。讓人、程式和AI都能夠理解和分析可觀測資料,從而構建真正的全棧可觀測能力,提升問題定位效率。
AI 驅動智能分析
以統一的可觀測資料模型為基石,通過使用機器學習技術進行深度模式識別與關聯分析,實現精準的異常檢測、趨勢預測和智能警示降噪。同時利用大語言模型的能力,將複雜的可觀測資料轉化為深度洞察,實現革命性的“對話式營運”——用自然語言與智能助手對話,快速定位、分析和處理問題。
開放相容,擁抱主流生態
CloudMonitor2.0全面擁抱開源技術生態,原生支援Prometheus、Grafana、OpenTelemetry,Elasticsearch等業界主流標準和工具。這使得您現有的監控資產和技術棧可以平滑遷移和接入,無論是雲原生應用還是混合雲環境,都能實現無縫的統一監控,為您提供了一個靈活、開放、無廠商鎖定的解決方案。
新舊版本相容性說明
CloudMonitor 2.0 與 ARMS 舊版警示管理的通知體系互相獨立。ARMS 舊版的通知策略採用匹配規則路由模式,CloudMonitor 2.0 的通知對象採用直接關聯模式(連絡人、IM 機器人、Webhook、排班表)。兩套系統資料結構不同,通知策略和通知對象不能互相可見。
CloudMonitor 2.0 不支援從 ARMS 舊版同步通知策略。建議在CloudMonitor 2.0 的Prometheus 監控模組下統一建立警示規則與通知對象。ARMS 控制台已提供進入CloudMonitor 2.0 的入口。
基本概念
在使用CloudMonitor前,您需要瞭解以下基本概念。
術語 | 說明 |
工作空間(WorkSpace) | 工作空間(WorkSpace)是CloudMonitor2.0中用於表示一組資源集合的抽象層,為企業團隊提供統一的管理和資源分組資料隔離能力,所選地區用於儲存工作區接入的資料和配置資訊。通過使用工作空間,可以建立多個獨立的資源環境,每個資源環境都可以擁有自己的對象集(如雲端服務、基礎設施、服務端和前端應用、中介軟體等),每個組內的資源是相互隔離的,這可防止不同組之間的資源衝突,提高資源使用的安全性。
|
應用(App) | 可觀測App是對WorkSpace下的資料來源進行讀寫操作的載體,在WorkSpace中可以開啟或隱藏,App通常是對於某一特定情境的可觀測領域知識的呈現。具有以下特點:
|
實體(Entity) | 實體Entity是指可觀測的實體物件,例如一個容器叢集或者一台ECS伺服器,對應一個實體Entity。 |
模型(Umodel) | UModel是一個可觀測資料模型定義規範,用於定義各類可觀測對象的模型,包括日誌、指標、Trace、實體等,以及這些可觀測對象之間的關聯關係,以實現可觀測資料的統一定義和管理。 |
功能特性
功能特性 | 描述 |
全棧資料擷取與監控 |
|
智能分析與診斷 |
|
可視化與報表 |
|
警示與通知管理 |
|
開放與整合能力 |
|
安全與高可用 |
|
成本最佳化功能 |
|
跨地區統一管理 | 支援對分布在多個地區的資源實施集中監控和管理,簡化營運工作流程。 |
應用情境
情境 | 情境描述 | 方案優勢 |
情境一:全棧統一監控與即時觀測圖譜 | 企業需同時監控混合雲環境中的物理伺服器、容器叢集、微服務應用及資料庫等資源,但傳統工具分散導致營運效率低。CloudMonitor2.0通過統一採集指標(如CPU、記憶體)、鏈路(如API調用鏈)、日誌(如錯誤記錄檔)及事件(如配置變更),構建端到端觀測圖譜,實現跨資源、跨服務的全域狀態可視化。 |
|
情境二:智能異常檢測與故障預測 | 在流量突增或複雜架構下,人工識別潛在故障難度高。CloudMonitor2.0基於機器學習模型分析歷史資料,即時預測系統容量瓶頸、服務響應延遲等風險,並提前觸發預警。 |
|
情境三:從用戶端到服務端,端到端全鏈路追蹤(APM) | 微服務架構下,單次使用者請求可能涉及數十個服務調用和前後端調用,效能瓶頸難以追蹤。CloudMonitor2.0結合全鏈路追蹤與代碼級診斷,向上連結使用者體驗、向下連結基礎設施,構建全棧觀測圖譜,精準分析慢查詢、死結等問題。 |
|
情境四:安全合規與威脅洞察 | 企業需即時監控登入異常、資料泄露等安全事件,並滿足等保合規審計要求。CloudMonitor2.0通過日誌即時分析、行為模式識別,快速發現潛在威脅。 |
|
情境五:資源最佳化與成本管理 | 雲資源使用不透明易導致資源浪費。CloudMonitor2.0分析資源使用率,推薦Auto Scaling策略與閑置資源釋放方案。 |
|
情境六:智能警示與自動化營運 | 傳統警示易出現誤判或資訊過載。CloudMonitor2.0通過警示降噪、動態閾值及分級通知機制,提升警示精準度,並支援自動化修複動作。 |
|
情境七:開源可觀測組件託管與智能化營運 | 企業在混合雲或多雲環境中廣泛使用開源可觀測工具(如Prometheus、Grafana、OpenTelemetry),但面臨以下挑戰:
|
|
可觀測應用列表
應用類型 | 應用程式名稱 | 描述(中文) |
常駐 | 警示中心 | 集中管理所有警示資訊 |
常駐 | 所有功能 | 集中管理所有應用及其相關服務 |
常駐 | 接入中心 | 提供各種觀測對象和資料的接入與管理 |
常駐 | 實體探索 | 探索不同觀測對象的狀態和效能 |
常駐 | 雲產品監控 | 提供阿里雲服務的基礎監控指標查詢與警示服務 |
應用可觀測 | 應用監控 | 對應用程式效能進行即時監控與故障診斷 |
應用可觀測 | 使用者體驗監控 | 專註於Web、移動端App和小程式情境的監控 |
應用可觀測 | AI應用可觀測 | 提供AI應用的全棧一體化可觀測能力 |
營運監控 | Prometheus服務 | Prometheus全託管雲端服務,實現高效能監控系統 |
營運監控 | 問題響應 | 將警示事件彙總成問題並進行管理 |
營運監控 | 雲撥測 | 類比使用者請求,主動式監控網路品質、服務可用性及使用者體驗 |
營運監控 | 資料庫可觀測 | 為資料庫服務提供一站式可觀測能力 |
營運監控 | 日誌審計 | 記錄並審查動作記錄 |
雲產品洞察 | PAI洞察 | 為人工智慧平台PAI提供一站式全棧可觀測能力 |
雲產品洞察 | 容器洞察 | 深入分析 Kubernetes 叢集的運行狀態 |
雲產品洞察 | ECS 洞察 | 彈性計算服務的進階監控功能 |
智能探索與分析 | UModel Explorer | Entity & Umodel 調試工具 |
智能探索與分析 | Data Explorer | 探索和分析各種監控指標、資料 |
智能探索與分析 | 事件中心 | 統一管理各類事件資訊 |
智能探索與分析 | 儀錶盤 | 展示關鍵計量的綜合儀表板 |
智能探索與分析 | 日誌探索 | 提供日誌資料探索/分析服務 |