EAS 提供即時日誌、SLS 日誌採集、服務監控、監控大盤、監控警示、Prometheus 監控等可觀測效能力,覆蓋從故障發現、問題排查到長期分析的完整鏈路。
能力總覽
日誌、監控與警示三類能力在故障處理中各自承擔不同角色:
-
日誌:記錄服務啟動並執行詳細輸出(開機記錄、請求處理日誌、錯誤堆棧),用於精確定位問題根因。
-
監控:以指標和圖表展示服務運行趨勢(QPS、延遲、錯誤率、資源使用率),用於發現異常和容量評估。
-
警示:基於監控指標設定閾值,異常時主動通知使用者,用於觸發響應。
典型故障處理路徑:警示觸發 → 監控定位異常指標和時段 → 日誌深入排查根因。
日誌
EAS 提供以下日誌與記錄能力,按使用情境選擇:
-
歷史日誌查詢:在服務詳情頁的日志頁簽查詢,支援按執行個體篩選、關鍵詞搜尋、時間段過濾。適合進行日誌檢索和日誌分析。
-
即時日誌跟蹤:在服务实例列表中選中某個執行個體,單擊实时日志,可流式查看當前容器的滾動輸出。適合互動式調試和對即時性要求高的情境(如觀察推理過程的逐 token 輸出)。
說明即時日誌功能上線之前建立的服務無法使用即時日誌功能,如需使用請重新建立服務。
-
SLS 日誌採集:將 EAS 服務日誌採集到 SLS,支援通過洞察 Tab 快速接入、CloudMonitor 2.0 接入中心批量接入、SLS Logtail 手動設定三種方式,滿足從單服務快速接入到高階自訂採集的需求。詳見配置日誌採集。
-
調用記錄持久化:將服務的所有請求和響應記錄儲存到 MaxCompute 或 SLS 中,用於審計、調用分析或問題排查。需在部署服務時,於服务功能地區開啟保存调用记录,並選擇儲存目標:
-
大数据MaxCompute:選擇一個已建立的MaxCompute项目(如無請建立MaxCompute專案),並配置MaxCompute数据表名稱。部署服務時,系統會自動在選定的專案中建立此表。
-
日志服务SLS:選擇一個已建立的SLS项目(如無,請建立Project),並配置logstore名稱。部署服務時,系統會自動在選定的專案中建立此 Logstore。
-
監控
EAS 提供五類監控能力,按監控範圍和指標來源選擇:
-
服務監控(單服務):查看單個服務的 QPS、延遲、錯誤率、資源使用率等基礎運行指標,支援按 Service 和 Instance 維度切換。開箱即用,進入服務詳情頁的监控頁簽直接查看。詳情參見服務監控說明。
-
監控大盤(地區級彙總):將當前帳號在當前所選地區下所有工作空間的服務指標匯總到統一看板,用於多服務整體巡檢和容量規劃。切換工作空間不影響資料範圍。詳情參見大盤監控說明。
-
自訂監控指標(單服務,使用者上報):上報推理 token 數、批大小、命中率等業務指標,可用於驅動Auto Scaling。需在服務代碼中按規範打點上報。詳情參見自訂監控及擴縮容指標。
-
Prometheus 監控(帳號級,外部系統整合):通過CloudMonitor 2.0 接入中心將 EAS 監控指標接入 Prometheus,使用 PromQL 查詢指標資料,並對接 Grafana 等自有監控系統。包含推理架構指標、GPU 算力指標等進階指標,會產生額外費用。詳情參見通過Prometheus監控EAS推理服務。
-
鏈路追蹤(單服務,ARMS):基於 ARMS 的調用鏈追蹤,定位跨組件效能瓶頸。部分官方鏡像可一鍵開啟;對於其他鏡像,需在運行命令中整合 ARMS 探針。詳情參見EAS中開啟LLM應用鏈路追蹤(Tracing)。
警示
EAS 支援兩類警示情境,按通知觸發源選擇:
-
監控警示:監控指標(錯誤率、延遲、資源使用率等)超閾值時主動通知,基於服務監控指標配置規則。詳情參見開通服務監控警示。
-
CloudMonitor事件:監聽服務生命週期事件(部署完成、擴容、執行個體異常退出等)並發出通知。詳情參見查看EASCloudMonitor事件。
常見問題
Q:為什麼在服務詳情頁的日誌頁簽看不到日誌?
常見原因:
-
服務執行個體尚未啟動完成(仍在拉取鏡像或初始化)
-
服務進程未將日誌輸出到 stdout/stderr
-
查詢時間視窗過窄或篩選的執行個體不存在日誌,調整時間範圍或切換"全部執行個體"重試
Q:控制台的日誌頁簽和 SLS 日誌採集是什麼關係?
兩者都用於事後查詢日誌,但定位不同:控制台日志頁簽開箱即用,適合單服務、近期的快速排查;SLS 日誌採集支援長期儲存、跨服務關聯分析和合規歸檔,其中洞察 Tab 接入方式同樣開箱即用。可同時啟用,按情境選擇。