EMR AI助手是阿里雲EMR提供的智能營運服務。本文介紹AI助手的核心優勢、功能模組、覆蓋情境以及版本與規格。
功能概述
EMR AI助手是阿里雲EMR提供的智能營運服務。基於大語言模型,AI助手可串連您的EMR叢集/執行個體,理解叢集/執行個體狀態和監控資料,為您提供從問答諮詢、效能診斷、健康巡檢到主動推送的全棧AI營運能力,成為您的7×24巨量資料專家。AI助手現已同時支援EMR Serverless StarRocks與EMR Serverless Spark:在StarRocks執行個體診斷與營運之外,還提供Spark作業診斷與營運管理能力,可在同一入口按產品維度切換使用。
核心優勢
串連真實叢集,而非通用問答
AI助手直接連接您的StarRocks執行個體與Serverless Spark工作空間,可讀取系統資料表、查詢Profile、監控指標、作業日誌與隊列資源等運行時資料。所有診斷和建議基於叢集的真實狀態產生,而非基於通用知識的泛化回答。
從被動應答到主動營運
AI助手不僅在您提問時工作。通過配置智能日報、巡檢報告和警示推送(含Spark巡檢日報、Spark Workspace定期巡檢等),AI助手可7×24持續監控叢集狀態,主動發現問題並推送到DingTalk/飛書,無需人工值守。
多入口覆蓋,隨時可用
支援通過EMR控制台、DingTalk/飛書IM通道、API介面多種方式接入,融入您現有的營運工作流程,無需切換工具。
功能模組
AI助手包含以下核心功能模組:
交談視窗
控制台內建的AI對話介面,支援與AI助手進行多輪對話互動。
-
支援自然語言提問,AI助手自動識別意圖並串連叢集進行分析。
-
支援上下文多輪對話,可在一次會話中逐步深入排查問題。
-
對話歷史自動儲存,可隨時回顧之前的診斷記錄。
-
支援選擇關聯執行個體,對不同執行個體不同情境進行分析。
-
支援在Serverless StarRocks與Serverless Spark之間切換產品,針對不同產品進行問答與診斷。
-
支援選擇專家技能,一鍵調用專項診斷流程。StarRocks內建效能診斷、開發助手、營運管理、湖倉排障四類專家技能,Spark內建作業診斷、營運管理兩類專家技能。
工作中樞
管理AI助手的定時任務和歷史執行記錄,支援按產品維度(Serverless StarRocks / Serverless Spark)分別查看和管理工作。
任務配置:
-
配置智能日報的推送時間和頻率。
-
配置巡檢報告的執行循環。
-
StarRocks內建3項定時任務(全量健康巡檢、運行中SQL巡檢、歷史慢SQL巡檢)和6項警示任務(CheckPoint異常警示、Compaction異常警示、機器負載異常警示、Routine Load異常警示、物化視圖異常警示、查詢延遲異常警示)。
-
Spark內建5項系統定時任務(Spark Workspace定期巡檢、Spark巡檢日報推送、Spark慢任務專家、Spark失敗作業診斷匯總、Spark隊列資源巡檢)。
-
支援啟用/暫停,支援設定觸發閾值。
執行記錄:
-
查看所有任務的歷史執行結果。
-
查看每次日報/巡檢/警示的完整內容。
-
按時間、類型、狀態篩選記錄。
-
執行失敗時可查看失敗原因。
IM配置
將AI助手接入企業IM工具,團隊成員在工作群內即可直接使用。
-
支援DingTalk、飛書、企業微信接入。
-
配置對應群組的Webhook地址和簽名密鑰。
API/SDK對接
支援通過API/SDK,將EMR AI助手能力內建於您的企業平台和自動化營運流程中,詳情請參見通過API調用EMR AI助手。
覆蓋情境(Serverless StarRocks)
效能診斷
當叢集出現延遲飆升、查詢逾時、資源打滿等問題時,AI助手可快速定位根因並給出修複方案。
|
情境 |
AI助手能做什麼 |
樣本問題 |
|
執行計畫分析 |
深度分析Query Profile,定位運算元級瓶頸 |
"這條查詢跑了30秒,幫我看下Profile" |
|
資源瓶頸診斷 |
分析CPU/記憶體/磁碟/IO使用狀態,識別熱點 |
"CPU突然飆到100%了" |
|
Compaction積壓 |
分析版本堆積、寫入放大,給出參數調優建議 |
"版本數警示了,怎麼處理?" |
叢集營運
覆蓋日常巡檢、Auto Scaling、組態管理等營運操作。
|
情境 |
AI助手能做什麼 |
樣本問題 |
|
健康巡檢 |
8維度全面體檢,輸出健康評分和最佳化建議 |
"幫我做一次全面體檢" |
|
Auto Scaling |
分析歷史負載,評估是否需要擴縮容 |
"大促前需不需要加節點?" |
|
串連診斷 |
排查串連失敗、逾時、白名單問題 |
"應用突然連不上叢集了" |
|
配置調優 |
對比最佳實務,推薦參數調整 |
"Compaction線程數應該設多少?" |
|
執行個體管理 |
查看執行個體資訊、版本、帳號許可權等 |
"當前執行個體是什麼規格?" |
異常排查
|
情境 |
AI助手能做什麼 |
樣本問題 |
|
報錯診斷 |
匹配已知問題庫,提供修複方案 |
"報了這個錯怎麼辦?" |
|
節點故障 |
分析BE/FE崩潰原因,給出恢複步驟 |
"BE掛了什麼原因?" |
|
OOM分析 |
定位記憶體消耗源頭,給出參數調整建議 |
"查詢報OOM了" |
|
匯入失敗 |
分析匯入錯誤原因,給出修複方案 |
"Stream Load報錯了" |
主動營運
AI助手可按計劃自動執行分析任務,並將結果推送到IM通道。
|
推送類型 |
觸發方式 |
推送內容 |
|
智能日報 |
每日定時 |
叢集健康評分 + 例外狀況事件診斷 + 趨勢對比 + 最佳化建議 |
|
巡檢報告 |
每周定時 |
8維度健康評分 + 全量檢查 + 最佳化建議清單 |
|
警示推送 |
監控事件觸發 |
警示詳情 + AI根因診斷 + 建議操作 |
所有定時任務和推送記錄均可在工作中樞中查看和管理。
諮詢答疑
|
情境 |
AI助手能做什麼 |
樣本問題 |
|
產品使用 |
基於StarRocks最新文檔回答使用問題 |
"物化視圖怎麼建立?" |
|
最佳實務 |
提供建表、匯入、查詢最佳化等最佳實務 |
"分桶數怎麼選?" |
|
功能諮詢 |
解答StarRocks功能特性和適用情境 |
"Colocate Join什麼情境下用?" |
|
生態對接 |
Paimon/Iceberg/Fluss/Kafka等外部資料源接入指導 |
"怎麼配置Paimon Catalog?" |
覆蓋情境(Serverless Spark)
作業診斷
當Spark作業出現耗時超預期、執行失敗、效能劣化等問題時,AI助手可快速定位原因並給出最佳化建議。
|
情境 |
AI助手能做什麼 |
樣本問題 |
|
慢作業分析 |
按耗時、CU消耗和資料掃描量定位TOP慢作業,區分長期穩定與真實劣化,給出最佳化順序 |
"最近24小時哪些作業最耗CU?" |
|
失敗作業診斷 |
分析失敗或異常作業的日誌、退出碼、OOM等資訊,按失敗族聚類給出根因與修複建議 |
"這個作業為什麼失敗了?" |
|
相似作業對比 |
對比周期性相似作業的歷史運行,識別效能劣化 |
"今天的作業為什麼比昨天慢?" |
營運管理
覆蓋資源診斷、工作空間巡檢等日常營運操作。
|
情境 |
AI助手能做什麼 |
樣本問題 |
|
資源診斷 |
分析隊列CU水位、資源等待、作業排隊原因 |
"作業一直在排隊是什麼原因?" |
|
工作空間巡檢 |
全面巡檢隊列水位、作業成功率、CU消耗趨勢,輸出巡檢報告 |
"幫我對Workspace做一次巡檢" |
主動營運
AI助手可按計劃自動執行Spark分析任務,並將結果推送到IM通道。
|
推送類型 |
觸發方式 |
推送內容 |
|
Spark巡檢日報 |
每日定時 |
前一天Workspace巡檢日報摘要與報告連結 |
|
Spark Workspace定期巡檢 |
定期定時 |
Workspace穩定性、效能、成本與用量的可追溯HTML報告 |
|
慢作業/失敗作業匯總 |
每日定時 |
TOP慢作業最佳化順序、失敗作業族根因結論與修複建議 |
|
隊列資源巡檢提示 |
每日定時+閾值觸發 |
隊列CU水位、持續未運行作業、近7日CU增長超閾值提示 |
所有Spark定時任務和推送記錄均可在工作中樞中查看和管理。
版本與規格
每個使用者提供100萬免費Token額度,可直接體驗。免費額度用盡後,可開通隨用隨付,按實際消耗的Token用量結算,計費規則請參見EMR AI助手隨用隨付說明。
額度與功能規格按帳號維度統一計算,Serverless StarRocks與Serverless Spark情境共用同一Token額度與功能規格。
快速上手指引請參見EMR AI助手快速入門。
聲明
本服務輸出內容由人工智慧模型產生,我們無法完全保證本服務模型的安全、可靠、可用和持續穩定及產生內容的合規、完整和準確。產生內容不代表阿里雲立場和觀點。我們將不斷提升服務品質,但不承諾服務的可用性和可靠性,並不對您使用本服務的結果負責。請謹慎判斷產生內容,不過度依賴。若您根據產生內容作出的判斷或行為導致您、其他使用者或阿里雲遭受任何損失或損害,您將承擔全部責任和後果。
您的所有使用行為由您自行負責,請確保您發布、上傳、連結或通過服務提供的任何內容合法合規,不損害社會公用秩序,不侵犯他人合法權益,不編造或傳播虛假資訊等。
使用本服務的診斷功能需要收集診斷執行個體的相關資料,包括您資料庫執行個體的基本資料、系統資料表內容、執行個體的監控指標、事件和日誌中的嚴重錯誤資訊,以及Spark工作空間的作業運行資訊、隊列與資源指標等。
常見問題
Q:AI助手會讀取我的業務資料嗎?
A:AI助手僅讀取叢集的系統資料表(如information_schema)、Query Profile、監控指標等營運資料,用於診斷和分析。不會讀取您的業務表資料內容。
Q:AI助手的操作許可權如何管控?
A:AI助手的操作範圍受RAM許可權控制。當前以唯讀診斷和分析為主,寫操作(如配置變更)需要您在對話中明確確認後才會執行。
Q:Token額度用完了會怎樣?
A:Token額度用完後,AI助手將暫停服務,您可以開啟超量計費。建議關注控制台中的額度使用方式,及時調整。
Q:多個執行個體如何管理?
A:一個AI助手訂閱可關聯同帳號下的多個StarRocks執行個體及Serverless Spark工作空間。在對話中指定執行個體或工作空間名即可切換分析目標。定時任務可分別為每個執行個體或工作空間配置獨立的推送規則。
Q:定時任務執行失敗了怎麼辦?
A:在工作中樞的執行記錄中可查看失敗原因。常見原因包括:執行個體處於停機狀態、IM通道串連斷開、Token額度不足。修複問題後任務會在下次觸發時自動回復。