除了自然語言問答,EMR AI助手還內建了12個專家技能,分別面向慢查詢、執行計畫、資源水位、資料匯入、物化視圖等營運情境。本文介紹各專家技能的命令、解決什麼問題、需要您提供哪些資訊,協助您在遇到問題時快速選對技能。
專家技能與自然語言問答的區別
直接用自然語言提問時,AI助手需要先識別您的意圖,再決定讀取哪些資料。選擇專家技能相當於提前告訴AI助手"按哪套方法排查",AI助手會按該情境固定的診斷路徑收集證據,輸出結構也更穩定。
因此,問題類型已經明確時(例如確定是匯入失敗),建議直接選擇對應技能;現象不清楚時(例如只知道業務變慢),先用自然語言描述,讓AI助手判斷方向。
調用方式
在AI助手的交談視窗中,通過斜杠命令調用專家技能。兩種方式都可以:
輸入斜杠(
/)調出技能菜單,從列表中選擇需要的技能。直接輸入完整命令,例如
/slow-sql,再補充執行個體、時間範圍等資訊。
命令後面用@指定目標執行個體,再跟上問題描述。完整格式如下:
/技能命令 @執行個體名 問題描述
技能菜單中展示的技能範圍與帳號許可權和執行個體類型有關,實際可用技能以交談視窗中的菜單為準。
專家技能列表
各專家技能的命令和適用範圍如下。
命令 | 技能 | 解決什麼問題 | 需要您提供的資訊 | 輸出內容 |
| 慢查詢分析 | 找出指定時間段內最慢的SQL,並判斷主要瓶頸在SQL寫法、表設計、資源競爭還是資料扭曲。 | 執行個體、時間範圍。已有目標SQL或Query ID時一併提供。 | 慢SQL排名、瓶頸分類、最佳化建議。 |
| Profile診斷 | 分析單條SQL的Query Profile(查詢執行詳情),定位到具體運算元層級的耗時來源。 | Query ID或Profile內容,以及對應的SQL文本。 | 各階段耗時、瓶頸運算元及證據、驗證方法。 |
| 資源診斷 | 分析CPU、記憶體、磁碟和IO水位異常,判斷壓力來自查詢、匯入、Compaction(資料合併)還是節點異常。 | 執行個體、時間範圍、觀察到的業務現象。 | 資源消耗來源、關聯任務、處置建議。 |
| Compaction診斷 | 定位版本堆積、Compaction失敗以及受影響的表和分區。 | 警示時間、涉及的表或分區、Compaction Score。 | 堆積範圍、原因判斷、低風險處置動作。 |
| 建表設計 | 為新表選擇表模型、分區、分桶和排序鍵。 | 查詢模式、寫入方式、資料量與增長預期。 | 建表方案,包含表模型、分區、分桶和排序鍵。 |
| SQL調優 | 改寫已知的慢SQL,最佳化執行計畫。 | SQL文本、相關表結構,有Profile時一併提供。 | 改寫建議、預期收益、改動風險。 |
| 資料匯入 | 排查匯入失敗、延遲和吞吐不達預期的問題。 | 匯入方式、任務名稱、報錯資訊。 | 錯誤分類、鏈路定位、修複建議。 |
| 物化視圖 | 分析物化視圖重新整理失敗、狀態失效和查詢未命中的原因。 | 物化視圖名稱、基表、查詢SQL、重新整理記錄。 | 狀態判斷、重新整理問題定位、命中最佳化建議。 |
| 執行個體巡檢 | 對執行個體做一次多維度體檢,適合周期巡檢、變更前檢查和故障後複核。 | 執行個體、需要重點檢查的範圍。 | 健康評分、風險項、最佳化清單。 |
| 串連診斷 | 排查用戶端串連執行個體失敗的問題。 | 用戶端類型、串連入口、報錯資訊、網路環境。 | 按網路、認證、許可權分層給出的結論。 |
| Catalog排查 | 排查湖倉Catalog配置和外表訪問異常。 | Catalog類型、配置內容、報錯資訊。 | 按中繼資料、儲存、許可權分層的排查結論。 |
| 例外狀況事件 | 分析錯誤記錄檔和例外狀況事件,判斷影響範圍。 | 錯誤摘要、發生時間、執行個體。 | 影響範圍、原因判斷、下一步動作。 |
按現象選擇技能
如果不確定該用哪個技能,可以按下表從現象反查。
您遇到的現象 | 建議使用的技能 |
業務反饋查詢變慢,但不清楚是哪些SQL。 | 慢查詢分析( |
已定位到某條SQL慢,需要知道慢在哪一步。 | 先用Profile診斷( |
CPU、記憶體或磁碟水位突然升高。 | 資源診斷( |
收到Compaction相關警示,或寫入後查詢變慢。 | Compaction診斷( |
匯入任務失敗、報錯或延遲變大。 | 資料匯入( |
物化視圖沒有按預期重新整理,或查詢沒有命中物化視圖。 | 物化視圖( |
用戶端或BI工具連不上執行個體。 | 串連診斷( |
查詢Iceberg、Hive等外表報錯。 | Catalog排查( |
準備上新業務,需要確認表怎麼建。 | 建表設計( |
變更前後需要做一次執行個體體檢。 | 執行個體巡檢( |
日誌中出現大量報錯,但不確定影響範圍。 | 例外狀況事件( |
只知道業務受影響,看不出屬於哪一類問題。 | 先用自然語言描述現象,由AI助手判斷方向。 |
提問方法
同一個技能,給出的資訊越完整,結論越具體。建議按以下順序組織問題。
輸入技能命令,例如
/slow-sql。用
@指定目標執行個體,避免多執行個體情境下上下文混淆。給出明確的時間範圍,例如"2026-08-06 10:00到11:00",而不是"最近"、"剛才"。
補充關鍵證據:SQL文本、Query ID、Profile、錯誤摘要、任務名稱或警示名稱。
說明期望的輸出,例如要求區分確定結論和待驗證假設,或要求給出驗證方法。
下表是幾個可以直接參考的提問樣本,其中<INSTANCE_NAME>替換為您的執行個體名。
情境 | 提問樣本 |
慢查詢分析 |
|
Profile診斷 |
|
資源診斷 |
|
匯入排障 |
|
湖倉排查 |
|
執行個體巡檢 |
|
AI助手基於執行個體的實際運行資料分析,同一個問題在不同時間點提問,結論可能不同。排查過程中建議保留Query ID、時間範圍等關鍵資訊,便於後續複核。
如何判斷診斷結論是否可用
一份可以用於營運決策的診斷輸出,通常包含以下內容。如果輸出中缺少某一項,可以在對話中繼續追問。
分析對象:本次分析針對哪個執行個體、哪段時間、哪個任務、哪條SQL或哪個警示。
證據來源:結論依據的是Query Profile、監控指標、日誌、任務執行記錄還是執行個體配置。
根因判斷:區分已確認的結論和還需要驗證的假設。
處理建議:區分可以直接執行的低風險動作和需要審批的高風險變更。
風險提示:說明建議動作的影響範圍、復原方式和不適用的情境。
後續動作:需要繼續使用哪個專家技能,或需要人工檢查哪些內容。
使用限制
AI助手輸出診斷結論和建議,不會自動修改執行個體配置、擴縮容或重啟執行個體。涉及生產變更的操作需要您確認後按變更流程執行。
AI助手在當前帳號的授權範圍內讀取營運資料。RAM使用者需要主帳號完成授權,詳情請參見EMR AI助手快速入門。
診斷依據以系統資料表、Query Profile、監控指標、任務執行記錄和錯誤摘要等營運資料為主,不用於分析業務表中的詳細資料。
不要在對話中輸入密碼、AccessKey、SecretKey、Token、Cookie、Webhook密鑰或未脫敏的業務資料。
常見問題
AI助手會自動修改執行個體配置嗎?
不會。AI助手只輸出診斷結論和建議。配置修改、擴縮容、重啟、許可權調整等動作需要您確認後自行執行。
一個問題應該用哪個技能?
問題類型明確時直接選對應技能,參見按現象選擇技能。不確定時先用自然語言描述現象,AI助手會判斷方向並給出下一步建議。
技能菜單裡找不到某個技能怎麼辦?
技能菜單展示的範圍與帳號許可權和執行個體類型有關。確認帳號已獲得對應執行個體的操作許可權後重新開啟菜單。仍然找不到時,可以先用自然語言描述問題,AI助手會按相近的診斷路徑分析。
如何提高診斷準確率?
提供明確的執行個體、時間範圍、問題現象、SQL或Query ID、錯誤摘要,以及業務的正常基準資料。資訊越完整,越容易形成可驗證的結論。
診斷結論可以直接執行嗎?
低風險動作(例如調整查詢寫法、補充統計資訊)可以先在測試環境驗證後執行。涉及擴縮容、參數變更、重啟等高風險動作,需要結合實際監控資料人工複核,並按生產變更流程審批。