GPU クラスターアラートのリストを取得します。
操作説明
対象の ACK クラスターにコンポーネントをインストールした後の動作は以下のとおりです。
クラスターが初めて管理対象になったとき、コンポーネントは現在クラスター内にあるすべての ECS インスタンスにインストールされます。クラスターに 50 を超えるノードがある場合、最初のバッチでは最初の 50 ノードのみが処理されます。
オペレーティングシステムコンソールは、管理対象クラスターのスケーリングステータスを定期的にチェックします。新しい ECS インスタンスがクラスターに追加されると、コンソールはユーザーの介入なしに自動的にコンポーネントをインストールします。
今すぐお試しください
テスト
RAM 認証
リクエスト構文
GET /api/v1/aiTopology/topology/listAlarmRecord HTTP/1.1
リクエストパラメーター
|
パラメーター |
型 |
必須 / 任意 |
説明 |
例 |
| alarmTime |
string |
任意 |
"2025-08-22 18:16:25" などの特定の時点、または "2025-08-22 18:16:25,2025-08-23 18:16:25" のような "start,end" フォーマットの時間範囲でクエリを実行します。 |
"2025-08-22 18:16:25,2025-08-23 18:16:25" |
| alarmCluster |
string |
任意 |
"cluster1" などの特定のクラスターでクエリを実行します。複数のクラスターをクエリする場合は、"cluster1,cluster2,cluster3" のようにカンマで区切ります。 |
"cluster1" |
| alarmTask |
string |
任意 |
"task1" などの特定のタスクでクエリを実行します。複数のタスクをクエリする場合は、"task1,task2,task3" のようにカンマで区切ります。 |
タスク ID |
| current |
integer |
必須 |
ページネーションの現在のページ番号。 |
1 |
| pageSize |
integer |
必須 |
ページネーションの 1 ページあたりのエントリ数。 |
10 |
| status |
string |
任意 |
blocking、running、exited、restart などのタスクステータスでフィルター処理します。 |
Running |
| alarmType |
string |
任意 |
GPU メモリアクセスの範囲外またはタスクの一部サービス停止などのアノマリータイプでフィルター処理します。 |
cuda error |
| alarmExtInfo |
string |
任意 |
インスタンス ID またはコンテナでアノマリーをフィルター処理します。 |
インスタンス ID |
レスポンスフィールド
|
フィールド |
型 |
説明 |
例 |
|
object |
応答のスキーマ。 |
||
| code |
string |
値は "Success" または "Sysom.ServerError" です。 |
Success または Sysom.ServerError |
| data |
array<object> |
アラートデータのリスト。 |
|
|
object |
データノード。 |
||
| alarmCluster |
string |
アラートがトリガーされたクラスター。 |
cluster1 |
| alarmExtInfo |
any |
アラートに関する追加のフォーマット情報。 |
{ error_node_gpu, error_pod, task_pod_list, error_type, kernel, } |
| alarmId |
string |
アラートの一意の ID。 |
746d13f8-9662-4441-b76b-a8ed8d485195 |
| alarmLog |
string |
アラートに関連付けられたイベントログ。 |
cuda OOM: xxxxx |
| alarmTask |
string |
アノマリーが発生したタスクの ID。 |
タスクジョブ ID |
| alarmTime |
string |
アラートがトリガーされた日付と時間。 |
2025-08-22 18:16:25 |
| alarmTopology |
any |
トポロジースナップショット。 |
トポロジーデータ、例: "alarmTopology": { "nodes": [ { "gpu_list": [ { "values": { "Basic": [ { "value": "1", "key": "Gpu Number\n" } ], "Metric": [ { "value": "50", "key": "gpu_util(%)\n" } ], "Exception": [ { "value": "NCCL HANG", "key": "error0" } ] }, "name": "GPU1", "style": { "fill": "#e94242\n", "opacity": "0.1" }, "id": "6cc37fbc" } ], "values": { "Basic": [ { "value": "i-xxxxxx", "key": "instance" } ], "Metric": [ { "value": "value of metrics 1", "key": "name of metric 1" } ], "Exception": [ { "value": "NCCL HANG", "key": "error0" } ] }, "name": "i-xxxxxx\n", "style": { "fillOpacity": "0.5", "fill": "#e94242\n" }, "id": "975fbcb0" } ], "edges": [ { "src_id": "00534a88", "values": { "Basic": [ { "value": "v2.22.3\n", "key": "NCCL Version\n" } ], "Metric": [ { "value": "10000", "key": "Recv Msg Count" } ], "Exception": [ { "value": "NCCL HANG", "key": "error0" } ] }, "dst_id": "260525e9", "style": { "opacity": "0.1", "lineWidth": "1", "selectedStyle": "\"{\\\"opacity\\\": 1, \\\"lineWidth\\\": 1}\"\n", "stroke": "#e94242" }, "type": "GPU" } ] }, |
| alarmType |
string |
アラート機能のアラームメトリクス。 |
cuda OOM |
| status |
string |
タスクのステータス。 |
running、blocking、restart、exited、failed |
| uid |
string |
クラウドアカウントの UUID。 |
1234123412352311 |
| message |
string |
コードが "Success" でない場合、メッセージにはエラーのフォーマット情報が含まれます。 |
サーバーエラー |
| requestId |
string |
リクエストの ID。 |
実際のリクエスト ID |
| total |
string |
返されるレコードの総数。 |
10 |
例
成功レスポンス
JSONJSON
{
"code": "Success or Sysom.ServerError",
"data": [
{
"alarmCluster": "cluster1",
"alarmExtInfo": "{\nerror_node_gpu, \nerror_pod, \ntask_pod_list, \nerror_type, \nkernel, \n}",
"alarmId": "746d13f8-9662-4441-b76b-a8ed8d485195",
"alarmLog": "cuda OOM:xxxxx",
"alarmTask": "task job id",
"alarmTime": "2025-08-22 18:16:25",
"alarmTopology": "topology data,e.g.\n \"alarmTopology\": {\n \"nodes\": [\n {\n \"gpu_list\": [\n {\n \"values\": {\n \"Basic\": [\n {\n \"value\": \"1\",\n \"key\": \"Gpu Number\\n\"\n }\n ],\n \"Metric\": [\n {\n \"value\": \"50\",\n \"key\": \"gpu_util(%)\\n\"\n }\n ],\n \"Exception\": [\n {\n \"value\": \"NCCL HANG\",\n \"key\": \"error0\"\n }\n ]\n },\n \"name\": \"GPU1\",\n \"style\": {\n \"fill\": \"#e94242\\n\",\n \"opacity\": \"0.1\"\n },\n \"id\": \"6cc37fbc\"\n }\n ],\n \"values\": {\n \"Basic\": [\n {\n \"value\": \"i-xxxxxx\",\n \"key\": \"instance\"\n }\n ],\n \"Metric\": [\n {\n \"value\": \"value of metrics 1\",\n \"key\": \"name of metric 1\"\n }\n ],\n \"Exception\": [\n {\n \"value\": \"NCCL HANG\",\n \"key\": \"error0\"\n }\n ]\n },\n \"name\": \"i-xxxxxx\\n\",\n \"style\": {\n \"fillOpacity\": \"0.5\",\n \"fill\": \"#e94242\\n\"\n },\n \"id\": \"975fbcb0\"\n }\n ],\n \"edges\": [\n {\n \"src_id\": \"00534a88\",\n \"values\": {\n \"Basic\": [\n {\n \"value\": \"v2.22.3\\n\",\n \"key\": \"NCCL Version\\n\"\n }\n ],\n \"Metric\": [\n {\n \"value\": \"10000\",\n \"key\": \"Recv Msg Count\"\n }\n ],\n \"Exception\": [\n {\n \"value\": \"NCCL HANG\",\n \"key\": \"error0\"\n }\n ]\n },\n \"dst_id\": \"260525e9\",\n \"style\": {\n \"opacity\": \"0.1\",\n \"lineWidth\": \"1\",\n \"selectedStyle\": \"\\\"{\\\\\\\"opacity\\\\\\\": 1, \\\\\\\"lineWidth\\\\\\\": 1}\\\"\\n\",\n \"stroke\": \"#e94242\"\n },\n \"type\": \"GPU\"\n }\n ]\n },",
"alarmType": "cuda OOM",
"status": "running、blocking、restart、exited、failed",
"uid": "1234123412352311"
}
],
"message": "server error",
"requestId": "real request ID",
"total": "10"
}
エラーコード
|
HTTP ステータスコード |
エラーコード |
エラーメッセージ |
説明 |
|---|---|---|---|
| 400 | Sysom.ServerError | Server error, please correct the code according to the error message. %s. |
完全なリストについては、「エラーコード」をご参照ください。
変更履歴
完全なリストについては、「変更履歴」をご参照ください。