全部产品
Search
文档中心

人工智能平台 PAI:通过Prometheus监控EAS推理服务

更新时间:Aug 24, 2026

您可以通过云监控2.0的接入中心将PAI-EAS推理服务的监控指标接入Prometheus服务,使用PromQL查询指标数据,并对接到Grafana等自有监控系统,实现推理服务的全面监控。

计费说明

在云监控2.0的接入中心配置PAI-EAS 推理服务监控指标PAI-EAS 资源组监控指标会产生以下费用:

步骤一:接入EAS监控指标

  1. 登录云监控2.0控制台,选择目标工作空间后,在左侧导航栏单击接入中心

  2. 接入中心页面的搜索框中,输入"模型在线服务 PAI-EAS",单击搜索结果卡片。

  3. 接入数据选择PAI-EAS 推理服务监控指标PAI-EAS 资源组监控指标。

    重要

    高级监控指标包含大模型推理框架指标(vLLM或SGLang)、GPU算力指标、PAI EAS访问网关指标、服务和租户维度统计指标以及推理应用自定义指标(指标名会增加custom_前缀),具体参见EAS服务和资源组相关指标。当前支持的区域包括北京、上海、杭州、乌兰察布、新加坡、河源,更多区域需提交工单开通。

    如果您需要构建Grafana可视化大盘或配置自定义报警,建议开启高级监控指标。

  4. 接入过程将在后台自动进行,约需 1~2 分钟完成。您可以单击接入管理,查看已接入环境的详细信息,确认接入是否完成。

步骤二:获取Prometheus数据源信息

云监控2.0会创建对应的Prometheus实例用于存储EAS监控指标数据,默认存储位置为RegionShare:{{workspaceName}}:{{regionId}}(其中{{workspaceName}}为工作空间名称,{{regionId}}为地域ID)。

如下获取该Prometheus实例的地域和访问地址,可通过Prometheus API获取监控数据。

  1. 切换到接入管理页签,在接入配置列表中单击目标接入名称左侧的展开图标。

  2. 在展开的子项中,找到PAI-EAS 推理服务监控指标PAI-EAS 资源组监控指标,查看接入组件、状态、区域等信息。

  3. 操作列单击数据源,查看Prometheus服务的地域和访问地址。

步骤三:查询和探索指标

您可以进入Prometheus服务,通过指标探索或PromQL查询EAS监控指标数据。

  • 云监控指标名称会增加AliyunLearn_eas前缀,与云监控上展示的EAS指标定义一致,且标签信息更加丰富。

  • 高级监控指标请参考EAS高级监控指标

操作步骤如下:

  1. 在步骤二的数据源页面,单击实例ID,跳转Prometheus服务详情页面。

  2. 左侧导航栏切换到指标管理,在指标探索页签,查看EAS服务的指标详情。

    查看方式

    操作说明

    通过过滤指标查看指标详情

    1. 指标探索页签的查询构建器中,单击Metric探索

    2. 在搜索框中输入指标关键词(如 AliyunLearn),从下拉列表中选择目标指标(如 CPU 核心用量、CPU 利用率、GPU 显存利用率等)。

    3. 在操作列单击继续探索设置筛选条件,然后单击添加到查询框。

    4. 单击执行查询查看对应的指标折线图。

    借助PromQL组合,查询更加丰富的指标。

    例如查询当前所有服务的QPS之和:

    1. 输入sum(AliyunLearn_eas_qps_total)。(PromQL语法详情参见时序数据查询和分析语法

    2. 单击执行查询,便会展示当前区域所有EAS服务的QPS之和的变化趋势。

步骤四:使用Grafana可视化大盘

查看默认Grafana大盘

云监控2.0提供了默认的Grafana大盘,您可以按照以下操作步骤查看大盘详情。

  1. 在Prometheus服务详情页左侧导航栏,单击大盘列表

  2. 单击大盘名称,查看内置的Grafana大盘。

说明

您也可以在接入管理的策略下直接切换到大盘页签查看。

添加面板

下文为默认的Grafana大盘增加一个全局QPS面板。关于Grafana的更多介绍请参见可观测可视化 Grafana 版

  1. 在大盘详情页面单击右上角的Add panel按钮image,然后在新增的Add panel面板中,单击Add a new panel

  2. 在Edit Panel页面右侧,将图表类型切换为Stat

  3. 在页面左下角,将Data source切换为${datasource}

  4. 在Query区域,右侧切换为code,然后在Metrics browser文本框中输入PromQL查询语句sum(AliyunLearn_eas_eas_qps_total) 后,单击Run queries

  5. 通过调整threshold,为不同的阈值配置不同的展示颜色。配置完成后,页面会预览图表效果,通过单击Apply按钮保存设置。

步骤五:配置监控报警

在Prometheus服务的实例详情页面,可以查看预置的告警规则,预置告警规则均为P2级别,初始状态均为已停止

  1. 在Prometheus服务详情页左侧导航栏,单击告警规则

  2. 在告警规则页面,查看预置的告警规则。如需启用,修改启停状态;如需修改通知配置,单击编辑

如果上述默认模板无法满足您的需求,您可以单击创建告警规则,配置自定义告警规则。具体参数配置,详见告警规则

附录:EAS高级监控指标

说明

以下指标仅在步骤一中开启高级监控指标时才会显示。

服务实例维度指标

指标

指标含义

指标标签(维度)

指标分类

指标类型

单位

指标周期(单位s)

instance_cpu_count

服务实例CPU数量

instance,resource_type

CPU

Gauge

count

60

instance_gpu_count

服务实例GPU数量

instance,resource_type

GPU

Gauge

count

60

instance_cpu_usage

服务实例CPU使用量

instance

CPU

Gauge

core

60

instance_user_cpu_usage

服务实例用户进程CPU使用量

instance

CPU

Gauge

core

60

instance_system_cpu_usage

服务实例系统进程CPU使用量

instance

CPU

Gauge

core

60

instance_cpu_util

服务实例CPU使用率

instance

CPU

Gauge

%

60

instance_memory_rss_usage

服务实例内存使用量

instance

Memory

Gauge

byte

60

instance_memory_cache_usage

服务实例内存缓存使用量

instance

Memory

Gauge

byte

60

instance_memory_total

服务实例内存总量

instance

Memory

Gauge

byte

60

instance_memory_util

服务实例内存使用率

instance

Memory

Gauge

%

60

instance_response

服务实例请求数

instance

Request

Counter

count

60

instance_gpu_util

服务实例GPU使用率

instance

GPU

Gauge

%

60

instance_gpu_memory_usage

服务实例显存使用量

instance

GPU

Gauge

MiB

60

instance_gpu_memory_total

服务实例显存总量

instance

GPU

Gauge

MiB

60

instance_gpu_memory_util

服务实例显存使用率

instance

GPU

Gauge

MiB

60

instance_gpu_memory_bandwidth_limit

服务实例GPU显存带宽限制

instance

GPU

Gauge

bytes/second

60

instance_gpu_temperature

服务实例GPU温度

instance

GPU

Gauge

°C

60

instance_gpu_slow_temperature

服务实例GPU降频温度

instance

GPU

Gauge

°C

60

instance_gpu_shut_temperature

服务实例GPU关机温度

instance

GPU

Gauge

°C

60

instance_gpu_nvswitch_error

服务实例NVSwitch致命错误信息

instance

GPU

Gauge

count

60s

instance_gpu_nvswitch_non_fatal_error

服务实例NVSwitch非致命错误信息

instance

GPU

Gauge

count

60

instance_gpu_ecc_total_vol_sbe

服务实例单比特易失性ECC错误总数

instance

GPU

Counter

count

60

instance_gpu_ecc_total_vol_dbe

服务实例双比特易失性ECC错误总数

instance

GPU

Counter

count

60

instance_gpu_ecc_total_agg_sbe

服务实例单比特聚合(持久性)ECC错误总数

instance

GPU

Counter

count

60

instance_gpu_ecc_total_agg_dbe

服务实例双比特聚合(持久性)ECC错误总数

instance

GPU

Counter

count

60

instance_gpu_remap_fail

服务实例行重映射失败次数

instance

GPU

Gauge

count

60

instance_gpu_remap_pending

服务实例行重映射待处理次数

instance

GPU

Gauge

count

60

instance_gpu_pcie_replay_counter

服务实例PCIe重传计数器

instance

GPU

Gauge

count

60

instance_gpu_pcie_transmit_measure_by_dcgm

服务实例通过DCGM测量的PCIe传输速率

instance

GPU

Gauge

bytes/second

60

instance_gpu_pcie_receive_measure_by_dcgm

服务实例通过DCGM测量的PCIe接收速率

instance

GPU

Gauge

bytes/second

60

instance_gpu_graphics_engine_util

服务实例图形引擎利用率

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_sm_util

服务实例SM(流式多处理器)利用率

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_dram_active

服务实例设备内存接口活跃发送或接收数据的比率

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_tensortflops_used

服务实例Tensor管道使用的Tflops

instance

GPU

Gauge

count

60

instance_gpu_memory_bandwidth_used

服务实例内存带宽使用量

instance

GPU

Gauge

bytes/second

60

instance_gpu_sm_clock

服务实例SM时钟频率

instance

GPU

Gauge

MHz

60

instance_gpu_sm_occupancy

服务实例SM上驻留的Warp数量比例

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_fp32tflops_used

服务实例FP32管道使用的Tflops

instance

GPU

Gauge

count

60

instance_gpu_fp16tflops_used

服务实例FP16管道使用的Tflops

instance

GPU

Gauge

count

60

instance_gpu_pipe_fp32_active

服务实例FP32管道活跃周期比例

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_pipe_fp16_active

服务实例FP16管道活跃周期比例

instance

GPU

Gauge

ratio (0~1)

60s

instance_gpu_pipe_tensor_active

服务实例Tensor管道活跃周期比例

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_power_usage

服务实例GPU功耗

instance

GPU

Gauge

watts

60

instance_accelerator_power_usage

服务实例加速器功耗

instance

GPU

Gauge

milliwatts

60

instance_gpu_mem_copy_util

服务实例内存复制利用率

instance

GPU

Gauge

%

60

instance_gpu_health_count

服务实例GPU健康状态计数的总和

instance

GPU

Gauge

count

60

instance_gpu_lost_card_num

服务实例VM中丢失显卡数量

instance

GPU

Gauge

count

60

instance_gpu_driver_hang

服务实例驱动挂起次数

instance

GPU

Gauge

count

60

instance_gpu_profile_status

服务实例Amperf性能分析状态

instance

GPU

Gauge

count

60

instance_gpu_uncorrectable_ecc

服务实例无法纠正的ECC错误数量

instance

GPU

Gauge

count

60

instance_gpu_xid_cnt

服务实例Xid错误数

instance

GPU

Gauge

count

60

instance_gpu_fatal_xid_error

服务实例致命Xid错误数

instance

GPU

Gauge

count

60

instance_gpu_kernel_err_cnt

服务实例来自内核日志的非Xid错误数

instance

GPU

Gauge

count

60

instance_qps

服务实例每秒请求数

instance

Request

Gauge

count

60

instance_traffic

服务实例流量

instance

Request

Gauge

bps

60

instance_avg_latency

服务实例平均请求响应时间

instance

Request

Gauge

ms

60

instance_tpxx_latency

服务实例TOPXX请求响应时间

instance

Request

Gauge

ms

60

instance_traffic_in

服务实例入流量

instance

Request

Gauge

bps

60

instance_traffic_out

服务实例出流量

instance

Request

Gauge

bps

60

instance_tcp_connections

服务实例TCP连接数

instance

Request

Gauge

count

60

服务维度指标

指标

指标含义

指标标签(维度)

指标分类

指标类型

单位

指标周期(单位s)

service_replicas

服务实例数

service

Meta

Gauge

count

60

service_pending_replicas

待执行的服务实例数

service

Meta

Gauge

count

60

service_available_replicas

运行中的服务实例数

service

Meta

Gauge

count

60

service_replicas_with_resource_type

服务实例数(带有资源类型标签)

service

Meta

Gauge

count

60

service_cpu_count

服务占用CPU总数

service

CPU

Gauge

core

60

service_cpu_count_with_resource_type

服务CPU总数(带有资源类型标签)

service

CPU

Gauge

core

60

service_gpu_count_with_resource_type

服务GPU总数(带有资源类型标签)

service

GPU

Gauge

count

60

service_rps_status_2xx

服务2XX响应请求数

service

Request

Gauge

count

60

service_rps_status_4xx

服务4XX响应请求数

service

Request

Gauge

count

60

service_rps_status_5xx

服务5XX响应请求数

service

Request

Gauge

count

60

service_rps_status_2xx_ratio

服务2XX响应请求数占比

service

Request

Gauge

%

60

service_rps_status_4xx_ratio

服务4XX响应请求数占比

service

Request

Gauge

%

60

service_rps_status_5xx_ratio

服务5XX响应请求数占比

service

Request

Gauge

%

60

service_qps

服务每秒请求数

service

Request

Gauge

count

60

service_avg_latency

服务平均请求响应时间

service

Request

Gauge

ms

60

service_tpxx_latency

服务TOPXX请求响应时间

service

Request

Gauge

ms

60

service_tp100_latency

服务TOP100请求响应时间

service

Request

Gauge

ms

60

service_traffic_in

服务入流量

service

Network

Gauge

bps

60

service_traffic_out

服务出流量

service

Network

Gauge

60

service_cpu_usage

服务CPU使用量

service

CPU

Gauge

core

60

service_user_cpu_usage

服务用户进程CPU使用量

service

CPU

Gauge

core

60

service_system_cpu_usage

服务系统进程CPU使用量

service

CPU

Gauge

core

60

service_cpu_util

服务CPU使用率

service

CPU

Gauge

%

60

service_memory_rss_usage

服务内存使用量

service

Memory

Gauge

byte

60

service_memory_cache_usage

服务内存缓存使用量

service

Memory

Gauge

byte

60

service_memory_total

服务内存总量

service

Memory

Gauge

byte

60

service_memory_util

服务内存使用率

service

Memory

Gauge

%

60

service_gpu_util

服务GPU使用率

service

GPU

Gauge

%

60

service_gpu_memory_usage

服务显存使用量

service

GPU

Gauge

MiB

60

service_gpu_memory_total

服务显存总量

service

GPU

Gauge

MiB

60

service_gpu_memory_util

服务显存使用率

service

GPU

Gauge

MiB

60

service_gpu_memory_bandwidth_limit

服务GPU显存带宽限制

service

GPU

Gauge

bytes/second

60

service_gpu_temperature

服务GPU温度

service

GPU

Gauge

°C

60

service_gpu_slow_temperature

服务GPU降频温度

service

GPU

Gauge

°C

60

service_gpu_shut_temperature

服务GPU关机温度

service

GPU

Gauge

°C

60

service_gpu_nvswitch_error

服务NVSwitch致命错误信息

service

GPU

Gauge

count

60

service_gpu_nvswitch_non_fatal_error

服务NVSwitch非致命错误信息

service

GPU

Gauge

count

60

service_gpu_ecc_total_vol_sbe

服务单比特易失性ECC错误总数

service

GPU

Counter

count

60

service_gpu_ecc_total_vol_dbe

服务双比特易失性ECC错误总数

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_sbe

服务单比特聚合(持久性)ECC错误总数

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_dbe

服务双比特聚合(持久性)ECC错误总数

service

GPU

Counter

count

60

service_gpu_remap_fail

服务行重映射失败次数

service

GPU

Gauge

count

60

service_gpu_remap_pending

服务行重映射待处理次数

service

GPU

Gauge

count

60

service_gpu_pcie_replay_counter

服务PCIe重传计数器

service

GPU

Gauge

count

60

service_gpu_pcie_transmit_measure_by_dcgm

服务通过DCGM测量的PCIe传输速率

service

GPU

Gauge

bytes/second

60

service_gpu_pcie_receive_measure_by_dcgm

服务通过DCGM测量的PCIe接收速率

service

GPU

Gauge

bytes/second

60

service_gpu_graphics_engine_util

服务图形引擎利用率

service

GPU

Gauge

ratio (0~1)

60

service_gpu_sm_util

服务SM(流式多处理器)利用率

service

GPU

Gauge

ratio (0~1)

60

service_gpu_dram_active

服务设备内存接口活跃发送或接收数据的比率

service

GPU

Gauge

ratio (0~1)

60

service_gpu_tensortflops_used

服务Tensor管道使用的Tflops

service

GPU

Gauge

count

60

service_gpu_memory_bandwidth_used

服务内存带宽使用量

service

GPU

Gauge

bytes/second

60

service_gpu_sm_clock

服务SM时钟频率

service

GPU

Gauge

MHz

60

service_gpu_sm_occupancy

服务SM上驻留的Warp线程数量比例

service

GPU

Gauge

ratio (0~1)

60

service_gpu_fp32tflops_used

服务FP32管道使用的Tflops

service

GPU

Gauge

count

60

service_gpu_fp16tflops_used

服务FP16管道使用的Tflops

service

GPU

Gauge

count

60

service_gpu_pipe_fp32_active

服务FP32管道活跃周期比例

service

GPU

Gauge

ratio (0~1)

60

service_gpu_pipe_fp16_active

服务FP16管道活跃周期比例

service

GPU

Gauge

ratio (0~1)

60

service_gpu_pipe_tensor_active

服务Tensor管道活跃周期比例

service

GPU

Gauge

ratio (0~1)

60

service_gpu_power_usage

服务GPU功耗

service

GPU

Gauge

watts

60

service_accelerator_power_usage

服务加速器功耗

service

GPU

Gauge

milliwatts

60

service_gpu_mem_copy_util

服务内存复制利用率

service

GPU

Gauge

%

60

service_gpu_health_count

服务GPU健康状态计数的总和

service

GPU

Gauge

count

60

service_gpu_lost_card_num

服务VM中丢失显卡数量

service

GPU

Gauge

count

60

service_gpu_driver_hang

服务驱动挂起次数

service

GPU

Gauge

count

60

service_gpu_profile_status

服务Amperf性能分析状态

service

GPU

Gauge

count

60

service_gpu_uncorrectable_ecc

服务无法纠正的ECC错误数量

service

GPU

Gauge

count

60

service_gpu_xid_cnt

服务Xid错误数

service

GPU

Gauge

count

60

service_gpu_fatal_xid_error

服务致命Xid错误数

service

GPU

Gauge

count

60

service_gpu_kernel_err_cnt

服务来自内核日志的非Xid错误数

service

GPU

Gauge

count

60

service_tcp_connections

服务TCP连接数

service

Network

Gauge

count

60

service_gateway_requests

llm-gateway:gateway当前接受到的请求数

service

Request

Gauge

count

60

service_gateway_pending_requests

llm-gateway:当前缓存在gateway中的请求数

service

Request

Gauge

count

60

service_llm_ttft_max

llm-gateway: llm流式请求的首包延时的最大值

service

Request

Gauge

time

60

service_llm_ttft_min

llm-gateway: llm流式请求的首包延时的最小值

service

Request

Gauge

time

60

service_llm_ttft_mean

llm-gateway: llm流式请求的首包延时的平均值

service

Request

Gauge

time

60

service_llm_ttft_percent

llm-gateway: llm流式请求的首包延时的分位值

service

Request

Gauge

time

60

service_llm_tpot_max

llm-gateway: llm流式请求的每包延时的最大值

service

Request

Gauge

time

60

service_llm_tpot_min

llm-gateway: llm流式请求的每包延时的最小值

service

Request

Gauge

time

60

service_llm_tpot_mean

llm-gateway: llm流式请求的每包延时的平均值

service

Request

Gauge

time

60

service_llm_tpot_percent

llm-gateway: llm流式请求的每包延时的分位值

service

Request

Gauge

time

60

service_endpoint_llm_waiting_requests

llm-gateway: llm推理引擎内部正在排队等待的请求数

service

Request

Gauge

count

60

service_endpoint_llm_running_requests

llm-gateway: llm推理引擎内部正在运行处理的请求数

service

Request

Gauge

count

60

service_endpoint_llm_gpu_cache_usage

llm-gateway: llm推理引擎gpu kv-cache的使用率

service

Request

Gauge

count

60

service_endpoint_llm_tps_in

llm-gateway: llm引擎每秒的输入的token数

service

Request

Gauge

count

60

service_endpoint_llm_tps_out

llm-gateway: llm引擎每秒输出的token数

service

Request

Gauge

count

60

资源组指标

指标

指标含义

指标标签(维度)

指标分类

指标类型

单位

指标周期(单位s)

resource_instance_cpu_util

资源组实例CPU使用率

instance_id

Resource Instance

Gauge

%

60

resource_instance_memory_total

资源组实例内存总量

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_used

资源组实例内存使用量

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_util

资源组实例内存使用率

instance_id

Resource Instance

Gauge

%

60

resource_instance_memory_cache

资源组实例内存缓存使用量

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_free

资源组实例内存空余量

instance_id

Resource Instance

Gauge

byte

60

resource_instance_traffic_in

资源组实例入流量

instance_id

Resource Instance

Gauge

bytes/second

60

resource_instance_traffic_out

资源组实例出流量

instance_id

Resource Instance

Gauge

bytes/second

60

resource_instance_disk_used

资源组实例硬盘使用量

instance_id

Resource Instance

Gauge

byte

60

resource_instance_disk_total

资源组实例硬盘总量

instance_id

Resource Instance

Gauge

byte

60

resource_instance_disk_util

资源组实例硬盘使用率

instance_id

Resource Instance

Gauge

byte

60

resource_instance_tcp_established

资源组实例TCP稳定链接数

instance_id

Resource Instance

Gauge

count

60

resource_instance_tcp_time_wait

资源组实例TCP等待链接数

instance_id

Resource Instance

Gauge

count

60

resource_instance_gpu_util

资源组实例GPU使用率

instance_id

Resource Instance

Gauge

%

60

resource_instance_gpu_memory_usage

资源组实例显存使用量

instance_id

Resource Instance

Gauge

MiB

60

resource_instance_gpu_memory_total

资源组实例显存总量

instance_id

Resource Instance

Gauge

MiB

60

resource_instance_gpu_memory_util

资源组实例显存使用率

instance_id

Resource Instance

Gauge

%

60

resource_cpu_util

资源组CPU使用率

resource

Resource

Gauge

%

60

resource_memory_total

资源组内存总量

resource

Resource

Gauge

byte

60

resource_memory_used

资源组内存使用量

resource

Resource

Gauge

byte

60

resource_memory_util

资源组内存使用率

resource

Resource

Gauge

%

60

resource_memory_cache

资源组内存缓存使用量

resource

Resource

Gauge

byte

60

resource_memory_free

资源组内存空余量

resource

Resource

Gauge

byte

60

resource_traffic_in

资源组入流量

resource

Resource

Gauge

bytes/second

60

resource_traffic_out

资源组出流量

resource

Resource

Gauge

bytes/second

60

resource_disk_used

资源组硬盘使用量

resource

Resource

Gauge

byte

60

resource_disk_total

资源组硬盘总量

resource

Resource

Gauge

byte

60

resource_disk_util

资源组硬盘使用率

resource

Resource

Gauge

byte

60

resource_tcp_established

资源组TCP稳定链接数

resource

Resource

Gauge

count

60

resource_tcp_time_wait

资源组TCP等待链接数

resource

Resource

Gauge

count

60

resource_gpu_util

资源组GPU使用率

resource

Resource

Gauge

%

60

resource_gpu_memory_usage

资源组显存使用量

resource

Resource

Gauge

MiB

60

resource_gpu_memory_total

资源组显存总量

resource

Resource

Gauge

MiB

60

resource_gpu_memory_util

资源组显存使用率

resource

Resource

Gauge

%

60