全部产品
Search
文档中心

人工智能平台 PAI:日志监控与报警

更新时间:Aug 24, 2026

EAS 提供实时日志、SLS 日志采集、服务监控、监控大盘、监控报警、Prometheus 监控等可观测性能力,覆盖从故障发现、问题排查到长期分析的完整链路。

能力总览

日志、监控与报警三类能力在故障处理中各自承担不同角色:

  • 日志:记录服务运行的详细输出(启动日志、请求处理日志、错误堆栈),用于精确定位问题根因。

  • 监控:以指标和图表展示服务运行趋势(QPS、延迟、错误率、资源使用率),用于发现异常和容量评估。

  • 报警:基于监控指标设置阈值,异常时主动通知用户,用于触发响应。

典型故障处理路径:报警触发 → 监控定位异常指标和时段 → 日志深入排查根因

日志

EAS 提供以下日志与记录能力,按使用场景选择:

  • 历史日志查询:在服务详情页的日志页签查询,支持按实例筛选、关键词搜索、时间段过滤。适合进行日志检索和日志分析。

  • 实时日志跟踪:在服务实例列表中选中某个实例,单击实时日志,可流式查看当前容器的滚动输出。适合交互式调试和对实时性要求高的场景(如观察推理过程的逐 token 输出)。

    说明

    实时日志功能上线之前创建的服务无法使用实时日志功能,如需使用请重新创建服务。

  • SLS 日志采集:将 EAS 服务日志采集到 SLS,支持通过洞察 Tab 快速接入、云监控 2.0 接入中心批量接入、SLS Logtail 手动配置三种方式,满足从单服务快速接入到高阶自定义采集的需求。详见配置日志采集

  • 调用记录持久化:将服务的所有请求和响应记录保存到 MaxCompute 或 SLS 中,用于审计、调用分析或问题排查。需在部署服务时,于服务功能区域开启保存调用记录,并选择存储目标:

    • 大数据MaxCompute:选择一个已创建的MaxCompute项目(如无请创建MaxCompute项目),并配置MaxCompute数据表名称。部署服务时,系统会自动在选定的项目中创建此表。

    • 日志服务SLS:选择一个已创建的SLS项目(如无,请创建Project),并配置logstore名称。部署服务时,系统会自动在选定的项目中创建此 Logstore。

监控

EAS 提供五类监控能力,按监控范围和指标来源选择:

  • 服务监控(单服务):查看单个服务的 QPS、延迟、错误率、资源使用率等基础运行指标,支持按 Service 和 Instance 维度切换。开箱即用,进入服务详情页的监控页签直接查看。详情参见服务监控说明

  • 监控大盘(地域级聚合):将当前账号在当前所选地域下所有工作空间的服务指标汇总到统一看板,用于多服务整体巡检和容量规划。切换工作空间不影响数据范围。详情参见大盘监控说明

  • 自定义监控指标(单服务,用户上报):上报推理 token 数、批大小、命中率等业务指标,可用于驱动弹性伸缩。需在服务代码中按规范打点上报。详情参见自定义监控及扩缩容指标

  • Prometheus 监控(账号级,外部系统集成):通过云监控 2.0 接入中心将 EAS 监控指标接入 Prometheus,使用 PromQL 查询指标数据,并对接 Grafana 等自有监控系统。包含推理框架指标、GPU 算力指标等高级指标,会产生额外费用。详情参见通过Prometheus监控EAS推理服务

  • 链路追踪(单服务,ARMS):基于 ARMS 的调用链追踪,定位跨组件性能瓶颈。部分官方镜像可一键开启;对于其他镜像,需在运行命令中集成 ARMS 探针。详情参见EAS中开启LLM应用链路追踪(Tracing)

报警

EAS 支持两类报警场景,按通知触发源选择:

  • 监控报警:监控指标(错误率、延迟、资源使用率等)超阈值时主动通知,基于服务监控指标配置规则。详情参见开通服务监控报警

  • 云监控事件:监听服务生命周期事件(部署完成、扩容、实例异常退出等)并发出通知。详情参见查看EAS云监控事件

常见问题

Q:为什么在服务详情页的日志页签看不到日志?

常见原因:

  • 服务实例尚未启动完成(仍在拉取镜像或初始化)

  • 服务进程未将日志输出到 stdout/stderr

  • 查询时间窗口过窄或筛选的实例不存在日志,调整时间范围或切换"全部实例"重试

Q:控制台的日志页签和 SLS 日志采集是什么关系?

两者都用于事后查询日志,但定位不同:控制台日志页签开箱即用,适合单服务、近期的快速排查;SLS 日志采集支持长期保存、跨服务关联分析和合规归档,其中洞察 Tab 接入方式同样开箱即用。可同时启用,按场景选择。