# 模型监控

模型监控为您提供模型 API 调用的多维度指标大盘和单模型深入分析，帮助您实时掌握调用健康状态、性能表现和 Token 使用情况。

模型监控包括以下两部分功能：

- **监控概览**：展示所有模型的汇总指标和模型列表，快速了解整体调用状况。
- **监控详情**：针对单个模型，提供统计和性能两个维度的多图表深入分析。

> 监控数据基于审计日志存储，数据写入和展示可能存在少量延迟，请稍后刷新查看。

## 监控概览

进入 **模型服务平台 > 模型监控**，概览页默认查询**最近 3 小时**的数据。

### 筛选条件

- **时间范围**（必填）：支持快捷选项和自定义时间。
- **地域**（必填）：选择 推理地域，默认选中列表第一个。

> 概览页自动使用当前账号的所有 API Key 查询数据，不支持按 API Key 筛选。

### 汇总指标

页面展示 5 个汇总指标卡片，每个卡片悬停可查看详细说明。卡片右侧有手动刷新按钮。

| 指标 | 说明 |
|------|------|
| 模型数量 | 时间范围内有调用的模型总数 |
| 总调用次数 | 所有模型的调用总次数 |
| 总失败次数 | 所有模型的失败调用总次数 |
| 平均调用时长 | 所选时间范围内，模型 API 所有调用请求的调用时长的平均值 |
| 平均首 Token 延时 | 所选时间范围内，模型 API 所有流式调用请求的首 Token 延迟的平均值 |

### 模型列表

模型列表以表格形式展示各模型的调用概况，表格右上角支持按模型名称关键词搜索。

| 列 | 说明 |
|----|------|
| 模型名称 | 模型标识 |
| 调用次数 | 该模型在所选时间范围内的调用总次数 |
| 失败次数 | 该模型的失败调用次数 |
| 失败率 | 百分比显示，= 失败次数 / 调用次数 |
| 平均调用时长 | 该模型的平均调用耗时，≥1000ms 自动切换为秒显示 |
| 平均首 Token 延时 | 该模型的平均首 Token 延时，≥1000ms 自动切换为秒显示 |
| 操作 | 点击「监控」进入该模型的详情页 |

## 模型监控详情

在监控概览页的模型列表中，点击目标模型行的「监控」链接，进入该模型的监控详情页。

> 点击「监控」时，系统会将概览页当前选择的时间范围自动传递给详情页作为初始筛选条件。

### 筛选条件

详情页提供以下筛选条件，修改后自动刷新数据：

- **时间范围**：支持快捷选项和自定义时间。时间选择器的显示格式随聚合粒度自动切换——分钟粒度显示到时:分，小时粒度显示到时，天粒度仅显示日期。支持的最大时间范围为 60 天。
> 聚合粒度会根据所选时间范围自动禁用不合适的选项，以避免数据点过密或过疏。具体规则见下方表格。

  | 时间范围 | 可用粒度 |
  |----------|----------|
  | ≤ 12 小时 | 分钟、5 分钟、小时（天禁用） |
  | 12 小时 ~ 24 小时 | 5 分钟、小时（分钟、天禁用） |
  | 24 小时 ~ 7 天 | 小时、天（分钟、5 分钟禁用） |
  | > 7 天 | 仅天 |

- **API Key**：支持选择「全部 API Key」或指定某一个 API Key，默认为全部。
- **地域**：选择 推理地域。
- **请求方式**：支持按请求类型筛选，可选全部、流式（Streaming）或非流式（Non-Streaming）。

### 统计

统计 Tab 包含以下指标，布局如下：

1. 调用次数（全宽）
2. 状态码分布（全宽）
3. 失败次数 + 失败率（并排）
4. 限流错误次数（全宽）
5. Token 用量（全宽）
6. 平均单次请求 Token 用量（全宽）
7. 缓存命中率（全宽）

| 指标 | 指标含义 |
|---|---|
| 调用次数 | 所选时间范围内，模型 API 接收到的请求总次数。 |
| 状态码分布 | 所选时间范围内，不同 HTTP 状态码对应的请求次数分布。 |
| 失败次数 | 所选时间范围内，未成功完成的请求次数。 |
| 失败率 | 所选时间范围内，失败请求次数占总请求次数的比例。 |
| 限流错误次数 | 所选时间范围内，因触发限流而失败（状态码 429）的请求次数。 |
| Token 用量 | 所选时间范围内，模型 API 请求消耗的 Token 数量，包括总 Token、输入 Token、输出 Token、缓存命中 Token。（输入 Token 包含缓存命中部分） |
| 平均单次请求 Token 用量 | 所选时间范围内，平均每次模型 API 请求消耗的 Token 数量，包括总 Token、输入 Token、输出 Token、缓存命中 Token。（输入 Token 包含缓存命中部分） |
| 缓存命中率 | 所选时间范围内，缓存命中的输入 Token 数量占总输入 Token 数量的比例 |

### 性能

性能 Tab 包含以下指标，布局如下：

1. RPM + TPM（并排）
2. 调用时长（全宽）
3. 首 Token 延迟 + Token 输出速度（并排）

| 指标 | 指标含义 |
|---|---|
| RPM | 每分钟模型 API 接收到的请求次数。 |
| TPM | 每分钟模型 API 处理的 Token 数量，包括总 Token、输入 Token、输出 Token、缓存命中 Token。（输入 Token 包含缓存命中部分） |
| 调用时长 | 单次请求从网关接收到请求开始，到完整响应返回结束所经历的总时长。 |
| 首 Token 延迟（TTFT） | 单次请求从网关接收到请求开始，到返回首个输出 Token 所经历的时长，仅统计成功且可正常采集首 Token 的流式请求。 |
| Token 输出速度（TPS） | 单次请求在 Token 生成阶段的平均输出速度，即输出 Token 数与 Token 输出耗时的比值，单位为 Token/s，仅统计成功且可正常采集 Token 输出速度的请求。 |

> **百分位说明**：P50 表示中位数（50% 的请求低于此值），P95 表示 95% 的请求低于此值，P99 表示 99% 的请求低于此值。百分位值越高，说明尾部延迟越大。

### 图表操作

每个图表卡片标题栏右侧提供以下操作按钮：

- **全屏查看**：点击全屏按钮，图表放大至覆盖层展示，按 ESC 退出。
- **下载 PNG**：将当前图表导出为 2 倍分辨率的 PNG 图片。
- **复制到剪贴板**：将图表以图片形式复制到系统剪贴板。
- **重试**：当图表加载失败时显示重试按钮，点击可单独重新请求该图表对应的数据。

图表加载中时显示骨架屏动画（折线占位符脉冲效果），而非空白等待。

## 使用前提

- 当前账号已创建 API Key 并产生了模型调用数据。
- 监控数据基于审计日志存储，请选择正确的地域。

## 常见问题

### 为什么某些图表不显示数据？

可能原因包括：

- 所选时间范围内无调用记录；
- 所选 API Key 无对应模型的调用权限；
- 所选地域不正确。

请检查筛选条件后重试。

### 聚合粒度选项为什么部分变灰不可选？

聚合粒度会根据所选时间范围自动禁用不合适的选项，以避免数据点过密或过疏。例如时间范围超过 7 天时，仅支持按天聚合。具体规则参见上方筛选条件中的聚合粒度表。

### 为什么无法选择超过 60 天的时间范围？

系统限制单次查询最大为 60 天。如需查看更长时间跨度的数据，建议分段查询。