本文介绍RDS实例巡检支持的61个巡检事项和191个可配置指标,覆盖性能、资源、会话、备份、高可用、安全、慢SQL、错误日志和Schema治理等领域,并说明每个指标的含义、单位、比较方式和推荐规则,供您在创建自定义巡检事项时参考。
指标表字段说明
本文按巡检领域组织,每个领域包含若干巡检事项,每个巡检事项对应一张指标表。指标表中各字段的含义如下:
-
指标名称(Key):指标在控制台的展示名称,括号中的Key为该指标的唯一标识。
-
指标含义:指标反映的数据库状态,以及该指标在巡检事项中的用途。
-
单位:指标值和阈值使用的单位。取值为“无固定单位”时,表示该指标为状态值、枚举值或时间值。
-
比较方式:创建规则时该指标支持选择的比较符。
-
推荐规则:系统提供的默认Warning和Error规则,您可以结合实例规格、业务峰值和服务等级目标(SLO)调整阈值。
-
可选值:状态类或枚举类指标支持直接选择的取值。取值为“—”时,表示需要您自行输入阈值。
建议先在少量代表性实例上使用默认阈值运行巡检,再根据业务基线逐步校准阈值。默认阈值为通用取值,不能覆盖所有业务负载特征,请由数据库管理员结合实际负载确认。
选择巡检指标
创建自定义巡检事项时,建议先明确需要判断的业务问题,再选择对应的指标。选择步骤如下:
-
明确业务问题:例如判断CPU是否持续处于高水位,或备份是否满足7天恢复要求。
-
选择主判断指标:选择直接用于配置Warning和Error规则的指标,例如CPU使用率均值、备份保留天数。
-
补充解释指标:选择用于区分瞬时峰值、持续高水位和长期趋势的指标,例如CPU峰值、CPU高水位占比、CPU趋势。
-
核对单位、比较方式和可选值:阈值需按指标定义的单位(如%、秒、MB、次数)填写;布尔类和状态类指标需使用指标表中列出的可选值。
|
业务问题 |
主判断指标 |
可选解释指标 |
说明 |
|
CPU是否持续高水位 |
CPU使用率均值、CPU超过90%占比 |
CPU峰值、CPU趋势、CPU异常点数 |
以均值和占比作为判断依据,以峰值和趋势辅助定位原因。 |
|
QPS是否异常变化 |
QPS均值、QPS异常比例 |
QPS峰值、QPS趋势、QPS变异系数 |
同时关注负载水位和波动幅度。 |
|
备份是否满足恢复要求 |
备份保留天数、最近备份时间 |
备份成功率、备份大小 |
从备份是否存在、是否成功、保留时长三个方面组合判断。 |
|
是否存在锁风险 |
行锁等待数、MDL锁会话峰值 |
死锁次数、锁超时频率 |
根据锁问题的发生频度和持续时长组合配置规则。 |
|
安全配置是否合规 |
是否开启SSL、账号状态、白名单状态 |
外部IP错误峰值、安全攻击状态 |
状态类指标优先使用控制台提供的可选值。 |
建议一个巡检事项聚焦一个业务问题,使用1~2个主判断指标,再按需补充解释指标。创建自定义巡检事项的完整步骤,请参见RDS实例巡检功能。
能力总览
实例巡检提供12个核心巡检领域与扩展能力,共61个巡检事项、191个可配置指标。下表中各领域的指标数按巡检事项维度统计,部分指标可在多个巡检事项中复用。
|
巡检领域 |
事项数 |
指标数 |
|
性能指标 |
4 |
35 |
|
资源使用率 |
6 |
51 |
|
安全配置分析 |
5 |
10 |
|
扩展能力 |
1 |
2 |
|
备份与恢复分析 |
7 |
21 |
|
慢查询分析 |
6 |
15 |
|
高可用与容灾分析 |
5 |
11 |
|
Schema与对象分析 |
4 |
9 |
|
错误日志分析 |
5 |
9 |
|
实例信息 |
5 |
13 |
|
连接与会话管理 |
4 |
8 |
|
锁等待与死锁分析 |
4 |
6 |
|
存储引擎分析 |
5 |
9 |
目前RDS实例巡检仅支持MySQL引擎。
1. 性能指标
本领域当前提供35个指标,覆盖4个巡检事项。
QPS性能分析
分析QPS水位、波动趋势和异常点。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
QPS均值( |
表示巡检时间窗口内的QPS均值,用于观察整体平均水位。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
QPS峰值( |
表示巡检时间窗口内的QPS峰值,用于识别最高水位或最严重时刻。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
QPS最小值( |
表示巡检时间窗口内的QPS最小值,用于识别最低水位或能力下限。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
QPS标准差( |
衡量QPS在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
QPS变异系数( |
衡量QPS相对平均水位的波动强度,便于比较不同负载规模下的稳定性。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
QPS极差( |
表示巡检时间窗口内最高值与最低值的差异,反映QPS波动幅度。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
QPS中位数( |
统计QPS中位数,用于衡量该现象的规模或发生频度。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
QPS峰值时间( |
记录QPS峰值时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
QPS最低时间( |
记录QPS最低时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
QPS趋势( |
描述QPS趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
QPS异常点数( |
统计QPS异常点数,用于识别时间窗口内突发或离群波动的频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
QPS异常比例( |
统计QPS异常比例,用于判断异常波动在整个时间窗口中的持续程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
TPS性能分析
分析TPS水位、波动趋势和异常点。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
TPS均值( |
表示巡检时间窗口内的TPS均值,用于观察整体平均水位。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
TPS峰值( |
表示巡检时间窗口内的TPS峰值,用于识别最高水位或最严重时刻。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
TPS最小值( |
表示巡检时间窗口内的TPS最小值,用于识别最低水位或能力下限。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
TPS标准差( |
衡量TPS在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
TPS变异系数( |
衡量TPS相对平均水位的波动强度,便于比较不同负载规模下的稳定性。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
TPS极差( |
表示巡检时间窗口内最高值与最低值的差异,反映TPS波动幅度。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
TPS中位数( |
统计TPS中位数,用于衡量该现象的规模或发生频度。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
TPS峰值时间( |
记录TPS峰值时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
TPS最低时间( |
记录TPS最低时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
TPS趋势( |
描述TPS趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
TPS异常点数( |
统计TPS异常点数,用于识别时间窗口内突发或离群波动的频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
TPS异常比例( |
统计TPS异常比例,用于判断异常波动在整个时间窗口中的持续程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
InnoDB缓冲池命中率
检查InnoDB缓冲池命中率及低水位占比。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
InnoDB缓冲池命中率均值( |
表示巡检时间窗口内的InnoDB缓冲池命中率均值,用于观察整体平均水位。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning < 95;Error < 90 |
— |
|
InnoDB缓冲池命中率最小值( |
表示巡检时间窗口内的InnoDB缓冲池命中率最小值,用于识别最低水位或能力下限。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning < 95;Error < 90 |
— |
|
InnoDB缓冲池命中率标准差( |
衡量InnoDB缓冲池命中率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 20 |
— |
|
InnoDB缓冲池命中率低于95%占比( |
衡量InnoDB缓冲池命中率低于95%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 70;Error ≥ 90 |
— |
临时表创建分析
分析临时磁盘表创建频率和临时文件空间占用。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
临时磁盘表创建总数( |
统计临时磁盘表创建总数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
临时磁盘表创建速率( |
表示巡检时间窗口内的临时磁盘表创建速率,用于识别最低水位或能力下限。 |
次/分钟 |
>、≥、<、≤、=、≠、区间 |
Warning > 50;Error > 100 |
— |
|
临时磁盘表创建峰值速率( |
表示巡检时间窗口内的临时磁盘表创建峰值速率,用于识别最高水位或最严重时刻。 |
次/分钟 |
>、≥、<、≤、=、≠、区间 |
Warning > 83.33;Error > 166.67 |
— |
|
临时磁盘表创建趋势( |
描述临时磁盘表创建趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
临时文件最大占用( |
表示巡检时间窗口内的临时文件最大占用,用于识别最高水位或最严重时刻。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning > 1024;Error > 10240 |
— |
|
临时文件平均占用( |
表示巡检时间窗口内的临时文件平均占用,用于观察整体平均水位。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning > 1024;Error > 10240 |
— |
|
临时文件占磁盘比例( |
衡量临时文件占磁盘比例,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 30;Error > 50 |
— |
2. 资源使用率
本领域当前提供51个指标,覆盖6个巡检事项。
CPU使用率分析
分析CPU使用率水位、峰值、趋势和异常点。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
CPU使用率均值( |
表示巡检时间窗口内的CPU使用率均值,用于观察整体平均水位。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
CPU使用率峰值( |
表示巡检时间窗口内的CPU使用率峰值,用于识别最高水位或最严重时刻。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
CPU使用率最小值( |
表示巡检时间窗口内的CPU使用率最小值,用于识别最低水位或能力下限。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
CPU峰值时间( |
记录CPU峰值时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
CPU超80%占比( |
衡量CPU超80%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
CPU超90%占比( |
衡量CPU超90%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
|
CPU使用率趋势( |
描述CPU使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
CPU异常点数( |
统计CPU异常点数,用于识别时间窗口内突发或离群波动的频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
CPU使用率标准差( |
衡量CPU使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
CPU高负载时间占比( |
衡量CPU高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
内存使用率分析
分析内存使用率水位、峰值、趋势和异常点。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
内存使用率均值( |
表示巡检时间窗口内的内存使用率均值,用于观察整体平均水位。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
内存使用率峰值( |
表示巡检时间窗口内的内存使用率峰值,用于识别最高水位或最严重时刻。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
内存使用率最小值( |
表示巡检时间窗口内的内存使用率最小值,用于识别最低水位或能力下限。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
内存峰值时间( |
记录内存峰值时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
内存超80%占比( |
衡量内存超80%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
内存超90%占比( |
衡量内存超90%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
|
内存使用率趋势( |
描述内存使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
内存异常点数( |
统计内存异常点数,用于识别时间窗口内突发或离群波动的频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
内存使用率标准差( |
衡量内存使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
内存高负载时间占比( |
衡量内存高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
磁盘使用率分析
分析磁盘使用率水位、峰值、趋势和异常点。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
磁盘使用率均值( |
表示巡检时间窗口内的磁盘使用率均值,用于观察整体平均水位。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
磁盘使用率峰值( |
表示巡检时间窗口内的磁盘使用率峰值,用于识别最高水位或最严重时刻。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
磁盘使用率最小值( |
表示巡检时间窗口内的磁盘使用率最小值,用于识别最低水位或能力下限。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
磁盘峰值时间( |
记录磁盘峰值时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
磁盘超80%占比( |
衡量磁盘超80%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
|
磁盘超90%占比( |
衡量磁盘超90%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
|
磁盘使用率趋势( |
描述磁盘使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
磁盘异常点数( |
统计磁盘异常点数,用于识别时间窗口内突发或离群波动的频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
磁盘使用率标准差( |
衡量磁盘使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
磁盘高负载时间占比( |
衡量磁盘高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
IOPS使用率分析
分析IOPS水位、峰值、趋势和异常点。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
IOPS均值( |
表示巡检时间窗口内的IOPS均值,用于观察整体平均水位。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
IOPS峰值( |
表示巡检时间窗口内的IOPS峰值,用于识别最高水位或最严重时刻。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
IOPS最小值( |
表示巡检时间窗口内的IOPS最小值,用于识别最低水位或能力下限。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
IOPS峰值时间( |
记录IOPS峰值时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
IOPS趋势( |
描述IOPS趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
IOPS异常点数( |
统计IOPS异常点数,用于识别时间窗口内突发或离群波动的频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 10 |
— |
|
IOPS标准差( |
衡量IOPS在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
次/秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 5000 |
— |
|
IOPS高负载时间占比( |
衡量IOPS高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
连接数使用率分析
分析数据库连接使用率水位、峰值和异常点。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
连接使用率均值( |
表示巡检时间窗口内的连接使用率均值,用于观察整体平均水位。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
连接使用率峰值( |
表示巡检时间窗口内的连接使用率峰值,用于识别最高水位或最严重时刻。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
连接使用率最小值( |
表示巡检时间窗口内的连接使用率最小值,用于识别最低水位或能力下限。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
连接峰值时间( |
记录连接峰值时间,用于定位关键峰谷或状态发生的具体时刻。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00 |
— |
|
连接超80%占比( |
衡量连接超80%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 80;Error > 90 |
— |
|
连接超90%占比( |
衡量连接超90%占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
|
连接使用率趋势( |
描述连接使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。 |
无固定单位 |
=、≠ |
Warning = increasing;Error = increasing |
increasing、stable、decreasing |
|
连接异常点数( |
统计连接异常点数,用于识别时间窗口内突发或离群波动的频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
连接使用率标准差( |
衡量连接使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
连接数高负载时间占比( |
衡量连接数高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 30;Error ≥ 50 |
— |
存储吞吐量分析
分析存储I/O吞吐量的平均值和峰值。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
IO吞吐量均值( |
表示巡检时间窗口内的IO吞吐量均值,用于观察整体平均水位。 |
MB/s |
>、≥、<、≤、=、≠、区间 |
Warning > 100;Error > 500 |
— |
|
IO吞吐量峰值( |
表示巡检时间窗口内的IO吞吐量峰值,用于识别最高水位或最严重时刻。 |
MB/s |
>、≥、<、≤、=、≠、区间 |
Warning > 100;Error > 500 |
— |
|
存储吞吐规格使用率( |
衡量存储吞吐规格使用率,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 80;Error ≥ 90 |
— |
3. 安全配置分析
本领域当前提供10个指标,覆盖5个巡检事项。
SSL/TLS状态
检查SSL和TDE数据加密配置状态。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
SSL开启状态( |
表示SSL开启状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
|
TDE加密状态( |
表示TDE加密状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
IP白名单分析
检查IP白名单是否存在全网放通风险。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
白名单全放通( |
表示白名单全放通的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
|
白名单组数( |
统计白名单组数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
账号权限分析
检查数据库账号数量、高权限账号和不可用账号。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
账号数量( |
统计账号数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
存在高权限账号( |
表示存在高权限账号的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
|
高权限账号数量( |
统计高权限账号数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 2;Error > 10 |
— |
|
不可用账号数量( |
统计不可用账号数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 5 |
— |
密码策略分析
检查数据库密码复杂度策略是否启用。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
密码策略已启用( |
表示密码策略已启用的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
安全组分析
检查实例绑定的安全组配置。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
安全组数量( |
统计安全组数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
4. 扩展能力
用于承载跨领域或独立扩展能力,便于按业务需要组合进自定义事项。
其他扩展指标
用于补充该巡检事项的关键可观测数据。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
审计日志已启用( |
表示审计日志已启用的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
|
只读实例数量( |
统计只读实例数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
5. 备份与恢复分析
本领域当前提供21个指标,覆盖7个巡检事项。
数据备份状态与策略
检查数据备份是否启用及其保留周期。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
备份保留天数( |
统计备份保留天数,用于衡量该现象的规模或发生频度。 |
天 |
>、≥、<、≤、=、≠、区间 |
Warning < 7;Error ≤ 3 |
— |
|
备份已启用( |
表示备份已启用的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
日志备份状态与策略
检查日志备份是否启用及其保留周期。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
日志备份已启用( |
表示日志备份已启用的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
|
日志备份保留天数( |
统计日志备份保留天数,用于衡量该现象的规模或发生频度。 |
天 |
>、≥、<、≤、=、≠、区间 |
Warning < 7;Error ≤ 3 |
— |
|
高空间使用率保护状态( |
表示高空间使用率保护状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
备份历史分析
分析最近备份时间、备份数量和备份空间占用。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
上次备份距今(小时)( |
衡量上次备份距今(小时),用于判断时长、延迟或保留周期是否符合预期。 |
小时 |
>、≥、<、≤、=、≠、区间 |
Warning > 48;Error > 72 |
— |
|
备份数量( |
统计备份数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning = 0;Error = 0 |
— |
|
最近一次备份失败( |
表示最近一次备份失败的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
|
备份总大小(MB)( |
反映备份总大小(MB),用于辅助判断“备份历史分析”相关的运行状态与风险。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning > 1024;Error > 10240 |
— |
|
成功备份数( |
统计成功备份数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning < 2;Error = 0 |
— |
|
备份失败率( |
衡量备份失败率,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 10;Error ≥ 30 |
— |
Binlog空间占用
分析Binlog文件数量和空间占用。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
Binlog文件数( |
统计Binlog文件数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 100;Error ≥ 500 |
— |
|
Binlog总大小(MB)( |
反映Binlog总大小(MB),用于辅助判断“Binlog空间占用”相关的运行状态与风险。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 10240;Error ≥ 51200 |
— |
|
当前Binlog空间占用( |
反映当前Binlog空间占用,用于辅助判断“Binlog空间占用”相关的运行状态与风险。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 10240;Error ≥ 51200 |
— |
|
Binlog空间使用率( |
衡量Binlog空间使用率,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 20;Error ≥ 50 |
— |
Binlog文件列表
检查Binlog文件数量和文件空间占用。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
Binlog文件数( |
统计Binlog文件数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 100;Error ≥ 500 |
— |
|
Binlog总大小(MB)( |
反映Binlog总大小(MB),用于辅助判断“Binlog文件列表”相关的运行状态与风险。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 10240;Error ≥ 51200 |
— |
Binlog开启状态
检查Binlog是否启用。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
Binlog已启用( |
表示Binlog已启用的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
Binlog备份策略
检查Binlog保留策略配置。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
Binlog已启用( |
表示Binlog已启用的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
|
Binlog保留天数( |
统计Binlog保留天数,用于衡量该现象的规模或发生频度。 |
天 |
>、≥、<、≤、=、≠、区间 |
Warning ≤ 3;Error ≤ 1 |
— |
|
Binlog自动清理状态( |
表示Binlog自动清理状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
6. 慢查询分析
本领域当前提供15个指标,覆盖6个巡检事项。
慢查询日志状态
检查慢查询日志是否启用。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
慢查询日志已启用( |
表示慢查询日志已启用的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
慢查询数量分析
统计慢查询数量、SQL模板数量和平均扫描行数。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
慢查询总数( |
统计慢查询总数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 2000 |
— |
|
慢查询独立SQL数( |
统计慢查询独立SQL数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 50;Error > 200 |
— |
|
慢查询平均扫描行( |
表示巡检时间窗口内的慢查询平均扫描行,用于观察整体平均水位。 |
行 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
慢查询耗时分布
分析慢查询平均耗时、最大耗时和耗时分布。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
超过10s慢查询数( |
统计超过10s慢查询数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 5;Error > 20 |
— |
|
5-10s慢查询数( |
统计5-10s慢查询数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 30;Error > 100 |
— |
|
10秒及以上慢SQL占比( |
衡量10秒及以上慢SQL占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
5至10秒慢SQL占比( |
衡量5至10秒慢SQL占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 50;Error > 80 |
— |
Top慢SQL分析
分析平均耗时最高的慢SQL。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
Top慢查询平均时间( |
表示巡检时间窗口内的Top慢查询平均时间,用于观察整体平均水位。 |
秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
|
Top慢查询执行次数( |
统计Top慢查询执行次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
高频慢SQL分析
分析执行频率最高的慢SQL。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
Top慢查询执行次数( |
统计Top慢查询执行次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
高频慢SQL数量( |
统计高频慢SQL数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 10 |
— |
慢SQL来源分析
分析慢SQL的来源数据库、来源IP和高峰时段。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
单来源IP慢SQL最大数( |
表示巡检时间窗口内的单来源IP慢SQL最大数,用于识别最高水位或最严重时刻。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 50;Error > 200 |
— |
|
单小时慢SQL最大数( |
表示巡检时间窗口内的单小时慢SQL最大数,用于识别最高水位或最严重时刻。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 100;Error > 500 |
— |
|
慢SQL涉及数据库数( |
统计慢SQL涉及数据库数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
7. 高可用与容灾分析
本领域当前提供11个指标,覆盖5个巡检事项。
复制状态分析
检查主从复制延迟、复制线程状态和复制错误。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
复制延迟( |
衡量复制延迟,用于判断时长、延迟或保留周期是否符合预期。 |
秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 60;Error > 300 |
— |
|
Slave IO运行状态( |
表示Slave IO运行状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
|
Slave SQL运行状态( |
表示Slave SQL运行状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
|
复制错误( |
反映复制错误,用于辅助判断“复制状态分析”相关的运行状态与风险。 |
无固定单位 |
=、≠ |
Warning ≠;Error ≠ |
— |
|
复制链路中断( |
表示复制链路中断的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
高可用切换分析
分析高可用切换次数和最近切换原因。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
异常HA切换次数( |
统计异常HA切换次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 2;Error ≥ 6 |
— |
|
HA最近切换原因( |
反映HA最近切换原因,用于辅助判断“高可用切换分析”相关的运行状态与风险。 |
无固定单位 |
=、≠ |
Warning = Auto;Error = Health check failed |
— |
复制中断分析
检查复制中断及复制错误风险。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
复制错误次数( |
统计复制错误次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 5;Error > 10 |
— |
|
复制中断频率( |
表示复制中断频率的当前状态,用于判断相关配置或风险是否成立。 |
次/小时 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 2 |
— |
重启/停止分析
检查实例崩溃重启和异常停止记录。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
崩溃重启次数( |
统计崩溃重启次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 2;Error ≥ 6 |
— |
跨可用区部署分析
检查主备实例是否跨可用区部署。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
跨可用区部署( |
表示跨可用区部署的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
8. Schema与对象分析
本领域当前提供9个指标,覆盖4个巡检事项。
大表分析
分析最大表大小、最大表名称和实例表总数。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
最大表大小(MB)( |
表示巡检时间窗口内的最大表大小(MB),用于识别最高水位或最严重时刻。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning > 102400;Error > 512000 |
— |
|
最大表名称( |
表示巡检时间窗口内的最大表名称,用于识别最高水位或最严重时刻。 |
无固定单位 |
=、≠ |
Warning = mysql.db;Error = mysql.user |
— |
|
表总数( |
统计表总数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
Top5大表占磁盘比例( |
衡量Top5大表占磁盘比例,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 50;Error > 80 |
— |
无主键表分析
检查无主键表数量和表清单。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
无主键表数量( |
统计无主键表数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 50 |
— |
|
无主键表列表( |
反映无主键表列表,用于辅助判断“无主键表分析”相关的运行状态与风险。 |
无固定单位 |
=、≠ |
Warning ≠;Error ≠ |
— |
TEXT/BLOB字段分析
检查TEXT和BLOB类型字段数量。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
TEXT/BLOB字段数( |
统计TEXT/BLOB字段数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 50;Error > 200 |
— |
自增溢出风险分析
检查自增列使用率和溢出风险。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
自增主键高风险表数( |
统计自增主键高风险表数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 0 |
— |
|
自增主键中风险表数( |
统计自增主键中风险表数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 5 |
— |
9. 错误日志分析
本领域当前提供9个指标,覆盖5个巡检事项。
错误日志总体统计
统计错误日志总量及ERROR、WARNING级别分布。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
错误日志总数( |
统计错误日志总数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 100;Error > 500 |
— |
|
Error级日志数( |
统计Error级日志数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
|
Warning级日志数( |
统计Warning级日志数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 10 |
— |
连接失败错误
检查数据库连接失败类错误。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
连接失败次数( |
统计连接失败次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 20;Error > 50 |
— |
认证失败错误
检查数据库认证失败类错误。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
认证失败次数( |
统计认证失败次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 5;Error > 20 |
— |
访问拒绝错误
检查数据库权限拒绝类错误。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
访问拒绝次数( |
统计访问拒绝次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 50 |
— |
安全威胁识别
检查潜在暴力破解和安全威胁IP。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
单一外部IP错误峰值( |
表示巡检时间窗口内的单一外部IP错误峰值,用于识别最高水位或最严重时刻。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 20;Error > 50 |
— |
|
存在严重集中攻击( |
表示存在严重集中攻击的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
|
存在集中攻击( |
表示存在集中攻击的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
10. 实例信息
本领域当前提供13个指标,覆盖5个巡检事项。
实例运行状态
检查实例当前运行状态以及异常、待处理和未知状态。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
实例运行状态( |
表示实例运行状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = Maintaining;Error = Released |
Running、Creating、Deleting、EngineVersionUpgrading、DBInstanceClassChanging、Restoring、Transing、InstanceInstalling、Importing、GuardDBInstanceCreating、Maintaining、Migrating、Upgrading、Released、Deleted、Expired、Unknown |
|
实例是否异常( |
表示实例是否异常的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
|
实例是否处于需关注状态( |
表示实例是否处于需关注状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
|
实例是否未知状态( |
表示实例是否未知状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
实例锁定状态
检查实例是否处于锁定状态。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
实例是否锁定( |
表示实例是否锁定的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
到期时间与续费风险
检查实例到期时间、自动续费状态和续费风险。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
实例到期天数( |
统计实例到期天数,用于衡量该现象的规模或发生频度。 |
天 |
>、≥、<、≤、=、≠、区间 |
Warning ≤ 30;Error ≤ 7 |
— |
|
实例续费风险( |
表示实例续费风险的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = true;Error = true |
true、false |
MySQL版本信息
检查MySQL引擎版本、当前内核版本和最新内核版本。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
MySQL引擎版本( |
表示MySQL引擎版本的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = 5.7;Error = 5.6 |
5.6、5.7、8.0 |
|
当前内核版本( |
反映当前内核版本,用于辅助判断“MySQL版本信息”相关的运行状态与风险。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < rds_20240101;Error < rds_20230101 |
— |
|
最新内核版本( |
反映最新内核版本,用于辅助判断“MySQL版本信息”相关的运行状态与风险。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < rds_20240101;Error < rds_20230101 |
— |
版本安全风险
检查当前MySQL内核版本是否存在已知安全漏洞。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
当前内核版本( |
反映当前内核版本,用于辅助判断“版本安全风险”相关的运行状态与风险。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < rds_20240101;Error < rds_20230101 |
— |
|
最新内核版本( |
反映最新内核版本,用于辅助判断“版本安全风险”相关的运行状态与风险。 |
无固定单位 |
>、≥、<、≤、=、≠、区间 |
Warning < rds_20240101;Error < rds_20230101 |
— |
|
版本安全风险等级( |
表示版本安全风险等级的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = Warning;Error = Error |
Normal、Warning、Error |
11. 连接与会话管理
本领域当前提供8个指标,覆盖4个巡检事项。
活跃会话状态
检查活跃会话数和运行线程数的峰值。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
活跃会话峰值( |
表示巡检时间窗口内的活跃会话峰值,用于识别最高水位或最严重时刻。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 1000;Error > 2000 |
— |
|
运行线程峰值( |
表示巡检时间窗口内的运行线程峰值,用于识别最高水位或最严重时刻。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 500;Error > 1000 |
— |
阻塞SQL分析
检查当前处于锁等待或阻塞状态的SQL。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
被阻塞SQL数( |
统计被阻塞SQL数,用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 10 |
— |
|
阻塞SQL平均阻塞时长( |
表示巡检时间窗口内的阻塞SQL平均阻塞时长,用于观察整体平均水位。 |
秒 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error ≥ 300 |
— |
未提交事务分析
检查未提交事务和长事务数量。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
未提交事务数( |
统计未提交事务数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning ≥ 5;Error > 9 |
— |
|
长事务数( |
统计长事务数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 0 |
— |
|
中等时长事务数( |
统计中等时长事务数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 5 |
— |
长时间运行SQL分析
检查当前执行时间过长的SQL。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
长时间运行SQL数(审计优先)( |
统计长时间运行SQL数(审计优先),用于衡量该现象的规模或发生频度。 |
项 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 10 |
— |
12. 锁等待与死锁分析
本领域当前提供6个指标,覆盖4个巡检事项。
MDL锁等待分析
检查MDL锁等待会话数量。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
MDL锁会话峰值( |
表示巡检时间窗口内的MDL锁会话峰值,用于识别最高水位或最严重时刻。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 50 |
— |
行锁等待分析
检查当前行锁等待会话数量。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
行锁等待数( |
统计行锁等待数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 5;Error > 10 |
— |
死锁检测
检查时间窗口内发生的数据库死锁。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
死锁次数( |
统计死锁次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 5;Error > 10 |
— |
|
死锁频率( |
衡量死锁频率,用于观察该现象在整体数据中的占比或风险程度。 |
次/小时 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 2 |
— |
锁等待超时分析
检查时间窗口内发生的锁等待超时。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
锁超时次数( |
统计锁超时次数,用于衡量该现象的规模或发生频度。 |
次 |
>、≥、<、≤、=、≠、区间 |
Warning > 5;Error > 10 |
— |
|
锁等待超时频率( |
衡量锁等待超时频率,用于观察该现象在整体数据中的占比或风险程度。 |
次/小时 |
>、≥、<、≤、=、≠、区间 |
Warning > 1;Error > 2 |
— |
13. 存储引擎分析
本领域当前提供9个指标,覆盖5个巡检事项。
引擎分布与风险分析
分析表存储引擎分布和MyISAM使用情况。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
MyISAM表数量( |
统计MyISAM表数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 10 |
— |
|
MyISAM占比( |
衡量MyISAM占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
事务支持能力分析
检查表存储引擎的事务支持风险。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
MyISAM表数量( |
统计MyISAM表数量,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 10 |
— |
|
MyISAM占比( |
衡量MyISAM占比,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 10;Error > 30 |
— |
系统表引擎检查
检查系统库是否存在非InnoDB表。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
非InnoDB系统表数( |
统计非InnoDB系统表数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 0;Error > 10 |
— |
InnoDB运行状态分析
检查InnoDB当前活跃事务状态。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
InnoDB活跃事务数( |
统计InnoDB活跃事务数,用于衡量该现象的规模或发生频度。 |
个 |
>、≥、<、≤、=、≠、区间 |
Warning > 200;Error > 500 |
— |
|
InnoDB运行健康状态( |
表示InnoDB运行健康状态的当前状态,用于判断相关配置或风险是否成立。 |
无固定单位 |
=、≠ |
Warning = false;Error = false |
true、false |
表碎片分析
分析表碎片率和高碎片表数量。
|
指标名称(Key) |
指标含义 |
单位 |
比较方式 |
推荐规则 |
可选值 |
|
表碎片总大小( |
反映表碎片总大小,用于辅助判断“表碎片分析”相关的运行状态与风险。 |
MB |
>、≥、<、≤、=、≠、区间 |
Warning > 5000;Error > 10000 |
— |
|
表碎片占磁盘比例( |
衡量表碎片占磁盘比例,用于观察该现象在整体数据中的占比或风险程度。 |
% |
>、≥、<、≤、=、≠、区间 |
Warning > 30;Error > 50 |
— |
使用建议
-
从需要判断的业务问题出发选择指标,避免在一个巡检事项中添加过多无关指标。
-
Warning规则用于提前提示趋势或水位风险,Error规则用于标识需要优先处理的高风险条件。
-
多指标联合判断时,需先明确规则的命中条件是满足任一条件还是满足全部条件。
-
布尔类和枚举类指标需使用指标表中列出的可选值,不支持自定义文本值。
-
新建巡检模板建议先在少量代表性实例上运行,确认指标数据可采集、规则可命中、报告结果符合预期后,再扩大适用范围。
指标列表会随产品能力持续更新。新增数据源、指标或数据库引擎时,配置方式与本文保持一致。