RDS实例巡检项及巡检规则说明

更新时间:
复制 MD 格式

本文介绍RDS实例巡检支持的61个巡检事项和191个可配置指标,覆盖性能、资源、会话、备份、高可用、安全、慢SQL、错误日志和Schema治理等领域,并说明每个指标的含义、单位、比较方式和推荐规则,供您在创建自定义巡检事项时参考。

指标表字段说明

本文按巡检领域组织,每个领域包含若干巡检事项,每个巡检事项对应一张指标表。指标表中各字段的含义如下:

  • 指标名称(Key):指标在控制台的展示名称,括号中的Key为该指标的唯一标识。

  • 指标含义:指标反映的数据库状态,以及该指标在巡检事项中的用途。

  • 单位:指标值和阈值使用的单位。取值为“无固定单位”时,表示该指标为状态值、枚举值或时间值。

  • 比较方式:创建规则时该指标支持选择的比较符。

  • 推荐规则:系统提供的默认WarningError规则,您可以结合实例规格、业务峰值和服务等级目标(SLO)调整阈值。

  • 可选值:状态类或枚举类指标支持直接选择的取值。取值为“—”时,表示需要您自行输入阈值。

说明

建议先在少量代表性实例上使用默认阈值运行巡检,再根据业务基线逐步校准阈值。默认阈值为通用取值,不能覆盖所有业务负载特征,请由数据库管理员结合实际负载确认。

选择巡检指标

创建自定义巡检事项时,建议先明确需要判断的业务问题,再选择对应的指标。选择步骤如下:

  1. 明确业务问题:例如判断CPU是否持续处于高水位,或备份是否满足7天恢复要求。

  2. 选择主判断指标:选择直接用于配置WarningError规则的指标,例如CPU使用率均值、备份保留天数。

  3. 补充解释指标:选择用于区分瞬时峰值、持续高水位和长期趋势的指标,例如CPU峰值、CPU高水位占比、CPU趋势。

  4. 核对单位、比较方式和可选值:阈值需按指标定义的单位(如%、秒、MB、次数)填写;布尔类和状态类指标需使用指标表中列出的可选值。

业务问题

主判断指标

可选解释指标

说明

CPU是否持续高水位

CPU使用率均值、CPU超过90%占比

CPU峰值、CPU趋势、CPU异常点数

以均值和占比作为判断依据,以峰值和趋势辅助定位原因。

QPS是否异常变化

QPS均值、QPS异常比例

QPS峰值、QPS趋势、QPS变异系数

同时关注负载水位和波动幅度。

备份是否满足恢复要求

备份保留天数、最近备份时间

备份成功率、备份大小

从备份是否存在、是否成功、保留时长三个方面组合判断。

是否存在锁风险

行锁等待数、MDL锁会话峰值

死锁次数、锁超时频率

根据锁问题的发生频度和持续时长组合配置规则。

安全配置是否合规

是否开启SSL、账号状态、白名单状态

外部IP错误峰值、安全攻击状态

状态类指标优先使用控制台提供的可选值。

说明

建议一个巡检事项聚焦一个业务问题,使用1~2个主判断指标,再按需补充解释指标。创建自定义巡检事项的完整步骤,请参见RDS实例巡检功能

能力总览

实例巡检提供12个核心巡检领域与扩展能力,共61个巡检事项、191个可配置指标。下表中各领域的指标数按巡检事项维度统计,部分指标可在多个巡检事项中复用。

巡检领域

事项数

指标数

性能指标

4

35

资源使用率

6

51

安全配置分析

5

10

扩展能力

1

2

备份与恢复分析

7

21

慢查询分析

6

15

高可用与容灾分析

5

11

Schema与对象分析

4

9

错误日志分析

5

9

实例信息

5

13

连接与会话管理

4

8

锁等待与死锁分析

4

6

存储引擎分析

5

9

说明

目前RDS实例巡检仅支持MySQL引擎。

1. 性能指标

本领域当前提供35个指标,覆盖4个巡检事项。

QPS性能分析

分析QPS水位、波动趋势和异常点。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

QPS均值(qps_avg

表示巡检时间窗口内的QPS均值,用于观察整体平均水位。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

QPS峰值(qps_max

表示巡检时间窗口内的QPS峰值,用于识别最高水位或最严重时刻。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

QPS最小值(qps_min

表示巡检时间窗口内的QPS最小值,用于识别最低水位或能力下限。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

QPS标准差(qps_std_dev

衡量QPS在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

QPS变异系数(qps_cv

衡量QPS相对平均水位的波动强度,便于比较不同负载规模下的稳定性。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

QPS极差(qps_range

表示巡检时间窗口内最高值与最低值的差异,反映QPS波动幅度。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

QPS中位数(qps_median

统计QPS中位数,用于衡量该现象的规模或发生频度。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

QPS峰值时间(qps_max_time

记录QPS峰值时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

QPS最低时间(qps_min_time

记录QPS最低时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

QPS趋势(qps_trend

描述QPS趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

QPS异常点数(qps_anomaly_count

统计QPS异常点数,用于识别时间窗口内突发或离群波动的频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

QPS异常比例(qps_anomaly_ratio

统计QPS异常比例,用于判断异常波动在整个时间窗口中的持续程度。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

TPS性能分析

分析TPS水位、波动趋势和异常点。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

TPS均值(tps_avg

表示巡检时间窗口内的TPS均值,用于观察整体平均水位。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

TPS峰值(tps_max

表示巡检时间窗口内的TPS峰值,用于识别最高水位或最严重时刻。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

TPS最小值(tps_min

表示巡检时间窗口内的TPS最小值,用于识别最低水位或能力下限。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

TPS标准差(tps_std_dev

衡量TPS在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

TPS变异系数(tps_cv

衡量TPS相对平均水位的波动强度,便于比较不同负载规模下的稳定性。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

TPS极差(tps_range

表示巡检时间窗口内最高值与最低值的差异,反映TPS波动幅度。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

TPS中位数(tps_median

统计TPS中位数,用于衡量该现象的规模或发生频度。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

TPS峰值时间(tps_max_time

记录TPS峰值时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

TPS最低时间(tps_min_time

记录TPS最低时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

TPS趋势(tps_trend

描述TPS趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

TPS异常点数(tps_anomaly_count

统计TPS异常点数,用于识别时间窗口内突发或离群波动的频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

TPS异常比例(tps_anomaly_ratio

统计TPS异常比例,用于判断异常波动在整个时间窗口中的持续程度。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

InnoDB缓冲池命中率

检查InnoDB缓冲池命中率及低水位占比。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

InnoDB缓冲池命中率均值(innodb_buffer_hit_avg

表示巡检时间窗口内的InnoDB缓冲池命中率均值,用于观察整体平均水位。

%

>、≥、<、≤、=、≠、区间

Warning < 95;Error < 90

InnoDB缓冲池命中率最小值(innodb_buffer_hit_min

表示巡检时间窗口内的InnoDB缓冲池命中率最小值,用于识别最低水位或能力下限。

%

>、≥、<、≤、=、≠、区间

Warning < 95;Error < 90

InnoDB缓冲池命中率标准差(innodb_buffer_hit_std_dev

衡量InnoDB缓冲池命中率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 20

InnoDB缓冲池命中率低于95%占比(innodb_buffer_hit_below95_ratio

衡量InnoDB缓冲池命中率低于95%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 70;Error ≥ 90

临时表创建分析

分析临时磁盘表创建频率和临时文件空间占用。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

临时磁盘表创建总数(temp_disk_table_sum

统计临时磁盘表创建总数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

临时磁盘表创建速率(temp_disk_table_rate_per_min

表示巡检时间窗口内的临时磁盘表创建速率,用于识别最低水位或能力下限。

次/分钟

>、≥、<、≤、=、≠、区间

Warning > 50;Error > 100

临时磁盘表创建峰值速率(temp_disk_table_peak_per_min

表示巡检时间窗口内的临时磁盘表创建峰值速率,用于识别最高水位或最严重时刻。

次/分钟

>、≥、<、≤、=、≠、区间

Warning > 83.33;Error > 166.67

临时磁盘表创建趋势(temp_disk_table_trend

描述临时磁盘表创建趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

临时文件最大占用(temp_file_size_max

表示巡检时间窗口内的临时文件最大占用,用于识别最高水位或最严重时刻。

MB

>、≥、<、≤、=、≠、区间

Warning > 1024;Error > 10240

临时文件平均占用(temp_file_size_avg

表示巡检时间窗口内的临时文件平均占用,用于观察整体平均水位。

MB

>、≥、<、≤、=、≠、区间

Warning > 1024;Error > 10240

临时文件占磁盘比例(temp_file_disk_ratio

衡量临时文件占磁盘比例,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 30;Error > 50

2. 资源使用率

本领域当前提供51个指标,覆盖6个巡检事项。

CPU使用率分析

分析CPU使用率水位、峰值、趋势和异常点。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

CPU使用率均值(cpu_avg

表示巡检时间窗口内的CPU使用率均值,用于观察整体平均水位。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

CPU使用率峰值(cpu_max

表示巡检时间窗口内的CPU使用率峰值,用于识别最高水位或最严重时刻。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

CPU使用率最小值(cpu_min

表示巡检时间窗口内的CPU使用率最小值,用于识别最低水位或能力下限。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

CPU峰值时间(cpu_max_time

记录CPU峰值时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

CPU80%占比(cpu_above80_ratio

衡量CPU80%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

CPU90%占比(cpu_above90_ratio

衡量CPU90%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

CPU使用率趋势(cpu_trend

描述CPU使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

CPU异常点数(cpu_anomaly_count

统计CPU异常点数,用于识别时间窗口内突发或离群波动的频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

CPU使用率标准差(cpu_std_dev

衡量CPU使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

CPU高负载时间占比(cpu_high_load_ratio

衡量CPU高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

内存使用率分析

分析内存使用率水位、峰值、趋势和异常点。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

内存使用率均值(memory_avg

表示巡检时间窗口内的内存使用率均值,用于观察整体平均水位。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

内存使用率峰值(memory_max

表示巡检时间窗口内的内存使用率峰值,用于识别最高水位或最严重时刻。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

内存使用率最小值(memory_min

表示巡检时间窗口内的内存使用率最小值,用于识别最低水位或能力下限。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

内存峰值时间(memory_max_time

记录内存峰值时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

内存超80%占比(memory_above80_ratio

衡量内存超80%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

内存超90%占比(memory_above90_ratio

衡量内存超90%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

内存使用率趋势(memory_trend

描述内存使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

内存异常点数(memory_anomaly_count

统计内存异常点数,用于识别时间窗口内突发或离群波动的频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

内存使用率标准差(memory_std_dev

衡量内存使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

内存高负载时间占比(memory_high_load_ratio

衡量内存高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

磁盘使用率分析

分析磁盘使用率水位、峰值、趋势和异常点。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

磁盘使用率均值(disk_avg

表示巡检时间窗口内的磁盘使用率均值,用于观察整体平均水位。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

磁盘使用率峰值(disk_max

表示巡检时间窗口内的磁盘使用率峰值,用于识别最高水位或最严重时刻。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

磁盘使用率最小值(disk_min

表示巡检时间窗口内的磁盘使用率最小值,用于识别最低水位或能力下限。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

磁盘峰值时间(disk_max_time

记录磁盘峰值时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

磁盘超80%占比(disk_above80_ratio

衡量磁盘超80%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

磁盘超90%占比(disk_above90_ratio

衡量磁盘超90%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

磁盘使用率趋势(disk_trend

描述磁盘使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

磁盘异常点数(disk_anomaly_count

统计磁盘异常点数,用于识别时间窗口内突发或离群波动的频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

磁盘使用率标准差(disk_std_dev

衡量磁盘使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

磁盘高负载时间占比(disk_high_load_ratio

衡量磁盘高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

IOPS使用率分析

分析IOPS水位、峰值、趋势和异常点。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

IOPS均值(iops_avg

表示巡检时间窗口内的IOPS均值,用于观察整体平均水位。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

IOPS峰值(iops_max

表示巡检时间窗口内的IOPS峰值,用于识别最高水位或最严重时刻。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

IOPS最小值(iops_min

表示巡检时间窗口内的IOPS最小值,用于识别最低水位或能力下限。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

IOPS峰值时间(iops_max_time

记录IOPS峰值时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

IOPS趋势(iops_trend

描述IOPS趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

IOPS异常点数(iops_anomaly_count

统计IOPS异常点数,用于识别时间窗口内突发或离群波动的频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 10

IOPS标准差(iops_std_dev

衡量IOPS在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

次/秒

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 5000

IOPS高负载时间占比(iops_high_load_ratio

衡量IOPS高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

连接数使用率分析

分析数据库连接使用率水位、峰值和异常点。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

连接使用率均值(conn_avg

表示巡检时间窗口内的连接使用率均值,用于观察整体平均水位。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

连接使用率峰值(conn_max

表示巡检时间窗口内的连接使用率峰值,用于识别最高水位或最严重时刻。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

连接使用率最小值(conn_min

表示巡检时间窗口内的连接使用率最小值,用于识别最低水位或能力下限。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

连接峰值时间(conn_max_time

记录连接峰值时间,用于定位关键峰谷或状态发生的具体时刻。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < 2024-01-01 00:00:00;Error < 2020-01-01 00:00:00

连接超80%占比(conn_above80_ratio

衡量连接超80%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 80;Error > 90

连接超90%占比(conn_above90_ratio

衡量连接超90%占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

连接使用率趋势(conn_trend

描述连接使用率趋势在巡检时间窗口内的变化方向,可用于识别持续上升、稳定或下降趋势。

无固定单位

=、≠

Warning = increasing;Error = increasing

increasing、stable、decreasing

连接异常点数(conn_anomaly_count

统计连接异常点数,用于识别时间窗口内突发或离群波动的频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

连接使用率标准差(conn_std_dev

衡量连接使用率在巡检时间窗口内的离散程度,数值越大通常表示波动越明显。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

连接数高负载时间占比(conn_high_load_ratio

衡量连接数高负载时间占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 30;Error ≥ 50

存储吞吐量分析

分析存储I/O吞吐量的平均值和峰值。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

IO吞吐量均值(io_throughput_avg_mbps

表示巡检时间窗口内的IO吞吐量均值,用于观察整体平均水位。

MB/s

>、≥、<、≤、=、≠、区间

Warning > 100;Error > 500

IO吞吐量峰值(io_throughput_max_mbps

表示巡检时间窗口内的IO吞吐量峰值,用于识别最高水位或最严重时刻。

MB/s

>、≥、<、≤、=、≠、区间

Warning > 100;Error > 500

存储吞吐规格使用率(storage_throughput_usage_ratio

衡量存储吞吐规格使用率,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 80;Error ≥ 90

3. 安全配置分析

本领域当前提供10个指标,覆盖5个巡检事项。

SSL/TLS状态

检查SSLTDE数据加密配置状态。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

SSL开启状态(ssl_enabled

表示SSL开启状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

TDE加密状态(tde_enabled

表示TDE加密状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

IP白名单分析

检查IP白名单是否存在全网放通风险。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

白名单全放通(whitelist_has_all_access

表示白名单全放通的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

白名单组数(whitelist_group_count

统计白名单组数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

账号权限分析

检查数据库账号数量、高权限账号和不可用账号。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

账号数量(account_count

统计账号数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

存在高权限账号(super_account_exists

表示存在高权限账号的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

高权限账号数量(super_account_count

统计高权限账号数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 2;Error > 10

不可用账号数量(unavailable_account_count

统计不可用账号数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 5

密码策略分析

检查数据库密码复杂度策略是否启用。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

密码策略已启用(password_policy_enabled

表示密码策略已启用的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

安全组分析

检查实例绑定的安全组配置。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

安全组数量(security_group_count

统计安全组数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

4. 扩展能力

用于承载跨领域或独立扩展能力,便于按业务需要组合进自定义事项。

其他扩展指标

用于补充该巡检事项的关键可观测数据。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

审计日志已启用(audit_log_enabled

表示审计日志已启用的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

只读实例数量(readonly_instance_count

统计只读实例数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

5. 备份与恢复分析

本领域当前提供21个指标,覆盖7个巡检事项。

数据备份状态与策略

检查数据备份是否启用及其保留周期。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

备份保留天数(backup_retention_days

统计备份保留天数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning < 7;Error ≤ 3

备份已启用(backup_enabled

表示备份已启用的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

日志备份状态与策略

检查日志备份是否启用及其保留周期。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

日志备份已启用(log_backup_enabled

表示日志备份已启用的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

日志备份保留天数(log_backup_retention_days

统计日志备份保留天数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning < 7;Error ≤ 3

高空间使用率保护状态(high_space_usage_protection_enabled

表示高空间使用率保护状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

备份历史分析

分析最近备份时间、备份数量和备份空间占用。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

上次备份距今(小时)(last_backup_age_hours

衡量上次备份距今(小时),用于判断时长、延迟或保留周期是否符合预期。

小时

>、≥、<、≤、=、≠、区间

Warning > 48;Error > 72

备份数量(backup_count

统计备份数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning = 0;Error = 0

最近一次备份失败(latest_backup_failed

表示最近一次备份失败的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

备份总大小(MB)(backup_total_size_mb

反映备份总大小(MB),用于辅助判断“备份历史分析”相关的运行状态与风险。

MB

>、≥、<、≤、=、≠、区间

Warning > 1024;Error > 10240

成功备份数(backup_success_count

统计成功备份数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning < 2;Error = 0

备份失败率(backup_failure_rate_percent

衡量备份失败率,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 10;Error ≥ 30

Binlog空间占用

分析Binlog文件数量和空间占用。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

Binlog文件数(binlog_files_count

统计Binlog文件数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning ≥ 100;Error ≥ 500

Binlog总大小(MB)(binlog_total_size_mb

反映Binlog总大小(MB),用于辅助判断“Binlog空间占用”相关的运行状态与风险。

MB

>、≥、<、≤、=、≠、区间

Warning ≥ 10240;Error ≥ 51200

当前Binlog空间占用(binlog_current_size_mb

反映当前Binlog空间占用,用于辅助判断“Binlog空间占用”相关的运行状态与风险。

MB

>、≥、<、≤、=、≠、区间

Warning ≥ 10240;Error ≥ 51200

Binlog空间使用率(binlog_space_usage_ratio

衡量Binlog空间使用率,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning ≥ 20;Error ≥ 50

Binlog文件列表

检查Binlog文件数量和文件空间占用。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

Binlog文件数(binlog_files_count

统计Binlog文件数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning ≥ 100;Error ≥ 500

Binlog总大小(MB)(binlog_total_size_mb

反映Binlog总大小(MB),用于辅助判断“Binlog文件列表”相关的运行状态与风险。

MB

>、≥、<、≤、=、≠、区间

Warning ≥ 10240;Error ≥ 51200

Binlog开启状态

检查Binlog是否启用。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

Binlog已启用(binlog_enabled

表示Binlog已启用的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

Binlog备份策略

检查Binlog保留策略配置。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

Binlog已启用(binlog_enabled

表示Binlog已启用的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

Binlog保留天数(binlog_retention_days

统计Binlog保留天数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning ≤ 3;Error ≤ 1

Binlog自动清理状态(binlog_auto_cleanup_enabled

表示Binlog自动清理状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

6. 慢查询分析

本领域当前提供15个指标,覆盖6个巡检事项。

慢查询日志状态

检查慢查询日志是否启用。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

慢查询日志已启用(slow_query_log_enabled

表示慢查询日志已启用的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

慢查询数量分析

统计慢查询数量、SQL模板数量和平均扫描行数。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

慢查询总数(slow_query_count

统计慢查询总数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 2000

慢查询独立SQL数(slow_query_unique_sql_count

统计慢查询独立SQL数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 50;Error > 200

慢查询平均扫描行(slow_query_avg_rows_examined

表示巡检时间窗口内的慢查询平均扫描行,用于观察整体平均水位。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

慢查询耗时分布

分析慢查询平均耗时、最大耗时和耗时分布。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

超过10s慢查询数(slow_query_10s_count

统计超过10s慢查询数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 5;Error > 20

5-10s慢查询数(slow_query_5_10s_count

统计5-10s慢查询数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 30;Error > 100

10秒及以上慢SQL占比(slow_query_10s_ratio

衡量10秒及以上慢SQL占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

510秒慢SQL占比(slow_query_5_10s_ratio

衡量510秒慢SQL占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 50;Error > 80

TopSQL分析

分析平均耗时最高的慢SQL。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

Top慢查询平均时间(slow_query_top_avg_time

表示巡检时间窗口内的Top慢查询平均时间,用于观察整体平均水位。

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

Top慢查询执行次数(slow_query_top_exec_count

统计Top慢查询执行次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

高频慢SQL分析

分析执行频率最高的慢SQL。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

Top慢查询执行次数(slow_query_top_exec_count

统计Top慢查询执行次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

高频慢SQL数量(slow_query_high_frequency_count

统计高频慢SQL数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 10

SQL来源分析

分析慢SQL的来源数据库、来源IP和高峰时段。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

单来源IPSQL最大数(slow_query_top_source_ip_count

表示巡检时间窗口内的单来源IPSQL最大数,用于识别最高水位或最严重时刻。

>、≥、<、≤、=、≠、区间

Warning > 50;Error > 200

单小时慢SQL最大数(slow_query_top_time_count

表示巡检时间窗口内的单小时慢SQL最大数,用于识别最高水位或最严重时刻。

>、≥、<、≤、=、≠、区间

Warning > 100;Error > 500

SQL涉及数据库数(slow_query_source_db_count

统计慢SQL涉及数据库数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

7. 高可用与容灾分析

本领域当前提供11个指标,覆盖5个巡检事项。

复制状态分析

检查主从复制延迟、复制线程状态和复制错误。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

复制延迟(replication_delay

衡量复制延迟,用于判断时长、延迟或保留周期是否符合预期。

>、≥、<、≤、=、≠、区间

Warning > 60;Error > 300

Slave IO运行状态(slave_io_running

表示Slave IO运行状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

Slave SQL运行状态(slave_sql_running

表示Slave SQL运行状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

复制错误(replication_error

反映复制错误,用于辅助判断“复制状态分析”相关的运行状态与风险。

无固定单位

=、≠

Warning ≠;Error ≠

复制链路中断(replication_broken

表示复制链路中断的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

高可用切换分析

分析高可用切换次数和最近切换原因。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

异常HA切换次数(ha_switch_count

统计异常HA切换次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning ≥ 2;Error ≥ 6

HA最近切换原因(ha_switch_latest_reason

反映HA最近切换原因,用于辅助判断“高可用切换分析”相关的运行状态与风险。

无固定单位

=、≠

Warning = Auto;Error = Health check failed

复制中断分析

检查复制中断及复制错误风险。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

复制错误次数(replication_error_count

统计复制错误次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 5;Error > 10

复制中断频率(replication_interruption_frequency

表示复制中断频率的当前状态,用于判断相关配置或风险是否成立。

次/小时

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 2

重启/停止分析

检查实例崩溃重启和异常停止记录。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

崩溃重启次数(crash_restart_count

统计崩溃重启次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning ≥ 2;Error ≥ 6

跨可用区部署分析

检查主备实例是否跨可用区部署。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

跨可用区部署(is_cross_az

表示跨可用区部署的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

8. Schema与对象分析

本领域当前提供9个指标,覆盖4个巡检事项。

大表分析

分析最大表大小、最大表名称和实例表总数。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

最大表大小(MB)(largest_table_size_mb

表示巡检时间窗口内的最大表大小(MB),用于识别最高水位或最严重时刻。

MB

>、≥、<、≤、=、≠、区间

Warning > 102400;Error > 512000

最大表名称(largest_table_name

表示巡检时间窗口内的最大表名称,用于识别最高水位或最严重时刻。

无固定单位

=、≠

Warning = mysql.db;Error = mysql.user

表总数(total_tables_count

统计表总数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

Top5大表占磁盘比例(top5_large_tables_disk_ratio

衡量Top5大表占磁盘比例,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 50;Error > 80

无主键表分析

检查无主键表数量和表清单。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

无主键表数量(tables_without_pk_count

统计无主键表数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 50

无主键表列表(tables_without_pk_list

反映无主键表列表,用于辅助判断“无主键表分析”相关的运行状态与风险。

无固定单位

=、≠

Warning ≠;Error ≠

TEXT/BLOB字段分析

检查TEXTBLOB类型字段数量。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

TEXT/BLOB字段数(text_blob_field_count

统计TEXT/BLOB字段数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 50;Error > 200

自增溢出风险分析

检查自增列使用率和溢出风险。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

自增主键高风险表数(auto_increment_high_risk_count

统计自增主键高风险表数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 0

自增主键中风险表数(auto_increment_medium_risk_count

统计自增主键中风险表数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 5

9. 错误日志分析

本领域当前提供9个指标,覆盖5个巡检事项。

错误日志总体统计

统计错误日志总量及ERROR、WARNING级别分布。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

错误日志总数(error_log_count

统计错误日志总数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 100;Error > 500

Error级日志数(error_log_error_count

统计Error级日志数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

Warning级日志数(error_log_warning_count

统计Warning级日志数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 10

连接失败错误

检查数据库连接失败类错误。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

连接失败次数(connection_failed_count

统计连接失败次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 20;Error > 50

认证失败错误

检查数据库认证失败类错误。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

认证失败次数(auth_failed_count

统计认证失败次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 5;Error > 20

访问拒绝错误

检查数据库权限拒绝类错误。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

访问拒绝次数(access_denied_count

统计访问拒绝次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 50

安全威胁识别

检查潜在暴力破解和安全威胁IP。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

单一外部IP错误峰值(security_top_ip_error_count

表示巡检时间窗口内的单一外部IP错误峰值,用于识别最高水位或最严重时刻。

>、≥、<、≤、=、≠、区间

Warning > 20;Error > 50

存在严重集中攻击(security_has_severe_concentrated_attack

表示存在严重集中攻击的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

存在集中攻击(security_has_concentrated_attack

表示存在集中攻击的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

10. 实例信息

本领域当前提供13个指标,覆盖5个巡检事项。

实例运行状态

检查实例当前运行状态以及异常、待处理和未知状态。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

实例运行状态(instance_running_status

表示实例运行状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = Maintaining;Error = Released

Running、Creating、Deleting、EngineVersionUpgrading、DBInstanceClassChanging、Restoring、Transing、InstanceInstalling、Importing、GuardDBInstanceCreating、Maintaining、Migrating、Upgrading、Released、Deleted、Expired、Unknown

实例是否异常(instance_is_abnormal

表示实例是否异常的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

实例是否处于需关注状态(instance_is_attention_status

表示实例是否处于需关注状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

实例是否未知状态(instance_is_unknown_status

表示实例是否未知状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

实例锁定状态

检查实例是否处于锁定状态。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

实例是否锁定(instance_is_locked

表示实例是否锁定的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

到期时间与续费风险

检查实例到期时间、自动续费状态和续费风险。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

实例到期天数(instance_expire_days

统计实例到期天数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning ≤ 30;Error ≤ 7

实例续费风险(instance_renewal_risk

表示实例续费风险的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = true;Error = true

true、false

MySQL版本信息

检查MySQL引擎版本、当前内核版本和最新内核版本。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

MySQL引擎版本(mysql_engine_version

表示MySQL引擎版本的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = 5.7;Error = 5.6

5.6、5.7、8.0

当前内核版本(mysql_current_kernel_version

反映当前内核版本,用于辅助判断“MySQL版本信息”相关的运行状态与风险。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < rds_20240101;Error < rds_20230101

最新内核版本(mysql_latest_kernel_version

反映最新内核版本,用于辅助判断“MySQL版本信息”相关的运行状态与风险。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < rds_20240101;Error < rds_20230101

版本安全风险

检查当前MySQL内核版本是否存在已知安全漏洞。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

当前内核版本(mysql_current_kernel_version

反映当前内核版本,用于辅助判断“版本安全风险”相关的运行状态与风险。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < rds_20240101;Error < rds_20230101

最新内核版本(mysql_latest_kernel_version

反映最新内核版本,用于辅助判断“版本安全风险”相关的运行状态与风险。

无固定单位

>、≥、<、≤、=、≠、区间

Warning < rds_20240101;Error < rds_20230101

版本安全风险等级(version_vulnerability_level

表示版本安全风险等级的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = Warning;Error = Error

Normal、Warning、Error

11. 连接与会话管理

本领域当前提供8个指标,覆盖4个巡检事项。

活跃会话状态

检查活跃会话数和运行线程数的峰值。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

活跃会话峰值(active_session_peak

表示巡检时间窗口内的活跃会话峰值,用于识别最高水位或最严重时刻。

>、≥、<、≤、=、≠、区间

Warning > 1000;Error > 2000

运行线程峰值(threads_running_peak

表示巡检时间窗口内的运行线程峰值,用于识别最高水位或最严重时刻。

>、≥、<、≤、=、≠、区间

Warning > 500;Error > 1000

阻塞SQL分析

检查当前处于锁等待或阻塞状态的SQL。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

被阻塞SQL数(blocked_sql_count

统计被阻塞SQL数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 10

阻塞SQL平均阻塞时长(blocked_sql_avg_block_time

表示巡检时间窗口内的阻塞SQL平均阻塞时长,用于观察整体平均水位。

>、≥、<、≤、=、≠、区间

Warning > 0;Error ≥ 300

未提交事务分析

检查未提交事务和长事务数量。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

未提交事务数(uncommitted_txn_count

统计未提交事务数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning ≥ 5;Error > 9

长事务数(long_txn_count

统计长事务数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 0

中等时长事务数(medium_txn_count

统计中等时长事务数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 5

长时间运行SQL分析

检查当前执行时间过长的SQL。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

长时间运行SQL数(审计优先)(long_running_sql_effective_count

统计长时间运行SQL数(审计优先),用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 10

12. 锁等待与死锁分析

本领域当前提供6个指标,覆盖4个巡检事项。

MDL锁等待分析

检查MDL锁等待会话数量。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

MDL锁会话峰值(mdl_lock_session_peak

表示巡检时间窗口内的MDL锁会话峰值,用于识别最高水位或最严重时刻。

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 50

行锁等待分析

检查当前行锁等待会话数量。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

行锁等待数(row_lock_wait_count

统计行锁等待数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 5;Error > 10

死锁检测

检查时间窗口内发生的数据库死锁。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

死锁次数(deadlock_count

统计死锁次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 5;Error > 10

死锁频率(deadlock_frequency

衡量死锁频率,用于观察该现象在整体数据中的占比或风险程度。

次/小时

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 2

锁等待超时分析

检查时间窗口内发生的锁等待超时。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

锁超时次数(lock_timeout_count

统计锁超时次数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 5;Error > 10

锁等待超时频率(lock_timeout_frequency

衡量锁等待超时频率,用于观察该现象在整体数据中的占比或风险程度。

次/小时

>、≥、<、≤、=、≠、区间

Warning > 1;Error > 2

13. 存储引擎分析

本领域当前提供9个指标,覆盖5个巡检事项。

引擎分布与风险分析

分析表存储引擎分布和MyISAM使用情况。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

MyISAM表数量(myisam_table_count

统计MyISAM表数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 10

MyISAM占比(myisam_ratio

衡量MyISAM占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

事务支持能力分析

检查表存储引擎的事务支持风险。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

MyISAM表数量(myisam_table_count

统计MyISAM表数量,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 10

MyISAM占比(myisam_ratio

衡量MyISAM占比,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 10;Error > 30

系统表引擎检查

检查系统库是否存在非InnoDB表。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

InnoDB系统表数(non_innodb_system_table_count

统计非InnoDB系统表数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 0;Error > 10

InnoDB运行状态分析

检查InnoDB当前活跃事务状态。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

InnoDB活跃事务数(innodb_active_transactions

统计InnoDB活跃事务数,用于衡量该现象的规模或发生频度。

>、≥、<、≤、=、≠、区间

Warning > 200;Error > 500

InnoDB运行健康状态(innodb_is_healthy

表示InnoDB运行健康状态的当前状态,用于判断相关配置或风险是否成立。

无固定单位

=、≠

Warning = false;Error = false

true、false

表碎片分析

分析表碎片率和高碎片表数量。

指标名称(Key)

指标含义

单位

比较方式

推荐规则

可选值

表碎片总大小(table_total_fragment_size_mb

反映表碎片总大小,用于辅助判断“表碎片分析”相关的运行状态与风险。

MB

>、≥、<、≤、=、≠、区间

Warning > 5000;Error > 10000

表碎片占磁盘比例(table_fragment_disk_ratio

衡量表碎片占磁盘比例,用于观察该现象在整体数据中的占比或风险程度。

%

>、≥、<、≤、=、≠、区间

Warning > 30;Error > 50

使用建议

  1. 从需要判断的业务问题出发选择指标,避免在一个巡检事项中添加过多无关指标。

  2. Warning规则用于提前提示趋势或水位风险,Error规则用于标识需要优先处理的高风险条件。

  3. 多指标联合判断时,需先明确规则的命中条件是满足任一条件还是满足全部条件。

  4. 布尔类和枚举类指标需使用指标表中列出的可选值,不支持自定义文本值。

  5. 新建巡检模板建议先在少量代表性实例上运行,确认指标数据可采集、规则可命中、报告结果符合预期后,再扩大适用范围。

说明

指标列表会随产品能力持续更新。新增数据源、指标或数据库引擎时,配置方式与本文保持一致。