当您需要监控各云产品资源的使用情况时,可以创建报警规则。如果资源的监控指标达到报警条件,云监控自动发送报警通知,帮助您及时得知异常监控数据,并快速处理。
操作步骤
登录云监控控制台。
-
在左侧导航栏,选择。
-
在报警规则页面,单击创建报警规则。
-
在创建报警规则面板,设置报警规则相关参数。
示例:为云服务器ECS全部实例的CPU使用率设置报警规则,当CPU使用率的最大阈值大于等于85%,且连续3个周期达到报警条件时,给报警联系人组内的所有报警联系人发送报警通知(通知方式为:电话+短信+邮件+WebHook)。
-
产品选择云服务器ECS,资源范围选择全部资源。
-
设置规则条件。
-
单击添加规则,在下滑菜单中选择合适的指标类型。
-
在添加规则描述面板,输入规则名称,指标类型选择简单指标,监控指标选择,在紧急区域,触发条件选择连续3个周期(1周期=1分钟),设置最大值大于等于85%。
-
单击确定。
-
ECS CPU监控指标说明
设置监控指标时,监控指标下拉列表中会同时出现(ECS)CPU使用率和(Agent)cpu.total两个CPU相关指标,两者的采集来源和适用场景不同,请根据实际需求选择:
属性
(ECS)CPU使用率
(Agent)cpu.total
指标名
CPUUtilizationcpu_total监控类型
基础监控
操作系统监控(Agent)
采集来源
宿主机直接采集
云监控插件采集
是否需要插件
否
是
采集周期
60/300/3600秒
15/60/900秒
适用场景
快速配置通用CPU告警
精准CPU监控和异常排查
(ECS)CPU使用率由宿主机直接采集,无需安装插件,适合快速配置通用CPU告警。(Agent)cpu.total由云监控插件采集,需在ECS实例上安装云监控插件,适合需要精准CPU使用率数据或排查CPU异常的场景。
表 1. 报警规则相关参数说明
参数
说明
产品
云监控可管理的云产品名称。例如:云数据库RDS版。
资源范围
报警规则作用的资源范围。取值:
-
全部资源:报警规则作用于指定云产品的全部资源上,对于新加入的资源生效。
-
应用分组:报警规则作用于指定云产品的指定应用分组内的全部资源上,对于新加入的资源生效。
-
实例:报警规则作用于指定云产品的指定资源上。
同一实例可能同时被多个不同资源范围的报警规则覆盖。例如,一个实例既在全部资源范围内,又在某个应用分组中。每个报警规则独立评估和触发,互不影响,不会因规则重叠产生优先级覆盖或冲突。
规则描述
报警规则的主体。当监控数据满足报警条件时,触发报警规则。规则描述的设置方法如下:
-
单击添加规则,在下滑菜单中选择合适的指标类型。
-
在添加规则描述面板,先输入规则名称,再设置规则条件。
-
简单指标:先选择监控指标,再为其设置阈值和报警级别。
报警级别采用升级(Escalations)模型。阈值达到某个级别时,系统仅触发该级别报警,不会连带触发其他级别。例如:阈值直接达到紧急时,仅触发紧急报警,不会同时触发普通和警告报警。
-
组合指标:先选择报警级别,再配置多指标报警描述为两个或两个以上的监控指标设置报警条件。
说明如果设置了多个指标报警规则,则目标资源必须在每个指标上均有数据,只有在满足条件后才能够正常触发报警。例如:在多指标报警规则中,如果包含公网的监控指标,而ECS主机资源并未配置公网IP,则将无法正常触发报警。
-
表达式:先选择报警级别,再配置报警表达式。
-
智能阈值:关于智能阈值的更多信息,请参见概览和创建智能阈值报警规则。
-
报警级别决定了报警发生时的通知方式。仅紧急级别支持电话通知。警告和普通级别不支持电话通知。不同报警级别支持的通知方式如下:
报警级别
通知方式
紧急(紧急)
电话+短信+邮件+WebHook
警告(警告)
短信+邮件+WebHook
普通(普通)
邮件+WebHook
说明关于如何设置复杂的表达式报警条件,请参见报警规则表达式说明。
通道沉默周期
报警发生后未恢复正常,间隔多久重复发送一次报警通知。取值:5分钟、15分钟、30分钟、60分钟、3小时、6小时、12小时和24小时。
某监控指标达到报警阈值时发送报警,如果监控指标在通道沉默周期内持续超过报警阈值,在通道沉默周期内不会重复发送报警通知;如果监控指标在通道沉默周期后仍未恢复正常,则云监控再次发送报警通知。
例如:当通道沉默周期选择12小时,如果报警未恢复正常,则间隔12小时后,云监控会再次发送报警通知。
生效时间
报警规则的生效时间。报警规则仅在生效期内才会发送报警通知。
说明当报警规则不在生效期时,不会发送报警通知,但是报警历史记录仍然会显示在报警历史列表中。
报警联系人组
发送报警的联系人组。
应用分组的报警通知会发送给该报警联系人组中的报警联系人。报警联系人组是一组报警联系人,可以包含一个或多个报警联系人。
关于如何创建报警联系人和报警联系人组,请参见创建报警联系人或报警联系人组。
标签
报警规则的标签。包括标签名称和标签值。
说明您最多可设置6组标签。
报警回调
公网可访问的URL,用于接收云监控通过POST请求推送的报警信息。目前仅支持HTTP协议。关于如何设置报警回调,请参见使用阈值报警回调。
当您需要测试报警回调地址的连通性时,可以执行以下操作。
-
单击回调地址正后方的测试。
在WebHook测试面板,您可以通过Webhook返回的状态码和测试结果详情对报警回调地址的连通性进行判断和排查。
说明您还可以设置Webhook的测试回调模板类型:和语言:,再次单击测试,获取对应的测试结果详情。
-
单击关闭。
说明单击高级设置,可设置该参数。
报警规则触发后仅支持发送通知(短信、邮件、Webhook、钉钉机器人等)和联动其他云服务(弹性伸缩、函数计算、日志服务等),不支持自动执行隔绝或阻断动作(如自动修改 OSS 权限、自动下线 ECS 实例等)。如需实现自动化阻断,可通过 Webhook 回调结合运维编排服务 OOS 或函数计算自定义处理逻辑。
弹性伸缩
如果您打开弹性伸缩开关,当报警发生时,会触发相应的伸缩规则。您需要设置弹性伸缩的地域、弹性伸缩组和弹性伸缩规则。
说明单击高级设置,可设置该参数。
日志服务
如果您打开日志服务开关,当报警发生时,会将报警信息发送至日志服务的日志库。您需要设置日志服务的地域、ProjectName/和Logstore。
关于如何创建Project和LogStore,请参见使用LoongCollector采集并分析ECS文本日志。
说明单击高级设置,可设置该参数。
轻量消息队列(原 MNS)— topic
如果您打开轻量消息队列(原 MNS)— topic开关,当报警发生时,会将报警信息发送至消息服务的主题。您需要设置消息服务的地域和主题。
关于如何创建主题,请参见创建主题。
说明单击高级设置,可设置该参数。
函数计算
如果您打开函数计算开关,当报警发生时,会将报警通知发送至函数计算进行格式处理。您需要设置函数计算的地域、服务和函数。
关于如何创建服务和函数,请参见快速创建函数。
说明单击高级设置,可设置该参数。
无数据报警处理方法
无监控数据时报警的处理方式。取值:
-
不做任何处理(默认值)
-
发送无数据报警
-
视为正常
部分云产品指标(例如云消息队列 RocketMQ 版的限流相关指标)在指标值为 0 时不上报监控数据,此时云监控显示为无数据而非正常。指标有数据但未达到报警阈值时,报警规则状态为正常;指标值为 0 导致数据未上报时,报警规则状态为无数据。您可以在实例监控报警页面查看实例维度的实际数据,确认指标是否确实未上报数据。
当报警规则触发无数据报警时,云监控按照规则中配置的最高报警级别发送通知。例如:规则配置了紧急、警告、普通三个级别,无数据报警按紧急级别通知;规则仅配置了普通级别,则按普通级别通知。
说明单击高级设置,可设置该参数。
删除报警资源后,关联该资源的报警规则会被自动清除。例如:报警规则的资源范围指定为某个 ECS 实例,该实例被删除后,关联该实例的报警规则会立即清除,不再产生新的报警历史记录。
如需管理关联了已过期资源的报警规则,请参见关联了已过期资源的报警规则。
-
-
单击确认。