Skip to content

告警中心

适用版本:DASS5(当前版本)
前提:已登录 DASSConsole;DASS5 设备在线

【说明】:集中查看设备的运行告警,区分「当前告警 / 未屏蔽规则 / 已屏蔽规则」三类,按规则屏蔽不需要关注的告警。屏蔽为设备级:每台设备各自维护自己的屏蔽状态。

【入口】:维护 → 告警信息(页面标题为「告警中心」)

页面由四部分组成:左侧/顶部页签(当前告警 / 未屏蔽规则 / 已屏蔽规则)、筛选区(搜索 + 类别 + 级别 + 【刷新】)、告警列表(点击行内【详情】查看详情与触发历史)。

功能概述

告警中心把设备侧的告警集中呈现出来,供现场工程师判断「哪里不正常、要不要马上处理、处理完没有」。

三条必须记住的口径:

  1. 当前告警 = 实时状态的镜像。告警不是一条"要人去关掉"的记录:判定条件满足就出现,条件恢复就自动消失,不需要任何确认或处理动作。
  2. 屏蔽按规则生效,不是按单条告警。屏蔽「磁盘使用率过高」这条规则后,该规则以后产生的全部告警都不再出现在列表与通知中,直到取消屏蔽。
  3. 告警描述给的是实测值,不是模板话术。描述里带实际使用率占用最大的前 3 项明细(磁盘给目录 / 文件,CPU 与内存给进程名 + PID),可直接据此定位。

核心价值:现场不用逐台设备翻日志,一屏就能看清"当前有哪些异常、最严重的是哪几条、是哪个进程 / 哪个目录造成的"。

使用场景

  • 日常巡检:打开【当前告警】看有没有未恢复的异常,先处理严重级;
  • 故障定位:按告警描述里的 Top3 明细(进程 / 目录)直接定位消耗源;
  • 降噪:把离线内网、维护窗口等预期内的告警按规则屏蔽,避免长期提示;
  • 核对口径:在【未屏蔽规则】页确认该规则的触发条件(阈值与持续时长写在规则描述里)与处理建议;
  • 交接与复盘:在告警【详情 → 触发历史】中查看同一规则的历次触发记录。

前置条件

  • 已登录 DASSConsole,并已选中要查看的目标设备(多设备控制台需先切换到该设备);
  • 设备在线:告警由设备侧监控模块实时判定;设备离线时,顶栏铃铛下拉会提示「设备离线,显示最近同步结果」;
  • 无需额外授权:告警不占用采集点 / 服务数授权余量;
  • 规则不可修改:规则清单由设备侧提供(当前为设备已实现的 21 条出厂规则),页面只读,不支持修改阈值与持续时长。

操作步骤

查看当前告警

步骤1. 进入「维护 → 告警信息」,页面默认停在**【当前告警】**页签。

【当前告警】页签为实例视图——只列当前正在触发、且未被屏蔽的告警;表头为「告警 ID / 类别 / 级别 / 对象 / 名称 / 时间 / 操作」:

告警中心当前告警实例列表

页签口径:

页签显示什么
当前告警告警实例:正在触发、且未被屏蔽的告警(即"此刻确实处于异常状态")
未屏蔽规则规则视图:未被屏蔽的规则清单(含当前没在报的规则),列含阈值/持续时长的文字描述与「当前状态」
已屏蔽规则规则视图:已被屏蔽的规则;在此可【取消屏蔽】

三个页签的列表均支持分页:实例视图由设备侧分页(默认每页 20 条);两个规则视图由前端分页(默认每页 10 条,规则一次取全、当前 22 条)。

步骤2. 用筛选区精确查询:

  • 搜索:输入告警 ID、对象、名称中的关键词,回车即查;
  • 类别:全部类别 / 系统资源 SR / 系统服务 SS / 授权许可 LA;
  • 级别:严重 / 警告 / 信息;
  • 【刷新】重新拉取设备侧告警并刷新列表;筛选条件会保留,需要清空时把各筛选项恢复为默认值(全部 / 空)。

看懂列表

说明
告警 ID规则编码(如 SR008);同一规则多次触发时,编码右侧显示 ×N(聚合触发次数),下方小字为该条记录的时间戳。点击告警 ID 直接打开详情
类别SR 系统资源 / SS 系统服务 / LA 授权许可
级别严重 / 警告 / 信息(标签颜色依次为红 / 橙 / 蓝)
对象告警对象,如「系统 CPU」「系统磁盘」「数据采集服务」
名称规则名称,如「CPU 使用率过高」
时间触发时间;存在多次触发时,下方额外显示「最近」一次触发时间(仅实例视图
当前状态规则视图专有在报(该规则此刻正在触发)/ 正常;用于一眼看出"这条没被屏蔽的规则现在有没有事"
操作实例视图:【详情】与【屏蔽】;规则视图:【屏蔽】(已屏蔽规则列表中显示【取消屏蔽】)

【注意】列表没有状态列。判断一条告警"还在不在",看它还出不出现在【当前告警】列表即可。

查看告警详情与触发历史

步骤1. 点击行内【详情】或直接点击告警 ID,右侧打开「告警详情」抽屉。

步骤2. 在**【基本信息】**页签查看:告警 ID、类别、级别、对象、名称、触发时间、触发次数(多次触发时附「最近」触发时间)、描述(实测值 + Top3 明细)、处理建议

步骤3. 切到**【触发历史】页签:以时间线列出同一规则**的历次触发记录与当时的描述(最多 50 条),用于判断"是反复抖动,还是持续异常"。

步骤4. 看完点【关闭抽屉】返回列表。

屏蔽 / 取消屏蔽告警

屏蔽是规则级操作:屏蔽的是这条规则,不是当前这一条记录;屏蔽状态由设备侧按规则保存,之后该规则产生的告警一律不再提醒。规则当前没有告警时也可以预先屏蔽(界面入口以实际页面为准)。

步骤1. 在【当前告警】或【未屏蔽规则】列表中找到目标行,点击操作列【屏蔽】。

步骤2. 在弹出的二次确认框中确认:

  • 标题:提示
  • 正文:确定要屏蔽此告警吗?屏蔽后不再出现在告警列表与通知中。

步骤3. 点击【确定】后,该告警不再计入顶栏铃铛角标、也不再产生顶部通知条,并转入**【已屏蔽规则】**页签(在那里可【取消屏蔽】)。
在【当前告警】页签中不再出现;该规则同时从【未屏蔽规则】清单移入【已屏蔽规则】清单(操作列由【屏蔽】变为【取消屏蔽】),便于核对"哪些被我屏蔽过"。

步骤4. 需要恢复提示时,进入**【已屏蔽规则】**页签,点击该行【取消屏蔽】,在确认框中点【确定】即可。

【注意】屏蔽 ≠ 处理。屏蔽只是不再提示,系统的实际状态没有任何改变:磁盘该满还是满、服务停了还是停着。

查看规则清单

步骤1. 点击页签**【未屏蔽规则】(或【已屏蔽规则】)——原「告警规则」独立页已下线**,规则内容并入此处。

【未屏蔽规则】页签是规则清单视图:按规则逐条列出(不只看当前在报的),表头为「规则编码 / 名称 / 级别 / 监控对象 / 触发条件 / 当前状态 / 操作」,页面按规则条数分页(默认每页 10 条):

告警中心未屏蔽规则清单页签

【已屏蔽规则】页签同样是规则清单视图,只是只列已被屏蔽的规则,操作列为【取消屏蔽】:

告警中心已屏蔽规则清单页签

步骤2. 列表按规则逐条展示:规则编码、名称、级别、监控对象、触发条件(规则描述,含阈值与持续时长)、当前状态在报 / 正常)。可按类别(系统资源 / 系统服务 / 授权许可)与级别筛选。

步骤3. 规则清单由设备侧提供(当前为设备已实现的 21 条出厂规则);页面只读,不支持修改阈值 / 持续时长 / 采样间隔。

告警规则一览(22 条)

下表为设备侧登记的全部 22 条规则(控制台规则视图直接取其数据)。
其中 21 条由设备侧引擎判定SS003(云平台连接失败)属子服务业务——由云平台连接服务自行探测并上报给设备侧,设备侧不判定。「触发条件」列写的是判定口径(阈值 + 需连续满足的时长),描述中还会附上实测值与 Top3 明细

规则编码级别告警对象名称触发条件处理建议
SR001信息系统 CPUCPU 使用率高CPU 使用率超过 70%,且持续 2 分钟检查进程状态,优化程序性能;可考虑降低非关键进程优先级
SR002警告系统 CPUCPU 使用率过高CPU 使用率超过 85%,且持续 5 分钟立即检查异常进程,必要时重启;终止占用 CPU 最高的非关键进程
SR003严重系统 CPUCPU 使用率极高CPU 使用率超过 95%,且持续 1 分钟立即终止异常进程或重启系统;执行紧急清理
SR004信息系统内存内存使用率高内存使用率超过 60%清理不必要的程序与缓存;执行内存释放
SR005警告系统内存内存使用率过高内存使用率超过 80%重启相关程序,检查内存泄漏;终止占用内存最高的非关键进程
SR006严重系统内存内存使用率极高内存使用率超过 90%立即重启相关程序或系统;终止内存泄漏进程
SR007信息系统磁盘磁盘使用率高任一挂载点使用率超过 75%清理临时文件与旧日志
SR008警告系统磁盘磁盘使用率过高任一挂载点使用率超过 85%立即清理磁盘空间,转移数据
SR009严重系统磁盘磁盘空间不足任一挂载点使用率超过 95%立即释放磁盘空间或扩容
SR010信息单个服务服务 CPU 占用高单个服务 CPU 占用超过 50%,且持续 5 分钟检查服务日志,优化业务逻辑
SR011警告单个服务服务 CPU 占用过高单个服务 CPU 占用超过 80%,且持续 3 分钟立即检查服务状态,重启服务
SR012严重单个服务服务 CPU 占用极高单个服务 CPU 占用超过 90%,且持续 1 分钟立即终止或重启服务
SR013信息单个服务服务内存占用高单个服务内存占用超过系统总内存的 10%检查内存使用情况,优化缓存策略
SR014警告单个服务服务内存占用过高单个服务内存占用超过系统总内存的 20%立即检查内存泄漏,重启服务
SR015严重单个服务服务内存占用极高单个服务内存占用超过系统总内存的 30%立即终止或重启服务
SS001严重数据采集服务数据采集服务停止数据采集服务异常停止立即重启服务,检查日志与配置
SS002严重数据库服务数据库服务停止数据库服务异常停止立即重启数据库服务,检查状态
SS003严重edge_mqtt_hub云平台连接失败边缘设备与云平台 MQTT 连接中断超过 30 秒(由子服务上报,设备层不判定)检查现场网络与云平台配置,确认云平台服务状态;必要时重启云平台连接服务
SS004信息网络连接互联网连接失败系统无法连接到互联网检查网络设备状态,验证网络配置,测试 DNS 解析
LA001信息数据库授权数据库授权即将过期数据库授权剩余时间少于 15 天联系供应商续费,准备授权更新
LA002严重数据库授权数据库授权已过期数据库使用授权已过期立即联系供应商更新授权
LA003严重数据库连接数据库未连接无法建立数据库连接检查数据库服务、网络与授权状态

【说明】当前已接入实时判定、会实际产生告警的是系统资源类SR001SR009SR010SR015(单个服务 CPU / 内存占用))、系统服务类SS001SS002SS004)与授权许可类LA001LA003);SS003(云平台连接失败)由子服务上报(设备侧只登记规则定义、不做判定)。

正因如此,SS003同时出现在两个视图里:既作为告警实例出现在【当前告警】,也会在**【未屏蔽规则】**清单中带着「当前状态」出现。下图取自同一台设备(IA-4200C-linux)——【当前告警】实例列表中上报上来的 SS003(对象 edge_mqtt_hub):

SS003 云平台连接失败出现在当前告警列表

切到【未屏蔽规则】页签,同一条 SS003 的「当前状态」为 在报——实例在报、规则也在报,两处口径互相印证:

SS003 在未屏蔽规则视图中的当前状态为在报

看懂通知条与顶栏铃铛

提示方式行为
顶栏铃铛铃铛右上角红色角标 = 当前触发且未被屏蔽的告警条数(超过 99 显示 99+)。点击铃铛展开「未处理告警」速览:显示未处理条数、条目(名称、级别、对象、时间)、【刷新】按钮与【进入告警中心 →】。点任意条目进入告警中心
通知浮层(右上角)页面右上角浮动提醒,最多同时显示 3 条,按级别排序(严重 → 警告 → 信息)。每条右侧有【去处理】(进入告警中心)与 ;条数多于 3 条时,折叠为「还有 N 条待处理告警,点击进入告警中心 →」。
⚠️ 它是浮层不占页面位置、不会把页面内容(如【创建服务】按钮)挤出屏幕;条数多时在浮层内部滚动(高度上限约为屏幕的四成),无告警时完全不显示
右下角弹窗新告警到达时在右下角弹出实时提醒(最多 3 条,约 9 秒后自动收起),提供【详情】(进入告警中心)与【忽略】

「不占页面位置」的实际效果:下图为采集服务页顶栏处于告警状态时的界面——通知浮层悬在页面右上角,页面自己的【创建服务】按钮在浮层之外、完整可见,既没有被遮挡,也没有被挤出屏幕:

通知浮层不遮挡创建服务按钮

⚠️ 注意忽略 ≠ 确认。点通知条上的 或弹窗里的【忽略】,只是让这条提醒不再显示(✕ 只对本次登录会话有效,刷新页面后仍可能出现),告警本身没有任何变化。告警是否消失,只取决于设备侧判定条件是否恢复。

判断告警是否已恢复

步骤1. 按告警的处理建议处置(清理磁盘、重启服务、结束异常进程等)。

步骤2. 回到【当前告警】观察:该告警自动从列表消失即表示条件已恢复。

步骤3. 若告警仍在,说明条件仍未满足,或恢复去抖时间未到——「持续 N 分钟」的规则在恢复方向同样生效(见下节说明),需等待与触发时长相同时长的稳定期。

【说明】何时需要点"确认"?不需要。告警中心不要求任何确认或处理动作来"关闭"告警;能消失的唯一原因是实测值已回到阈值以内并稳定足够时长

参数说明

取值 / 说明
类别SR 系统资源 / SS 系统服务 / LA 授权许可
级别严重(红)/ 警告(橙)/ 信息(蓝),对应级别取值 0 / 1 / 2
告警 ID规则编码,如 SR001;同一规则多条记录时,列表以 ×N 聚合显示
触发次数同一规则在告警列表中的记录条数(防风暴聚合,不重复刷屏)
描述实测值 + Top3 明细:磁盘给出实际使用率、总 / 已用 / 可用容量与占用最大的前 3 个目录或文件;CPU / 内存给出实际使用率与占用最高的前 3 个进程及 PID;数据库未连接给出具体失败原因
处理建议该规则的建议处置动作(出厂配置)
阈值 / 持续时长 / 采样间隔出厂配置,【未屏蔽规则】页只读展示;控制台不提供修改入口
屏蔽按规则(规则编码)生效,保存在设备侧;规则当前无告警时也可预先屏蔽

「持续 N 分钟」的真实口径(以设备侧实际判定为准):

指标触发(需连续满足)恢复(需连续满足)
CPU 使用率70% 持续 2 分钟(信息)/ 85% 持续 5 分钟(警告)/ 95% 持续 1 分钟(严重)与触发同样的时长
内存使用率60%(信息)/ 80%(警告)/ 90%(严重)与触发同样的时长
磁盘使用率75%(信息)/ 85%(警告)/ 95%(严重)与触发同样的时长

补充口径:

  • 去抖:触发与恢复都要连续满足对应时长,避免"闪报闪消"——瞬时抖动不会产生告警,刚恢复也不会立刻消失;
  • 磁盘监控所有挂载点:取使用率最高的分区作为判定依据;若有多个挂载点越过最低阈值(75%),描述中会追加提示「另有 N 个挂载点已越过 75%」;
  • CPU 采样周期按机型分流:IA-22 / IA-24 机型为 5 分钟一次,其他机型为 30 秒一次;同一组内只保留最高级别的告警(例如同时越过 70% 与 85%,只报警告级那条)。

注意事项

允许:查看当前告警 / 未屏蔽规则 / 已屏蔽规则、搜索与筛选、查看详情与触发历史、按规则屏蔽与取消屏蔽、在【未屏蔽规则】视图查看规则清单(只读)。

禁止 / 需谨慎

  • ⚠️ 警告 屏蔽是规则级,屏蔽一条等于屏蔽该规则的全部告警。对「数据采集服务停止」「磁盘空间不足」这类严重规则屏蔽前,务必确认现场确实不再需要该提示;
  • ⚠️ 警告 屏蔽不改变系统状态,只取消提示;靠屏蔽"消掉"告警会掩盖真实故障;
  • ⚠️ 注意 通知条的 与弹窗的【忽略】只关提示、不改告警状态,忽略不等于确认
  • ⚠️ 注意 列表没有状态列,判断告警是否还存在,以它是否仍出现在【当前告警】为准;
  • ⚠️ 注意 告警阈值与持续时长为出厂配置,页面只读,无法在现场自行调整;
  • ⚠️ 注意 离线内网现场会出现「互联网连接失败」(信息级,规则 SS004)的常态提示,属预期,不是故障。

示例

示例一:看懂一条磁盘告警

【当前告警】中出现一条 SR008,级别「警告」,对象「系统磁盘」,名称「磁盘使用率过高」,描述为:

磁盘 / 使用率 92.9%,已超过阈值 85%(总 28.3 GiB / 已用 24.9 GiB / 可用 1.9 GiB):/opt (7.0 GiB);/home (5.9 GiB);/var (1.4 GiB)

读法:

  1. 判定挂载点是 /实测使用率 92.9%,超过该级别阈值 85%
  2. 容量:总 28.3 GiB、已用 24.9 GiB、可用 1.9 GiB —— 空间已经不多;
  3. 占用最大的前三项依次是 /opt(7.0 GiB)、/home(5.9 GiB)、/var(1.4 GiB);
  4. 处置:优先清理 /opt/home 下的旧日志 / 历史数据,可参考「维护 → 存储管理」;
  5. 清理后无需任何确认动作,使用率降到 85% 以下并稳定同样时长后,该告警自动消失。

示例二:看懂一条 CPU 告警

CPU 使用率 100.0%,已超过阈值 95%:yes(PID 24008) 93.2%;…

读法:CPU 实测 100.0%,超过严重级阈值 95%;占用最高的是进程 yes(PID 24008),占用 93.2%;分号后依次是第 2、3 个进程。可直接据此结束或重启该进程,然后观察告警是否自动消失。

示例三:屏蔽一条预期内的告警

现场为离线内网,无外网出口,规则 SS004「互联网连接失败」(信息级)会长期存在:

  1. 「维护 → 告警信息」→【当前告警】找到 SS004 这一行;
  2. 点击【屏蔽】→ 确认框点【确定】;
  3. 该规则转入【已屏蔽规则】页签,不再出现在当前告警、不再计入铃铛角标、不再弹通知条;
  4. 需要恢复提示时,进入【已屏蔽规则】页签对该规则点【取消屏蔽】。

常见问题及解决方法

现象原因处置
刚处理的告警还在列表里实测值尚未回到阈值以内,或恢复去抖时长未到等待与"持续 N 分钟"相同的时长;用【刷新】复查
告警自己消失了,没人点过"处理"属预期:当前告警是实时状态镜像,条件恢复即自动消失无需处理;如需追溯,看【详情 → 触发历史】
列表里找不到某条规则该规则当前未触发(不在当前告警),或已被屏蔽切到【未屏蔽规则】或【已屏蔽规则】页签核对;口径见本节「页签口径」
屏蔽后铃铛角标不变角标只统计当前触发且未被屏蔽的告警;若该规则本就没有其他活跃告警,角标数字自然不变点铃铛下拉核对「未处理告警」条目,逐条判断
通知条点 ✕ 后刷新又出现✕ 只对本次会话隐藏,告警状态未变若确认无需提示,应按规则屏蔽,而不是关通知条
长期提示「互联网连接失败」现场离线内网,本就没有外网出口属预期(信息级);不关注时按规则屏蔽 SS004
没收到某条告警该规则已被屏蔽;或设备离线,列表显示的是最近一次同步结果到【已屏蔽规则】页签取消屏蔽;确认设备在线
磁盘告警的挂载点不是根目录磁盘监控所有挂载点,取使用率最高的分区以描述中给出的挂载点为准,清理该挂载点上的大目录
同一规则出现多条、带 ×N防风暴聚合:同一规则的多条记录聚合显示展开【详情 → 触发历史】查看历次触发时间与描述
告警描述里有 (暂未获取到明细)该次采样未取到 Top3 明细(如遍历超时)属正常兜底;下次采样会重新统计,可稍后【刷新】复核

相关命令/接口

本章功能全部在控制台界面完成,无命令行操作。

告警由设备侧监控模块按出厂规则判定,控制台侧提供告警列表、屏蔽、未处理统计与规则查询等接口;这些接口目前未收录进《DASS5 接口与二次开发手册》,需要接口对接时请联系技术支持确认。

安全声明

⚠️ 警告 不要长期屏蔽严重级规则(如「数据采集服务停止」「数据库服务停止」「磁盘空间不足」):屏蔽后设备侧不会再有任何提示,故障可能一直到业务中断才被发现。

⚠️ 注意 屏蔽仅取消提示,不改变设备实际状态;处置告警请以【处理建议】与现场实际为准,不要以"列表变干净了"作为问题解决的依据。

⚠️ 注意 告警描述中可能包含本机目录路径、进程名与 PID 信息,对外提供截图或日志前请先确认无敏感信息。