告警信息分散
随着业务的扩充与更新,金融企业不断完善监管能力,监控工具各司其职,告警事件也相对分散
随着业务的扩充与更新,金融企业不断完善监管能力,监控工具各司其职,告警事件也相对分散
运维人员面临多个监控工具告警信息,各工具告警级别定义不一致,无法快速判断告警紧急程度
发生告警风暴时,无法从主机维度、应用维度进行事件信息自动化整合压缩
存在“工具墙”,不利于运维人员跨工具进行告警关联情况分析、依赖告警情况分析
缺乏监控工作有效衡量指标,无法准确衡量IT服务团队的故障响应效率,影响运营改进决策
海量事件汇总
一体化运维首先汇总不同层级、专业和类型的事件,包括底层动环、传输、网络、主机,中间层操作系统、中间件、数据库,以及上层应用告警
平台集中收集并标准化处理分散的事件数据,提供统一运维窗口,便于IT管理人员及时响应和处理问题
重新梳理事件重要程度
系统支持根据时间、架构和指标等维度设置事件重定级策略,对原始事件级别进行二次校准
系统标识事件当前紧急程度,并呈现故障时段内事件的变化态势,帮助IT团队识别重要故障并安排处理优先级
智能事件归集
IT环境中各组件相互影响,底层组件故障可能会产生告警风暴,导致重要告警信息被淹没,运维团队难以快速识别故障域
一体化运维平台从告警所属的主机、集群、应用、架构等维度进行归集,将大量原始告警归集成少量“故障场景”,并提供时间和空间两种维度的故障分析视图,降低告警噪音,提升故障域的识别效率
可视化故障分析
一体化运维平台从横向和纵向呈现告警对象的关系拓扑:横向展示应用访问关系,纵向提供以应用为起点逐层下钻的故障分析视图,如应用、集群、虚拟机和物理拓扑,辅助运维团队定位故障域并分析可能的根因
监控管理运营化
一体化运维平台具备报表统计功能,为运维人员提供可视化、有据可依的事件分析报告。提供可视化的规则设置,通过规则看板了解规则有效性
根据企业管理需求建立监控体系模型,用于检查监控覆盖范围、规则有效性和尚未纳入监控的对象