资料来源:第五届农村中小金融机构科技创新优秀案例评选
一.项目计划

1.项目背景
随着黑龙江省农村信用社近年来需求的快速迭代和互联网金融等业务的快速发展,业务对信息技术的依赖逐年加深,信息技术发展对业务模式的影响日益明显。与此同时,有效控制信息技术风险成为工作重点。监管部门一直高度重视信息科技风险管理,已发布的多份指引文件均有提及,对信息科技风险管理提出了更高的要求。
目前,省联社数据中心已有数十个业务系统在运行。由于建设年限不同,这些业务系统的软硬件技术、平台和架构也不同。同时,随着业务的发展和国产化的推进,大量后续国产技术融入到业务系统中。为了加强数据中心的技术风险防范能力、新技术应用和运维管理能力,需要建设面向新趋势的新一代基础监控平台,对原有的各类it资源和国内资源进行统一监控和管理,降低运维管理风险,提高运维管理效率。
2.项目范围
建立覆盖网络、服务器、操作系统、数据库、中间件、存储等各种系统的基础资源监控平台。,并通过SSH、SNMP、Trap、Syslog、IPMI、Ping等监控基本资源。监控平台涵盖以下资源:
商务系统
本地服务器
网络设备
本地存储设备
远程服务器
场外存储设备
资料库
中间件
县级网络设备实现设备在线监测和主备用线路状态监测;
加密、加密、数字签名等安全设备;
关键应用系统模拟交易监控;
3.项目目标
根据项目计划,今年将实施一个基础监控系统建设项目,通过该项目对应用系统、服务器、数据库、中间件、存储等IT资源进行统一管理、采集和监控。构建一个易于管理、易于扩展、适应国内新技术、报警灵活、显示多样化的基础监控平台。通过模拟的方式开发应用可用性监控工具,可以通过基础监控系统的建设更好地支持IT运营和建设。通过本项目建设,减轻工程师运维压力和运维管理风险,提高运维监控效率,提升科技运维管理风险防范能力。
第二,创新
1.高可用性架构
基础监控平台采用分布式集群架构,分布式数据库支持复制机制不存在单点问题。根据集群的负载,节点可以动态添加到集群中,实现横向扩展。同时,为了满足数据分析和监管的要求,可以进行完整或增量数据备份,备份数据可以跨集群恢复,即使集群名称和节点数量不同。采用动态DNS,在数据库服务不可用时,自动切换到其他可用节点,服务无感知。
2.自动操作和维护闭环
监控平台收集基础设施可用性、容量、性能等的监控数据。,并根据设置的阈值信息进行阈值判断。当阈值不匹配时,它会生成报警消息,可以通过声光、短信、邮件、微信、钉钉等方式通知。同时可以根据匹配的自动动作规则执行远程命令进行自动恢复操作,如启动应用程序、自动扩容等。实现故障自愈。实现了特定场景下的监控、报警和自愈能力,形成了故障分析和反馈机制,构建了运维管理闭环系统。
3.批量部署和升级
基本监控平台支持一键式部署服务器的所有设备、所有集群和所有组件。统一代理程序支持自动批量部署和升级。代理程序启动后,可以自动注册和管理,无需人工干预。
4.统一机构
监控平台通过统一的代理程序实现对各类基础设施的监控采集、日志采集和自动调度。
5.多采集模式支持
基础监控平台的采集技术包括代理和无代理两种方式。该平台使用多种采集方法来监控主机、应用程序和数据库。这些技术包括:
基于代理的获取
基于标准协议的采集:WMI、HTTP/HTTPS、Ping、SNMP、SSH、TELNET、JDBC、ODBC、IPMI、JMX、SNMPTrap、Syslog等。
基于文件的收集:日志文件、JSON文件、CSV文件等。
基于脚本或可执行程序的集合:python、shell、perl、java、C、go等。
6.国内资源监测
随着新型信息技术应用产业的逐步推进,对传统的基础监控平台带来了各种新的运维挑战,如监控对象的类型、品牌、型号、协议以及大量的监控对象。为了应对国产软硬件带来的运维挑战,平台实现了全面覆盖国内各类资源监控的目标,并从产品底层进行了深度适配,通过代理程序、无代理程序等多种方式支持监控。该代理可以在任何国内操作系统上编译和安装。支持的标准收集协议包括WMI、HTTP/HTTPS、Ping、SNMP、SSH、TELNET、JDBC、ODBC、IPMI、JMX、SNMPTrap、Syslog等。支持的文件集合包括日志文件、JSON文件、CSV文件等。支持的脚本或可执行程序包括python、shell、perl、java等。多种采集方式和协议的支持,保证了平台能够全方位监控国内资源的可用性、性能、容量、日志等维度。平台丰富完善的对外接口保证了平台良好的扩展性,能够快速适应国内各种新资源,实现现有资源全覆盖,快速适配新资源,不断提升平台的能力和价值。
neokylin操作系统、东方通中间件、大梦数据库、华为和红山存储设备、启明星辰、天融信和深新信安全设备等支持资源以及其他国产软硬件资源将配合系统在行业内的推广进行适配和监控。
7.事件是动态的。
由于监控产生的告警事件内容往往不够丰富,如缺少业务系统、联系人、联系方式等信息,可读性差,基础监控平台通过结合配置管理组件实现告警信息的动态丰富。当报警数据显示在事件控制台中时,基本监控平台仅将API级报警数据与配置数据相关联,并且来自配置管理组件的配置数据不会到达基本监控平台。同时,不需要配置事件丰富规则,既满足了事件丰富的需求又不需要维护丰富的规则,减轻了运维人员的工作量。
8.实现模拟、拨号、测试和监控。
业务模拟拨测原理,通过模拟原理监测业务的可用性,是目前运维监控系统中最主动的业务监测方式,贴近用户体验。
模拟拨号监控开发后,监控功能明显,服务不可用可以触发报警,并以短信方式通知相应的应用负责人,有效避免了故障的扩大。对于可用性监控中包含的应用系统,可以通过系统获得以下帮助:
在复杂的告警情况下,可以通过是否收到应用系统服务可用性拨测监控提示来判断事态的严重性和业务是否受到影响,从而提高响应速度,避免事态扩大;
合理计算系统可用性,方便各应用负责人统计真实的应用可用性信息;
弥补非事务时间段网络流量镜像事务监控的失控漏洞,提前发现非事务时间段的服务可用性问题。
三。技术实现的特征
1.功能建筑

2.技术架构
3.特征
统一管理
统一监控管理、统一报警管理、统一通知管理、统一视图管理、统一报表管理、统一大屏管理、统一配置管理、统一存储管理。
监控对象全覆盖
实现操作系统、数据库、中间件、虚拟化、网络设备、安全设备、负载均衡设备、存储设备、业务系统等对象的全覆盖。
丰富的界面
所有操作都是接口,允许您以编程方式检索和修改系统的配置,并提供对历史数据的访问。界面被广泛用于创建新的个性化应用程序,将系统与第三方软件集成,以及批量自动执行常规任务。
支持多种采集方法
代理模式、基于标准协议的无代理模式和文件模式。同时支持插件和脚本,扩展采集方式和监控指标。
自动化批量部署
支持平台一键部署、网络自动发现、代理批量部署升级、代理自动注册、设备自动管理。
分布式体系结构
系统的分布式架构便于横向扩展,不存在性能瓶颈问题。
高可用性架构
服务器端的高可用性是通过平台集群技术实现的。没有单点故障,确保系统7×24小时稳定高效运行。
实现银行现有国内资源的全覆盖。
目前已经适配的国产软硬件资源有:neokylin操作系统、华为和红山存储设备、东方通中间件、启明星辰、天融信、沈心安全设备。
四。项目过程管理
1.需求分析和概要设计阶段
此阶段为2021年1月至2021年3月,主要完成业务需求分析、业务功能和技术架构的高层设计。
2.系统的详细设计阶段
此阶段为2021年3月至2021年4月,期间主要完成系统的详细设计,具体分析平台实现的管理流程和功能。
3.系统编码、测试和在线准备阶段。
本阶段时间为2021年5月至2021年8月,完成监测平台的详细设计和编码开发、测试和试点上线准备。
4.调试阶段
此阶段为2021年6月至2021年9月,期间监控平台已部署完成,并批量上线。根据试运行情况,提出了优化要求。
动词 (verb的缩写)操作
1.基础监控平台自2021年6月试运行以来运行稳定,全行软硬件系统监控覆盖率超过90%。到目前为止,它平均每秒处理500个新值。
2.基础监控平台有8种事件通知规则和3种事件通知方法。目前一天产生12个告警,26种监控模板,共有213个监控模板,68,225个监控项,13,356个事件触发器,每月98次活跃登录。
3.基础监控视图系统提供五种操作系统性能视图、五种数据库视图、六种中间件性能视图和六种网络设备性能视图。
4.基础监控平台提供2份自定义网络性能报告、1份核心系统性能报告和1份全行网络设备性能报告。基础监控平台本身每天检查一次。
5.通过模拟监控5套应用,可以实时计算应用的可用率。当业务不使用时,可以及时触发报警,避免在系统不可用时,未能及时获取用户感知而造成的客户流失。同时,可用性指标可以有效、科学地量化,便于各应用的服务质量评估,促进运维体系形成正向、良性的优化闭环。
不及物动词项目有效性
1.实现基础设施全覆盖。
实现了服务器、数据库、中间件、网络设备、安全设备、存储设备等基础设施的全覆盖。
2.现有国内资源已全部覆盖。
目前已经适配的国内资源有:neokylin操作系统、华为和红山存储设备、东方通中间件、启明星辰、天融信、沈心安全设备。
3.实现基础监测数据的多维监测和可视化。
支持各种基础设施性能数据、日志文件、SNMPTrap和Syslog数据的监控。通过表格、图形、折线图、饼图、热图等,以报告和视图的形式显示监控数据。
4.通过各种手段实现实时通知。
通过声光、短信等方式实时通知监控信息。
5.全面提升运维管理水平。
通过基础监控平台的建设,解决当前运维管理中的一系列实际问题,变被动运维为主动运维,实现基础设施的统一监控管理、统一告警管理、统一通知管理、统一视图管理、统一报表管理、统一大屏管理、统一配置管理、统一存储管理,为基础运维降本增效,全面提升全行运维管理水平,为科技安全运维提供强有力的技术支撑。
6.实现了模拟监控方法。
通过模拟用户行为,实现基于用户感知的业务拨测系统,形成运维监控系统的最后一道防线,避免服务故障发现不及时,影响客户满意度,造成客户流失。实现了实时计算,获得了系统可用性。可以通过模拟报警与否来判断故障的影响面,便于及时评估故障的严重程度。用监控手段形成完整的监控网络。从用户感知的角度,会反向完善和建设其他监测手段,倒逼我们优化基础监测系统的提升功能。

七。经验总结
通过基础监控平台的建设,实现服务器、数据库、中间件、网络设备、安全设备、存储设备等基础设施的全覆盖。并且也充分覆盖了国内现有的资源。后续将对国内资源进行适配,进行线内监测,监测数据以报表、图表、折线图、饼状图、热图等形式展示。通过仿真,实现了以用户体验为中心的服务可用性检测。针对特定场景,可以实现从监控到告警到故障自愈的闭环运维。强化有效防范科技风险、应用新技术、管理运维的能力。
通过该项目的建设,省联社将搭建一个高效、稳定、可扩展的监控平台,满足新时代的业务发展要求。依靠科技力量支持三农,帮助小微企业,帮助农村金融真正走出一条差异化、特色化的发展道路,构建普惠金融全方位、可持续的服务体系。
更多金融科技案例,请登录数字金融创新知识服务平台——金科创新社官网案例库。
免责声明:本平台仅供信息发布交流之途,请谨慎判断信息真伪。如遇虚假诈骗信息,请立即举报
举报













