1 运维巡检表格
1.1 每日巡检记录单
1.2 周巡检报告
1.3 季度巡检报告
1.4 远程服务记录单
1.5 现场维护记录单
1.6 现场运维巡检服务单
1.7 服务器巡检记录
1.8 网络设备巡检记录
1.9 视频会议系统检测表
1.10 机房巡检报告
1.11 运维服务统计表
1.12 运维服务交接单
1.13 运维服务交接单
1.14 运维变更类台帐
文末附服务器检查表: 1、系统资源检查
2、K8S集群检查
3、Nginx检查
4、JAVA应用检查
5、RabbitMQ检查
6、Redis检查
7、PostgreSQL检查
8、Elasticsearch检查
9、ELK日志系统检查
10、IDS(入侵检测)完整检查表
11、Linux完整检查表
12、MySQL完整检查表
13、Oracle完整检查表
14、SQL-server完整检查表
15、Tomcat完整检查表
16、WAF完整检查表
17、Weblogic完整检查表
18、windows完整检查表
19、防火墙策略调研表
20、防火墙完整检查表
软件全套资料部分文档清单: 工作安排任务书,可行性分析报告,立项申请审批表,产品需求规格说明书,需求调研计划,用户需求调查单,用户需求说明书,概要设计说明书,技术解决方案,数据库设计说明书,详细设计说明书,单元测试报告,总体测试计划,单元测试计划,产品集成计划,集成测试报告,集成测试计划,系统测试报告,产品交接验收单,验收报告,验收测试报告,压力测试报告,项目总结报告,立项结项审批表,成本估算表,项目计划,项目周报月报,风险管理计划,质量保证措施,项目甘特图,项目管理工具,操作手册,接口设计文档,软件实施方案,运维方案,安全检测报告,投标响应文件,开工申请表,开工报告,概要设计检查表,详细设计检查表,需求规格说明书检查表,需求确认表,系统代码编写规范,软件项目质量保证措施,软件部署方案,试运行方案,培训计划方案,软件系统功能检查表,工程试运行问题报告,软件合同,资质评审材料,信息安全相关文档等。
建设方案部分资料清单:
信创云规划设计建设方案,新型智慧城市解决方案,医疗信息化中台技术架构方案,智慧消防建设规划方案,智慧校园技术方案,智慧医疗技术方案,智慧园区管理平台建设方案,智慧政务大数据整体技术解决方案,SRM系统解决方案,固定资产管理系统建设方案,工单管理系统建设方案,大数据管理平台技术方案,GIS地理信息服务平台建设方案,设备管理系统建设方案,远程抄表管理方案,BIM建模建设方案,数字孪生物联网云平台建设方案,仓储管理建设方案,智慧园区整体解决方案 ,智慧工地整体解决方案等等。
全部资料获取:本文末个人名片直接获取。
服务器巡检表 |
||
检查项目 |
检查指标 |
检查标准 |
系统资源 |
CPU 使用率 |
正常:<70%低风险:≥ 70%中风险:≥ 85%高风险:≥ 95% |
内存使用率 |
正常:<70%低风险:≥ 70%中风险:≥ 85%高风险:≥ 95% |
|
磁盘使用率 |
正常:<80%异常:≥ 80% |
|
系统负载 |
正常:<70%低风险:≥ 70%中风险:≥ 85%高风险:≥ 95% |
|
日志文件是否有异常 |
正常:日志中风险无 ERROR报错低风险:日志中风险少量ERROR报错且不影响业务中风险:日志出现5%以上的ERROR报错且影响非核心业务高风险:日志中风险出现10%以上的ERROR报错且已经影响核心业务或者集群状态 |
|
系统服务是否正常运行 |
正常:没有Failed和Down状态的服务低风险:有Failed和Down状态的服务但不影响业务中风险:有Failed和Down状态的服务且影响非核心业务高风险:有Failed和Down状态的服务已经影响部分业务或者集群状态 |
|
检查系统是否有波峰波谷 |
正常:指标线没有明显的大波动低风险:少数波峰波谷,一天2-5次且持续时间不长中风险:频繁波峰波谷,一天≥5次且持续时间不长高风险:一直处于波峰波谷,无法提供服务 |
|
K8S集群 |
节点状态 |
正常:节点状态为 Ready低风险:出现1台状态为NotReady中风险:出现2台状态为NotReady高风险:大于2台状态为NotReady |
Pod 状态 |
正常:所有 Pod 状态为 Running低风险:Pod状态为Running但出现重启的情况中风险:非核心业务Pod出现不可用状态高风险:核心业务Pod不可用 |
|
持久卷状态 |
正常:所有持久卷状态均为 Bound低风险:持久卷出现异常但不影响业务中风险:持久卷出现异常且影响非核心业务高风险:所有持久卷不可用且核心业务受影响 |
|
节点资源使用情况 |
正常:所有节点资源使用率均低风险于 70%低风险:所有节点资源使用率大于70%且不影响业务中风险:所有节点资源使用率大于80%且影响非核心业务高风险:所有节点资源使用率大于95%且影响核心业务 |
|
节点间通信是否正常 |
正常:节点间通信延迟低风险于 50ms,无丢包低风险:节点间通信延迟大于 50ms但不影响业务中风险:节点间通信延迟大于 100ms出现丢包,且影响非核心业务高风险:节点间通信延迟大于 150ms出现丢包,且影响核心业务 |
|
Nginx |
端口监听 |
正常:监听端口包含nginx配置文件监听的端口低风险:监听端口不包含且不影响业务中风险:监听端口不包含且影响非核心业务高风险:监听端口不包含且影响核心业务 |
访问正常 |
正常:响应状态码为 200低风险:出现非200但不影响业务中风险:出现非200影响非核心业务高风险:出现非200且影响核心业务 |
|
日志记录 |
正常:日志中风险无 ERROR报错低风险:日志中风险少量ERROR报错,不影响使用中风险:日志出现2%的ERROR报错,影响非重要业务高风险:日志中风险出现10%以上的ERROR报错且已经影响部分重要业务 |
|
连接数 |
正常:<1024低风险:≥ 1024中风险:≥ 2048高风险:≥ 4096 |
|
JAVA应用 |
程序运行状态 |
正常:服务正在运行低风险:服务实例数<2但不影响业务中风险:服务不可用数<2影响非核心业务高风险:应用程序无法正常运行,核心服务不可用 |
检查Pod是否有波峰波谷 |
正常:指标线没有明显的大波动低风险:少数波峰波谷,一天2-5次且持续时间不长中风险:频繁波峰波谷,一天≥5次且持续时间不长高风险:一直处于波峰波谷,无法征程提供服务 |
|
RabbitMQ |
节点状态 |
正常:所有节点状态为 running中风险:出现一个节点状态为down高风险:所有节点状态为down |
队列长度 |
正常:≤ 500低风险:>500中风险:>1000高风险:> 2000 |
|
Redis |
连接数 |
正常:<1024低风险:≥ 1024中风险:≥ 2048高风险:≥ 4096 |
内存使用率 |
正常:<70%低风险:≥ 70%中风险:≥ 85%高风险:≥ 95% |
|
PostgreSQL |
数据库连接数 |
正常:<1024低风险:≥ 1024中风险:≥ 2048高风险:≥ 4096 |
磁盘空间使用率 |
正常:<80%异常:≥ 80% |
|
Elasticsearch |
集群状态 |
正常:集群status为 green低风险:集群status为 yellow高风险:集群status 为 red,出现不可用状态 |
索引状态 |
正常:索引status为 open高风险:索引status为 down |
|
ELK日志系统 |
日志收集是否正常 |
正常:应用输出的日志是否与ELK收集的一致低风险:日志出现不一致,收集不完全 |
索引状态 |
正常:索引status为 open中风险:索引状态status为 down |
评论前必须登录!
注册