改善机房环境监控管理现状的新理念
随着IT时代的到来,机房(计算机中心、设备间、配线室、基站等)已成为各单位的重要组成部分,机房(计算机中心、设备间、配线室、基站等)的环境设备(供配电、UPS、空调、温湿度、漏水、消防、保安等)必须提供正常的运行环境,否则,就会影响到整个系统的运行,若事故严重又不能及时处理就可能造成严重后果。因此,目前许多机房的管理不得不采用24小时专人值班来定时巡查机房场地设备,这样不仅加重了管理人员的负担,而且往往不能及时排除故障。尤其目前国内普遍缺乏机房场地设备的专业管理人员,对机房进行计算机自动化管理显得十分重要。
为了减少因环境和人为失误造成的损失,用户需要拥有一套先进、可靠的机房环境监控与预防系统来确保设备的安全运行。计算机机房和数据中心支撑着各类企事业单位现代化生产体系的正常运行,一些机房甚至已成为无人值守型。
在这种情况下,任何一个由于环境因素和人为失误造成的意外系统中断和设备损坏都会给企事业单位带来巨大的损失。为了减少这种损失,用户需要有一套先进、可靠的机房环境监控与预警系统来确保设备的安全运行。该系统必须能够随时随地观察到机房的情况、必须能及时地发出预防性报警、通知有关人员、采取措施、防止事故发生。
综上所述,完善的机房监控系统应该具备三大特点:能够实现从设备运行情况到机柜微环境再到机房整体环境这样多层次的监控;能够有丰富的阈值设置以监测出危机的存在,并能有丰富的预警方式和预警流程保证相关人员能够收到警讯,达到预警的目的;具备网络化、智能化,能够随时随地通过网络查看机房内的情况。
然而,传统机房环境监控是把重点放在对机房整体环境、空调及配电柜的监控上,而忽视了对设备内部的监控。另外,传统机房环境监控系统也缺少丰富的阈值、预警方式和预警流程设置,不能在真正意义上实现预警功能。
新概念机房监控的三大特点
为了改变传统机房环境监控的现状,需要引入三大新理念加以改善。
对设备内部进行监控
机房监控的目的在于保护机房内IT系统的正常、有效运行,在事故发生之前侦测出潜在危机,并通过各种方式将警情信息发送给相关人员及时进行处理。因此,机房监控的核心应该是对IT系统运行状态的监控,而最直接有效的监控应该是直接对IT设备运行状态进行监控。
IT设备内部的运行环境,例如服务器内风扇转速与CPU温度等是最直接、最迅速影响IT设备正常运行的因素。有时候即使机房内空调运转正常,机房整体环境参数值也在预设范围内,但某服务器却因为某种原因出现服务器内风扇的转速不正常、CPU过热。如果只监控机房整体环境,此时机房的管理人员是不会得到这种危险信息的,整个系统就会因为该服务器潜在危机没有得到及时处理而意外瘫痪。
多层次的机房监控
完善的机房监控系统应该是能够实现对从设备运行情况到机柜微环境再到机房整体环境这样多层次的监控,并能重点实现对设备内部的监控。
我们都知道,机柜内的微环境是设备正常运行所需要的物理环境。机柜微环境参数最能体现设备所处的实际运行物理环境的情况,所以实现对机柜内微环境的监控也相当重要。机房各个点的环境参数值是不同的,因此机房内整体环境监测的参数不能体现各机柜微环境参数,更不能体现重要设备内部的环境。也就是说,即使机房整体环境参数正常,IT设备所在处的环境也不一定正常。所以说机房的整体环境监控的重要性次于对设备的监控和对机柜内微环境的监控。
空调机的运行是为了降低机房内的温度,使机房内的整体温湿度保持在一个合适的范围内,机房各个点的温度参数值是不同的。空调机出风口的温度值不能说明机房的整体温度和机柜微环境温度,空调的正常运行不能说明设备就能正常运行。因此对空调的监控不能代表甚至取代对设备的监控。