欢迎来到天天文库
浏览记录
ID:29790971
大小:113.68 KB
页数:10页
时间:2018-12-23
《[计算机]ibmp系列小型机_故障定位、故障排除》由会员上传分享,免费在线阅读,更多相关内容在应用文档-天天文库。
1、第三章、故障定位、故障排除根据我们在实际商用系统中碰到问题,我们总结出了以下几种常见故障及其定位方式和解决方法。3.1硬件故障硬件故障有很多种,对系统产生的影响也不一样,这里按其故障对系统的影响程度分:致命影响的硬件故障和只影响功能的硬件故障两类进行硬件分类:其损坏对系统产生致命影响(将使机器宕机或无法启动)的硬件包括:主板、CPU、I/O柜(包含本地盘、光驱、PCI插槽等的柜子)或CEC柜(包含CPU/MEMORY等的柜子)、I/O柜I/O柜与CEC柜的接线、电源模块、风扇、本地硬盘、内存损坏等等注:I/O柜和CEC柜一般在比较高端的小型机才有,如M80,低端的是合一的。这些设备的损坏等将使
2、系统无法完成自检、引导和启动,液晶显示屏上都将有错误信息,可根据液晶显示屏上的错误码对照ServiceGuide查的错误原因,如果是工作状态下出现这些硬件损坏,则系统将被挂起或宕机。其损坏对仅对系统产生功能影响(机器不会宕机并能正常启动)的硬件包括:网卡、本地硬盘有坏块、显卡、SSA卡和其他外围设备这些设备的损坏只影响特定功能,如网络功能、显示功能、访问磁阵的功能等,对于本地硬盘有坏块的情况,则要看坏块中是否包含了重要的系统文件,如果不是重要系统文件,则系统功能不受影响,但也建议立即更换该硬盘。故障定位和排除:以上硬件故障信息都可以使用:液晶屏上的错误码或:errpt–dH查看到根据错误码确定
3、是什么硬件出了故障,对商用系统来讲,由于是双机系统,如果损坏机器是主机可以将此服务器切换成备机,然后修复故障机器,恢复系统。3.2磁阵故障磁阵引起的故障是目前碰到的最频繁、危害最大的故障,据不完全统计,其故障覆盖到总故障的70%以上,具体来讲,可能引起磁阵故障的环节包括:磁阵硬盘、7133柜子、主机上的SSA卡、连接7133与主机的SSA线、硬盘的位置和ssa线的接线方式、以及盘柜使用的电压及周围磁场、磁阵/硬盘/ssa卡的微码等都可能造成7133的异常。7133磁阵的问题是最复杂的,一般有物理损坏的原因也有环境原因,这是主因,如接线、插盘位置不符合要求、未及时查看系统告警等造成系统中断等辅因
4、。按照我们的经验,不管是什么硬件故障导致7133故障,系统都会产生告警,如果能及时发现问题并采取措施,一般都能防止故障的发生。故障定位:7133硬件故障也可以使用:errpt–dH查看到伴随的错误码有:B4C006180115140004PHssa0RESOURCEUNAVAILABLEFE9E93570401082304PHssa0DISKOPERATIONERRORFE9E93571205000803PHpdisk3DISKOPERATIONERROR03913B941122031103UHLVDDHARDWAREDISKBLOCKRELOCATIONACHIEVED613E5F38112
5、1125103PHLVDDI/OERRORDETECTEDBYLVM625E6B9A0401090004PHssa0ADAPTERDETECTEDOPENSERIALLINK26CA120B0206081104PHssa0CACHESTORAGECARD所有的错误码都预示着7133有异常,红色部分则表示肯定出现了硬件故障,需要立即进行检查并采取措施,否则磁阵将很快不能访问。对于蓝色部分:625E6B9A0401090004PHssa0ADAPTERDETECTEDOPENSERIALLINK表示ssa出现了开环,出现开环不仅影响IO性能,也增加了风险,即如果另一个环路也出现问题,将不能访问磁阵
6、。开环一般有两种情况:1)如果625E6B9A报错比较频繁,如每天几次,则表示系统很有可能出了硬件故障,虽然不会导致访问磁阵失败,但需要立即查出原因并解决。查错方法可以参考下面的描述。2)如果625E6B9A错误偶尔报一次,则要具体情况具体对待,有可能是读写忙出现的误报,也按下面方法进行排查,如果没有查出具体的原因,则可以继续观察。26CA120B0206081104PHssa0CACHESTORAGECARD该错误一般是在:SSA卡带writecache并打开FastWrite,而ssa卡上用于writecache供电的可充电镍镉电池达到或接近安全寿命的情况下产生的。这类错误产生将影响IO写
7、性能,并且由于在FastWrite打开的情况下,主备机需要同步ssa卡上的writecache,所以甚至会影响到主备机同步。具体解决方法可参考下文。故障排除:对于红色部分错误的问题排除,一般可以使用diag命令进行进一步诊断:#diag->TaskSelection->SSAServiceAids->LinkVerification检查环路中是否出现了???的盘符或状态不是good的硬盘或使用:#
此文档下载收益归作者所有