欢迎来到天天文库
浏览记录
ID:9680236
大小:49.50 KB
页数:2页
时间:2018-05-05
《hacmp工作原理以及日常维护》由会员上传分享,免费在线阅读,更多相关内容在应用文档-天天文库。
1、HACMP工作原理以及日常维护 HACMP的工作原理是利用LAN来监控主机及网络、网卡的状态。在一个HACMP环境中有TCP/IP网络和非TCP/IP网络。TCP/IP网络即应用客户端访问的公共网,该网可以是大多数AIX所支持的网络,如Ether,T.R.,FDDI,ATM,SOCC,SLIP,等等。非TCP/IP网络用来为HACMP对HA环境(Cluster)中的各节点进行监控而提供的一个替代TCP/IP的通讯路径,它可以是用RS232串口线将各节点连接起来,也可以是将各节点的SCSI卡或SSA卡设置成TargetM
2、ode方式。 HACMP将诊测并响应于三种类型的故障:1网卡故障,2网络工作,3节点故障。下面就这三种故障分别进行介绍。 1、网卡故障 前面讲到,HACMP的群集结构中,除了TCP/IP网络以外,还有一个非TCP/IP网络,它实际上是一根心跳线,专门用来诊测是节点死机还是仅仅网络发生故障。如下图所示,一旦节点加入了Cluster(即该节点上的HACMP已正常启动),该节点的各个网卡、非TCP/IP网络就会不断地接收并送Keep-Alive信号,K-A的参数是可调的,HA在连续发送一定数量个包都丢失后就可确认对方网卡
3、,或网络,或节点发生故障。因此,有了K-A后,HACMP可以很轻易地发现网卡故障,因为一旦某块网卡发生故障发往该块网卡的K-A就会丢失。此时node1上的clustermanager(HACMP的大脑)会产生一个sanager知道,应用和client并不知道。一旦发生sanager将原来serviceadapter的IP地址转移到standbyadapter上,而standby地址转移到故障网卡上,同时网络上其他节点进行ARP的刷新。网卡互换(ss,ExportNFSfilesystems,AssumeIPirror方式
4、,从而提供硬盘的高可用性。RAID-5将奇偶较验位分散在硬盘组中,因此当一组内的一个硬盘坏掉,组内的其他硬盘可以通过奇偶较验位将该硬盘上的数据恢复出来。RAID-5方式一般是由硬件实现的,如下7133的SSA适配器,而且如果同一组内的两个硬盘坏掉,该组硬盘的数据很可能就会全部丢失。mirror方式是将同一个数据写到至少两个物理外置上,因此它的效率没有RAID-5好,而且用盘量大,但安全性比RAID-5高,而且它易于实现,通过AIX中的(LogicVolumeManagement)可以很方便地设置。 b.硬盘控制卡 存
5、储设备连接到主机上都必须通过一块控制卡,SCSI设备是SCSIAdapter,SSA设备是SSAAdapter,如果这块卡坏掉,与之连接的外设就无法利用。有几种办法可以解决这个问题。 一种办法是用多个adapter。每个主机上都有两块或两块以上adapter,分别连接mirror的数据,因此无论是硬盘坏掉,还是Adapter坏掉,所有好数据还是可以被主机利用,不会出现单点故障。这种方法实现起来并不难,但必须配置多块adapter,而且必须采用数据mirror方式。这种方法也不用通过HACMP来实现。 另一种方法仍只用
6、一块adapter,利用HACMP中的ErrorNotificationFacility(错误通告机制)来解决。 ErrorNotificationFacility是HACMP提供的对其他设备的监控工具,任何报告给AIX的错误(error)都能被捕获被采取相应措施。HACMP提供了smit界面,使配置简单化。 我们已知道,用LVM可实现硬盘镜像,当一个盘坏掉,仍有一份12下一页——感谢阅读这篇文章,..,数据在镜像盘里,数据仍可进行读写,但此时数据不再有可用性,若镜像盘也坏掉则数据全部丢失。所以在此例中,PV丢失(L
7、VM_PVMISS)的信息会大幅显示在控制台面上,从而提醒用户去仔细查看errorlog找出故障并修复它。同样,此例中HACMP提供了界面,结合AIX的功能,从而监控故障的发生。 c.应用故障 如果用户的应用有kernelcall调用,或以root身份来启动等,一旦应用发生故障,很容易导致操作系统doResourceController)机制所提供的API接口,就可以使应用在doationdaemon,它负责维护整个cluster的状态的信息,clinfoAPI允许应用程序利用这些状态信息来采取相应行动。 d.HA
8、CMP故障 如果cluster中节点的HACMP进程doP将其升级为节点故障,从而发生资源接管。 如上所述,HACMP只全权负责诊断网卡故障、网络故障和节点故障这三类故障,并负责实现IP地址转换或接管,以及整个系统资源(硬件、文件、系统、应用程序,等等)的接管。对于这三类故障外的其他故障,可以结合AIX基本功能和
此文档下载收益归作者所有