p570,硬盘故障。



机器有两个vg,rootvg和datavg,rootvg未做镜像,datavg已做镜像。系统errpt和HMC报硬盘有问题,查看错误代码可能是硬盘有坏道(坏块),在尽量保全用户数据的前提下,要解决此问题。

先是想到把datavg的镜像解除,把空出来的hdisk2分配到rootvg给有故障的盘做mirror。在经过很长一段时间的同步之后,查看rootvg里面的Lv状态时可以看到除了hd1即/home还是stale状态外,其它LV都已经是syncd状态。然后为保险起见把整个/home分区都tar到datavg的一个分区里面,因为耗时比较久同时也可能是因为有坏道,所以此操作进行了很久而且IO等待很高,而且执行df
-g,iostat,vmstat等命令都等待了很久,完全就是卡住了,于是决定等第二天继续处理。



第二天早上查看此机器的状态,lsvg -l
rootvg发现除了/home之外也有很多分区也变成了stale状态,同时lsvg查看到有故障的hdisk0已经是missing状态,完全已经不可操作了。又一次尝试把/home下面的一些文件和文件夹tar到datavg里面,准备把/home分区重建一下。尝试使用rmlv,rmfs都失败,提示只有最后的一块好的盘系统无法保证vg完整而拒绝rmlv,rmfs。给rootvg
unmirror成功,但是在给/home分区rmlvcopy的时候一样提示失败。同时使用lspv
-M命令查看到hdisk1上只有两个LP是stale的状态,而查看hdisk0时看到正好对应的两个LP是好的,于是想着把hdisk0上这两块好的LP直接迁移到hdisk1上去,使用mirgratelp命令,但是在迁移过程中卡死,ctrl+c中止掉,后面就发现/home的LV的PVs变成了3,非常奇怪的问题。再尝试把hdisk0直接从rootvg中reduce掉,执行reducevg提示上面一样的错误,想换盘都不行了。后面实在无法了,准备尝试重启一下机器看。

重启后,在HMC里面看到,该分区的启动报错误代码0552,重新选一块hdisk启动依然报0552。于是只能从网络引导分区,引导进去之后已经看不到原来的hdisk0这块硬盘,importvg都不行,提示VGDA信息有问题。同时用于管理这几台小机的HMC也挂掉了,不能用了,图形界面始终无法显示出来,重启HMC之后故障依旧,只能把这个分区挂到另外一台HMC上使用。最后尝试各种方法都无法恢复系统本身,于是只能选择重装AIX。

这个案例告诉我们重要数据一定要做备份。案例中rootvg没镜像,小机也没连磁带机,也从来没有用mksysb做过系统的备份。虽然这是个开发测试机,但是oracle的数据居然是直接放在/home下面,不说用裸设备,至少要分另外一块硬盘的一个单独的LV出来用作oracle的数据分区。硬件故障是不可避免的,而用户没做备份这就有点说不过去了,所以对硬件不要太依赖,重要的数据一定要做备份。

处理某客户p570硬盘故障所思的更多相关文章

  1. vsftp客户连接常见故障现象

    ftp客户连接常见故障现象现象0:> ftp: connect :连接被拒绝原因: 服务没启动解决: # chkconfig vsftpd on<Enter> 现象1:500 OOP ...

  2. DELL EqualLogic PS存储硬盘故障数据恢复成功案例分享

    DELL EqualLogic PS4000采用虚拟ISCSI SAN阵列,为远程或分支办公室.部门和中小企业存储部署带来企业级功能.智能化.自动化和可靠性.以简化的管理.快速的部署及合理的价格满足了 ...

  3. EVA 4400存储硬盘故障数据恢复方案和数据恢复过程

    EVA系列存储是一款以虚拟化存储为实现目的的HP中高端存储设备,平时数据会不断的迁移,加上任务通常较为繁重,所以磁盘的负载相对是较重的,也是很容易出现故障的.EVA是依靠大量磁盘的冗余空间,以及故障后 ...

  4. rsync 实现文件同步 (重要数据通过rsyncr把数据同步到不同的两台服务器上,这样可以防止服务器的硬盘故障导致数据丢失) 客户端同步时如果要排某个目录

    rsync是unix系统下的数据镜像 备份工具,一般linux系统都 自带: # rpm -qa|grep rsync rsync-3.0.9-17.el7.x86_64 服务器端:10.100.0. ...

  5. Centos6.5硬盘故障修复

    以企业Centos6.5Linux为案例来修复系统,步骤如下: (1)远程备份本地其他重要数据,出现只读文件系统,需要先备份其他重要数据基于rsync|scp远程备份,其中/data为源目录,/dat ...

  6. 分布式存储ceph——(5)ceph osd故障硬盘更换

    正常状态:

  7. Ceph添加、删除osd及故障硬盘更换

    添加或删除osd均在ceph部署节点的cent用户下的ceph目录进行. 1. 添加osd 当前ceph集群中有如下osd,现在准备新添加osd: (1)选择一个osd节点,添加好新的硬盘: (2)显 ...

  8. 分布式存储ceph--osd故障硬盘更换(6)

    正常状态:

  9. Ceph osd故障硬盘更换

    正常状态: 故障状态: 实施更换步骤: (1)关闭ceph集群数据迁移: osd硬盘故障,状态变为down.在经过mod osd down out interval 设定的时间间隔后,ceph将其标记 ...

随机推荐

  1. Majority Element:主元素

    Given an array of size n, find the majority element. The majority element is the element that appear ...

  2. python-网络-tcp

    python-网络-tcp 标签(空格分隔): python TCP[client]-发送数据 from socket import * s = socket(AF_INET, SOCK_STREAM ...

  3. POJ 1141 括号匹配 DP

    黑书原题 区间DP,递归输出 不看Discuss毁一生 (woc还真有空串的情况啊) //By SiriusRen #include <cstdio> #include <cstri ...

  4. DC、CDC及CDC的各个子类

      设备描述表是一个包含设备信息的结构体(物理设备如显示器.打印机),MFC中关于图像操作都需要DC来完成.HDC是Windows的一种数据类型,是设备描述句柄:CDC是MFC封装的Windows 设 ...

  5. c# 枚举enum

    1 定义枚举 enum Days { Sunday, Monday, Tuesday, Wednesday, Thursday, Friday, Saturday }; 默认情况下,枚举中的每个元素的 ...

  6. require(): open_basedir restriction in effect. File

    新安装的 lnmp 环境,将项目放上报 require(): open_basedir restriction in effect. File 的错误! 错误日志显示,访问脚本不在 open_base ...

  7. NodeJS学习笔记 进阶 (2)Nodejs进阶:MD5加密算法(ok)

    个人总结:这篇文章讲解了Nodejs中自带模块的MD5加密算法的使用,读完这篇文章需要15分钟,其实还有一个叫utility的包在npm上,也非常好用. 摘选自网络 简介 MD5(Message-Di ...

  8. echarts如何修改数据视图dataView中的样式

    原文链接:点我 做了一个现实折线图的图表,通过右上角icon可以自由切换成柱状图,表格.在表格中遇到的一点小问题,解决方案如下: 1.场景重现 这是一个显示两个折线图的图表,一切看起来都很顺利.但是点 ...

  9. POJ 3630 Phone List(字典树)

    题意 题意:t个case(1<=t<=40),给你n个电话号码(电话号码长度<10)(1 ≤ n ≤ 10000),如果有电话号码是另一个电话号码的前缀,则称这个通讯录是不相容的,判 ...

  10. [洛谷P1343]地震逃生

    题目大意:有n个点m条单向边,每条边有一个容量.现有x人要分批从1走到n,问每批最多能走多少人,分几批运完(或输出无法运完). 解题思路:一看就是网络流的题目.每批最多能走多少人,即最大流.分几批运完 ...