浪潮服务器 磁盘阵列 raid5 升级,惨酿大祸
Abstract
由于业务的繁重和服务的长期使用压力,现需要将 8 台浪潮的节点进行物理设备的升级,升级的主要板块如下:
-
每台节点共上新数据盘11块,每块容量为 16T
-
每台节点共上新内存条12条,每条容量为 64G
-
基于新上的数据盘做 磁盘阵列 raid5 操作,并冗余留一块数据盘做 热备盘
主体业务便是这些, 中间产生一系列的小白无脑操作,专业运维工程师的操作都会一一叙述
Introduction
每条节点的具体环境如下所示:
- 服务器为
Inspur Server, 也就是大家熟知的 浪潮 服务器,很多运维老哥称之为洋垃圾 - CPU 为两颗
Socketo: Intel(R) Xeon(R) Platinurm 8163 CPU @ 2.50GHZ, 英特尔的至强白金系列 - 内存为 12 条 三星的 DDR4, 2666MHZ 的 64G 内存条, 共 768GB
- 系统储存为 2 块 三星1T SSD,并做 磁盘阵列 raid1
- 数据储存为 1 块 西数企业级 16T HDD
- 网络层面为 2 个 千兆 电口 和 2个万兆 光口
Upgrade
本人只在学生时期整理过服务器的组装,设备硬件等升级操作,但操作的均是 DELL 服务器,和现在的 浪潮 整体对比, DELL 的 Bios 和 Raid 设定和 后台 BMC 还是相当人性化的,浪潮 还在下去再沉淀沉淀!
主要升级的内容如下:
-
数据储存为 11 块 西数企业级 16T HDD, 并做 磁盘阵列 raid5 + 1块热备盘
-
内存为 12 条 三星的 DDR4, 2666MHZ 的 64G 内存条, 共 768GB

本次的升级的主体难度无非就在磁盘安装好后的 raid5 操作,其余均是脏活累活,之前也整过磁盘的 raid 操作,故本小白 “艺高人胆大” 的勇担本次升级业务的 ”重担“,道路多坎坷啊!
Process
在网上查询多篇升级或做磁盘阵列的操作blogs, 最终选择了影响我一生的一篇 浪潮服务器怎么重做raid 、设置pxe 启动, 具体流程如下所示
-
下午 5 点开始和另外三名小伙伴开始拆服务器的硬盘架,并与新的硬盘进行绑定,该步操作耗费了我们差不多 2 个小时左右的时间

-
时间来到了晚上的 7 点左右,在将现有的服务关停后,关闭服务器,开始安装 储存 和 内存设备; 升级的初步逻辑是先单独升级一台,升级成功后有了思路和经验,后续的 7 台节点岂不是轻松拿捏,故开始软件侧的升级流程… …
-
依据该博客的 step4 逻辑将启动模式从
传统模式调整为UEFI 模式后重启服务器成功在 Bios 中找到 raid 的控制界面

-
致命的操作来了:依据博客的 step7.2 步骤,选择清除当前的配置, 糊里糊涂的就在周边小伙伴的注视下就 confirm 这步操作。如果是小白可能不太清除该步骤的影响力有多大,具体的影响如下:
-
RAID 配置被删除
- RAID 级别失效:当前的 RAID 级别(如 RAID 0、RAID 1、RAID 5 等)会被清除,磁盘将恢复到非 RAID 状态。
- 虚拟磁盘消失:由 RAID 控制器创建的虚拟磁盘(Virtual Disk)将被删除,操作系统将无法识别之前的 RAID 阵列。
-
数据丢失风险
- 数据不可访问:清除 RAID 配置后,阵列中的数据将无法访问,因为 RAID 元数据(描述磁盘如何组成阵列的信息)已被删除。
- 数据恢复困难:如果没有备份,恢复数据可能会非常复杂,需要专业的数据恢复工具和服务。
-
磁盘状态恢复为单盘
- 磁盘将恢复为独立的物理磁盘,操作系统会将其识别为单独的硬盘,而不是 RAID 阵列的一部分。
-
需要重新配置 RAID
- 如果需要继续使用 RAID,必须重新进入 BIOS 或 RAID 配置工具,重新创建 RAID 阵列。
- 重新配置 RAID 时,可以选择相同的 RAID 级别或其他级别,但需要重新初始化磁盘,这会导致磁盘上的所有数据被清除。
-
操作系统可能无法启动
- 如果操作系统安装在 RAID 阵列上,清除 RAID 配置后,系统将无法找到启动分区,导致无法启动。
- 需要重新安装操作系统或从备份中恢复系统。
OK, 不知道大家还记得本文的主体逻辑是升级,并不是安装,前文提到的每台节点都是存在 2 块 1T 的raid1的系统盘的,那该步骤的 confirm 操作直接导致的是 该节点的系统盘的数据直接被 抹掉了,但在当时我是并不知道该步骤操作的严重性的,依然继续往下走
-
-
查看 12 块 HDD 状态

-
忽略博客的步骤7.3 的格式化硬盘,全是新盘,在后续挂载操作在格式化分区接口,故直接点击 Create Virtual Drive ,指定 raid 为 raid5,并选择 12 块盘创建 virtual dirver,最后再保存配置便完成了我认为的升级差不多的流程了

-
最后依据博客的step8步骤查看 Configuration Management.View Driver Group Properties 去查看创建好的 VD

并再次点击去查看该 VD 详情【其实细心看的小伙伴这里是已经可以看出来端倪了,因为这里只有数据盘的 raid5, 并没有 系统盘的 raid1,但当时的小白再尝成功的感觉怎会知晓这种情况呢!!!】

兴高采烈地和伙伴们看着配置成功的 很简单拙劣的 raid5 配置结果,一步步回退,最后按下储存并离开吗? 选择 是,彻底断送了还能挽救这离谱操作的选项

-
那流程流转至此,时间已然来到了晚上的 8 点左右,接下的便列举几个我在后面近4个小时中的来回循环无脑小白操作:
- 第一次重启系统,开机,亮屏,各种初始化,校验完成,等待启动,最终在启动时,显示网络超时【该流程近乎20min】
- 心想怎么会是网络启动呢?启动项设定错了?
- 再一次重启系统,开机,亮屏,各种初始化,校验完成,浪潮是 按 F11 选择启动选项,但是在选择的时候只有两个电口和两个光口的网络设备,但在当时根本不知晓该情况,故在这样的循环中来回反复了 至少 4次!!!【该流程近乎40-50min】
- 反复两次后伙伴们等不了了,无功并不浪费时间下只得让他们逐个关闭其他7台节点服务器,只安装内存和硬盘,其余并不做过多的操作
- 多次无果下,时间已然来到了晚上的 10 点左右,开始尝试找外援,先找之前的我们就找过的运维工程师,简称王哥,开始视频远程下指令,我来操作
- 一顿在我还在很骄傲的介绍自己的raid5的操作下,将初步的问题定位在启动项的逻辑上,故修改启动项为硬盘首选,网络与其他往后排,再次重启执行 8.1 的操作,结果依然启动不了;【该流程近乎20min】
- 再次启动进入 bios 后,进入 raid 仔细查看,王哥发现 为啥没有系统盘的数据呢,你磁盘当先,里面没有系统啊,肯定起不来啊,那就继续寻找系统盘,但是前文提到了:在 VD 中是查看不到系统盘的raid1的,但是在 driver 侧是能看到该有一个 水灵灵的 938G 的三星硬盘在列表里面的,然后我和王哥解释道这2块系统盘是做了 raid1 的,按道理来说数据是会备份的,故王哥让我利用 raid1 的备份机制试图将没显示的一块盘的数据通过 raid1机制将显示的这块盘的数据给备份回来,具体的操作是,将后置的两个盘随机拔出来一块【因为不知道那块是主盘】,紧接着拔掉另一块盘,在等了差不多 10 S 后,将这两块盘在插回去, 这样的步骤执行了两遍, 最后的结果是依然无果。【该流程近乎30min】
- 再次无果下,时间已然来到了晚上的 11 点左右,将该次事故的整体情况上报给上级,说明情况, 最终讨论的结果是现将这台节点从关机,等明天王哥线下来操作!
- 还不甘心的我,将求救外援之手伸向了我的老师,简称 唐锅,其实在找王哥之前,我第一时间就找了唐锅,但是当时他在开车,我就只能找王哥了,唐锅在开车到家后也问了我情况,当时在和王哥整,就没回复消息了,我在此刻给唐锅发了消息,然后问方便视频吗?唐锅说等一会,10秒后 唐锅 便打来了视频。接上发现他那边是已经睡了,他起床到客厅给我打的电话,我还准备煽情一下,唐锅直接打断,说对准屏幕,不愧是老法师!那修复流程如下:
- 在和我了解一下基础操作的前后逻辑, 但是我仍然判断系统还是存在的,只是启动不了而已,不知道怎么设置的 情况后之后,和我说了一句,你这个情况简单哦,我弄过的,唐锅说他的肉鸡就有我们的这款 浪潮的服务器,那前文的 “洋垃圾”,就是唐锅说的啊,我对这块确实涉猎甚少。他的初步判断是我们我们的系统是安装在磁盘阵列上的,你们启动项设定硬盘怎么行呢,故重复执行 8.1 步骤,进入bios 将启动项设定为 磁盘阵列,但是根本没这个选项,唐锅说:简单哦,你这个是不是把 boot model 设定为 UEFI 了啊,改掉, 改成其他的就行,故将 启动模式 修改为 传统模式后再重复执行 8.1 步骤后,在 boot 选项中看到了整列卡的选项,此刻我的内心是有点激动的,唐锅 让我把启动项只选择 磁盘阵列,其余选项全关闭【老法师】然后再次重复执行 8.1 步骤,此刻 唐锅 让我把视频稳住,紧紧看着启动界面的每个记录然后的东西,和我一一解释每行大概是什么意思,直至最后启动的进度条到头后不动了,屏幕右下角显示 92 的字样,唐锅说这个代码是启动盘或者次磁盘阵列出问题了,尝试再次重启后金鼎右下角的字样 从 B4 -> … … ->92, 最后的结果依然是无果,至此,我心已凉,一首凉凉送给自己。唐锅和我说了大概问题情况,并和我说下解决思路后便说我在乱弄哦,怎么能在未知的情况下清楚配置呢等等,想念学生时光啊!!!【该流程近乎40min】
- 此刻已知结果了,系统盘给我干废了,时间已然来到了晚上的 12 点左右,再次事故的整体情况上报给上级,说明情况,最终讨论的结果是现将这台节点从关机,要么明天重装系统,要么看下阵列卡是否有问题,在买块新的阵列卡试下,具体操作等明天王哥线下来操作!
- 第一次重启系统,开机,亮屏,各种初始化,校验完成,等待启动,最终在启动时,显示网络超时【该流程近乎20min】
-
那时间流转至此,已然来到了凌晨 时分,匆匆收拾回家睡觉,等待明日的,哦不今日的修复!
Fix
已然知晓酿成大祸,故开始修复之路!流程如下:
-
早上 9 点左右到达公司, 想着再次重启看看还有没有希望, 结果依然进度卡在 92 字样
-
早上 9.30,王哥抵达公司,直接将 两块系统盘拆下,用 DG(DiskGenius)查看系统数据是否还存在,两块盘点开一看, 空空如也,再次尝试找回删除的分区,但是时间已然过去 10多个小时,数据已然找不回来了【该流程近乎30min】
-
然后我也将昨晚 唐锅 说的磁盘阵列的问题给 王哥 说了,王哥将磁盘阵列卡拆下校验后也问题不大,故该事故的解决方式只能是重装系统了【该流程近乎30min】
-
王哥 将两块磁盘用 DG 格式化后装入服务器,并做了 raid1的磁盘阵列,而且让王哥把我整的 raid5给删了,重新创建一个新的磁盘阵列,并选择最后一块盘位热备盘。
-
这里吐槽下啊,不知道到时浪潮的问题还是这个阵列卡的问题,选择热备盘的逻辑极其繁琐,我和王哥找了好一会理清逻辑。具体逻辑大致为:
- 选中12块盘后,必须要在高级中选在初始化后才能选择热备选项
- 然后退回到 Virtual Driver Management 将最后一块盘给设定为热备盘
-
,如果是阵列卡的问题,那浪潮的 bios 也很不人性化,反正就是不好用,DELL 的在配置 raid 的热备盘中就直接选项可以直接点击选中,就很人性化, 浪潮,你就慢慢学吧!

-
-
那流程流转至此, 时间已然来到了 10:30左右, 接下来的操作便是 王哥操作其他节点的 raid5 的磁盘阵列操作,我安装这台重装系统的节点。王哥操作这每台节点的磁盘阵列速度那是噌噌噌的啊,最影响的还是浪潮的初始化和快速启动时间,王哥说,DELL 的快速启动差不多 1min 左右,而这 浪潮 的快速启动,哦不,好像么滴快速启动,因为不快速,整体启动至少15-20min。浪潮,你就慢慢学吧!【该流程近乎 1h】
-
那流程流转至此, 时间已然来到了 11:30左右,启动各个节点,配置重装节点的网络后,便 ssh 远程操作,磁盘的挂载分区操作了,终于离开了呜呜作响的机房了。
-
那接下来的配置便是查询 VD 的UUID, 并挂载在指定目录,该流程在此就不在赘述了,在网优秀博客比比皆是!
-
8台节点全部挂载调试完成后,用 dd 命令测试各个节点的 数据盘读写性能:
-
测试写速度
dd if=/dev/zero of=./test1.img bs=1G count=10 oflag=dsync
-
测试读速度
dd if=/storage/test1.img of=/dev/null bs=1G count=10 iflag=direct
-
8台的性能均在写 800MB+/s, 读取的速度在 1.7GB+/s
-
-
后续的优化便是将在浪潮的BMC 中设定 SMTP,一般服务器出问题直接给我们发送邮件以获悉情况, 但是浪潮的 SMTP 设置是真难用,且理解不透,

已经设定的很规范了,但是依然设定失败,一点也不人性化。浪潮,你就慢慢学吧!
- 那流程流转至此, 时间已然来到了 下午的 2点 左右,8台节点的升级调试逻辑全部完成,接下来便是一步步的安装服务,恢复业务,但是难度很大,相关影响的业务也只得无限期延后了!
Result
在本此的升级过程中,由于小白操作,经过 21 个小时的修复和补救逻辑,才使得部分业务可以启动,而那些重装系统致使服务逻辑断裂,业务至此无限期延后。以此本文也劝诫大家,在这中专业的领域中,还是需要专业人做专业事的,切勿以为自己会一点就去上手,否则造成的后果无法形容哦!
另外,编写该文档较为仓促,解决过程并能及时做到图文并茂,且后期确实难敢复现,还请谅解!
Discussion
也想借本文和大家讨论下一下几点:
- 浪潮的 SMTP 如何设置,网查的配置都无效,且很老了
- 你们遇错也会无限死循环吗?如果有,如何快速跳出来呢?
Note
唐锅:我学生时期的外聘云计算老师,化学出身,先后从化学厂员,由于环境和身体原因弃厂转编程,一路狂飙之现在的 云计算/大数据 运维开发 “老法师”!
王哥: 我们公司的长期的运维外包老哥,我们造成的烂摊子,基本都交给王哥了。
更多推荐
所有评论(0)