Abstract

​ 由于业务的繁重和服务的长期使用压力,现需要将 8 台浪潮的节点进行物理设备的升级,升级的主要板块如下:

  1. 每台节点共上新数据盘11块,每块容量为 16T

  2. 每台节点共上新内存条12条,每条容量为 64G

  3. 基于新上的数据盘做 磁盘阵列 raid5 操作,并冗余留一块数据盘做 热备盘

    主体业务便是这些, 中间产生一系列的小白无脑操作,专业运维工程师的操作都会一一叙述

Introduction

​ 每条节点的具体环境如下所示:

  1. 服务器为 Inspur Server, 也就是大家熟知的 浪潮 服务器,很多运维老哥称之为 洋垃圾
  2. CPU 为两颗 Socketo: Intel(R) Xeon(R) Platinurm 8163 CPU @ 2.50GHZ, 英特尔的至强白金系列
  3. 内存为 12 条 三星的 DDR4, 2666MHZ 的 64G 内存条, 共 768GB
  4. 系统储存为 2 块 三星1T SSD,并做 磁盘阵列 raid1
  5. 数据储存为 1 块 西数企业级 16T HDD
  6. 网络层面为 2 个 千兆 电口 和 2个万兆 光口

Upgrade

​ 本人只在学生时期整理过服务器的组装,设备硬件等升级操作,但操作的均是 DELL 服务器,和现在的 浪潮 整体对比, DELL 的 Bios 和 Raid 设定和 后台 BMC 还是相当人性化的,浪潮 还在下去再沉淀沉淀!

​ 主要升级的内容如下:

  1. 数据储存为 11 块 西数企业级 16T HDD, 并做 磁盘阵列 raid5 + 1块热备盘

  2. 内存为 12 条 三星的 DDR4, 2666MHZ 的 64G 内存条, 共 768GB

    在这里插入图片描述

​ 本次的升级的主体难度无非就在磁盘安装好后的 raid5 操作,其余均是脏活累活,之前也整过磁盘的 raid 操作,故本小白 “艺高人胆大” 的勇担本次升级业务的 ”重担“,道路多坎坷啊!

Process

​ 在网上查询多篇升级或做磁盘阵列的操作blogs, 最终选择了影响我一生的一篇 浪潮服务器怎么重做raid 、设置pxe 启动, 具体流程如下所示

  1. 下午 5 点开始和另外三名小伙伴开始拆服务器的硬盘架,并与新的硬盘进行绑定,该步操作耗费了我们差不多 2 个小时左右的时间
    在这里插入图片描述

  2. 时间来到了晚上的 7 点左右,在将现有的服务关停后,关闭服务器,开始安装 储存 和 内存设备; 升级的初步逻辑是先单独升级一台,升级成功后有了思路和经验,后续的 7 台节点岂不是轻松拿捏,故开始软件侧的升级流程… …

  3. 依据该博客的 step4 逻辑将启动模式从 传统模式 调整为 UEFI 模式 后重启服务器成功在 Bios 中找到 raid 的控制界面
    在这里插入图片描述

  4. 致命的操作来了:依据博客的 step7.2 步骤,选择清除当前的配置, 糊里糊涂的就在周边小伙伴的注视下就 confirm 这步操作。如果是小白可能不太清除该步骤的影响力有多大,具体的影响如下:

    1. RAID 配置被删除

      • RAID 级别失效:当前的 RAID 级别(如 RAID 0、RAID 1、RAID 5 等)会被清除,磁盘将恢复到非 RAID 状态。
      • 虚拟磁盘消失:由 RAID 控制器创建的虚拟磁盘(Virtual Disk)将被删除,操作系统将无法识别之前的 RAID 阵列。
    2. 数据丢失风险

      • 数据不可访问:清除 RAID 配置后,阵列中的数据将无法访问,因为 RAID 元数据(描述磁盘如何组成阵列的信息)已被删除。
      • 数据恢复困难:如果没有备份,恢复数据可能会非常复杂,需要专业的数据恢复工具和服务。
    3. 磁盘状态恢复为单盘

      • 磁盘将恢复为独立的物理磁盘,操作系统会将其识别为单独的硬盘,而不是 RAID 阵列的一部分。
    4. 需要重新配置 RAID

      • 如果需要继续使用 RAID,必须重新进入 BIOS 或 RAID 配置工具,重新创建 RAID 阵列。
      • 重新配置 RAID 时,可以选择相同的 RAID 级别或其他级别,但需要重新初始化磁盘,这会导致磁盘上的所有数据被清除。
    5. 操作系统可能无法启动

      • 如果操作系统安装在 RAID 阵列上,清除 RAID 配置后,系统将无法找到启动分区,导致无法启动。
      • 需要重新安装操作系统或从备份中恢复系统。

    OK, 不知道大家还记得本文的主体逻辑是升级,并不是安装,前文提到的每台节点都是存在 2 块 1T 的raid1的系统盘的,那该步骤的 confirm 操作直接导致的是 该节点的系统盘的数据直接被 抹掉了,但在当时我是并不知道该步骤操作的严重性的,依然继续往下走

  5. 查看 12 块 HDD 状态

    在这里插入图片描述

  6. 忽略博客的步骤7.3 的格式化硬盘,全是新盘,在后续挂载操作在格式化分区接口,故直接点击 Create Virtual Drive ,指定 raid 为 raid5,并选择 12 块盘创建 virtual dirver,最后再保存配置便完成了我认为的升级差不多的流程了

    在这里插入图片描述

  7. 最后依据博客的step8步骤查看 Configuration Management.View Driver Group Properties 去查看创建好的 VD

    在这里插入图片描述

    并再次点击去查看该 VD 详情【其实细心看的小伙伴这里是已经可以看出来端倪了,因为这里只有数据盘的 raid5, 并没有 系统盘的 raid1,但当时的小白再尝成功的感觉怎会知晓这种情况呢!!!】

    在这里插入图片描述

    兴高采烈地和伙伴们看着配置成功的 很简单拙劣的 raid5 配置结果,一步步回退,最后按下储存并离开吗? 选择 ,彻底断送了还能挽救这离谱操作的选项

    在这里插入图片描述

  8. 那流程流转至此,时间已然来到了晚上的 8 点左右,接下的便列举几个我在后面近4个小时中的来回循环无脑小白操作:

    1. 第一次重启系统,开机,亮屏,各种初始化,校验完成,等待启动,最终在启动时,显示网络超时【该流程近乎20min】
      • 心想怎么会是网络启动呢?启动项设定错了?
    2. 再一次重启系统,开机,亮屏,各种初始化,校验完成,浪潮是 按 F11 选择启动选项,但是在选择的时候只有两个电口和两个光口的网络设备,但在当时根本不知晓该情况,故在这样的循环中来回反复了 至少 4次!!!【该流程近乎40-50min】
      • 反复两次后伙伴们等不了了,无功并不浪费时间下只得让他们逐个关闭其他7台节点服务器,只安装内存和硬盘,其余并不做过多的操作
    3. 多次无果下,时间已然来到了晚上的 10 点左右,开始尝试找外援,先找之前的我们就找过的运维工程师,简称王哥,开始视频远程下指令,我来操作
      1. 一顿在我还在很骄傲的介绍自己的raid5的操作下,将初步的问题定位在启动项的逻辑上,故修改启动项为硬盘首选,网络与其他往后排,再次重启执行 8.1 的操作,结果依然启动不了;【该流程近乎20min】
      2. 再次启动进入 bios 后,进入 raid 仔细查看,王哥发现 为啥没有系统盘的数据呢,你磁盘当先,里面没有系统啊,肯定起不来啊,那就继续寻找系统盘,但是前文提到了:在 VD 中是查看不到系统盘的raid1的,但是在 driver 侧是能看到该有一个 水灵灵的 938G 的三星硬盘在列表里面的,然后我和王哥解释道这2块系统盘是做了 raid1 的,按道理来说数据是会备份的,故王哥让我利用 raid1 的备份机制试图将没显示的一块盘的数据通过 raid1机制将显示的这块盘的数据给备份回来,具体的操作是,将后置的两个盘随机拔出来一块【因为不知道那块是主盘】,紧接着拔掉另一块盘,在等了差不多 10 S 后,将这两块盘在插回去, 这样的步骤执行了两遍, 最后的结果是依然无果。【该流程近乎30min】
    4. 再次无果下,时间已然来到了晚上的 11 点左右,将该次事故的整体情况上报给上级,说明情况, 最终讨论的结果是现将这台节点从关机,等明天王哥线下来操作!
    5. 还不甘心的我,将求救外援之手伸向了我的老师,简称 唐锅,其实在找王哥之前,我第一时间就找了唐锅,但是当时他在开车,我就只能找王哥了,唐锅在开车到家后也问了我情况,当时在和王哥整,就没回复消息了,我在此刻给唐锅发了消息,然后问方便视频吗?唐锅说等一会,10秒后 唐锅 便打来了视频。接上发现他那边是已经睡了,他起床到客厅给我打的电话,我还准备煽情一下,唐锅直接打断,说对准屏幕,不愧是老法师!那修复流程如下:
      1. 在和我了解一下基础操作的前后逻辑, 但是我仍然判断系统还是存在的,只是启动不了而已,不知道怎么设置的 情况后之后,和我说了一句,你这个情况简单哦,我弄过的,唐锅说他的肉鸡就有我们的这款 浪潮的服务器,那前文的 “洋垃圾”,就是唐锅说的啊,我对这块确实涉猎甚少。他的初步判断是我们我们的系统是安装在磁盘阵列上的,你们启动项设定硬盘怎么行呢,故重复执行 8.1 步骤,进入bios 将启动项设定为 磁盘阵列,但是根本没这个选项,唐锅说:简单哦,你这个是不是把 boot model 设定为 UEFI 了啊,改掉, 改成其他的就行,故将 启动模式 修改为 传统模式后再重复执行 8.1 步骤后,在 boot 选项中看到了整列卡的选项,此刻我的内心是有点激动的,唐锅 让我把启动项只选择 磁盘阵列,其余选项全关闭【老法师】然后再次重复执行 8.1 步骤,此刻 唐锅 让我把视频稳住,紧紧看着启动界面的每个记录然后的东西,和我一一解释每行大概是什么意思,直至最后启动的进度条到头后不动了,屏幕右下角显示 92 的字样,唐锅说这个代码是启动盘或者次磁盘阵列出问题了,尝试再次重启后金鼎右下角的字样 从 B4 -> … … ->92, 最后的结果依然是无果,至此,我心已凉,一首凉凉送给自己。唐锅和我说了大概问题情况,并和我说下解决思路后便说我在乱弄哦,怎么能在未知的情况下清楚配置呢等等,想念学生时光啊!!!【该流程近乎40min】
    6. 此刻已知结果了,系统盘给我干废了,时间已然来到了晚上的 12 点左右,再次事故的整体情况上报给上级,说明情况,最终讨论的结果是现将这台节点从关机,要么明天重装系统,要么看下阵列卡是否有问题,在买块新的阵列卡试下,具体操作等明天王哥线下来操作!
  9. 那时间流转至此,已然来到了凌晨 时分,匆匆收拾回家睡觉,等待明日的,哦不今日的修复!

Fix

​ 已然知晓酿成大祸,故开始修复之路!流程如下:

  1. 早上 9 点左右到达公司, 想着再次重启看看还有没有希望, 结果依然进度卡在 92 字样

  2. 早上 9.30,王哥抵达公司,直接将 两块系统盘拆下,用 DG(DiskGenius)查看系统数据是否还存在,两块盘点开一看, 空空如也,再次尝试找回删除的分区,但是时间已然过去 10多个小时,数据已然找不回来了【该流程近乎30min】

  3. 然后我也将昨晚 唐锅 说的磁盘阵列的问题给 王哥 说了,王哥将磁盘阵列卡拆下校验后也问题不大,故该事故的解决方式只能是重装系统了【该流程近乎30min】

  4. 王哥 将两块磁盘用 DG 格式化后装入服务器,并做了 raid1的磁盘阵列,而且让王哥把我整的 raid5给删了,重新创建一个新的磁盘阵列,并选择最后一块盘位热备盘。

    • 这里吐槽下啊,不知道到时浪潮的问题还是这个阵列卡的问题,选择热备盘的逻辑极其繁琐,我和王哥找了好一会理清逻辑。具体逻辑大致为:

      • 选中12块盘后,必须要在高级中选在初始化后才能选择热备选项
      • 然后退回到 Virtual Driver Management 将最后一块盘给设定为热备盘
    • ,如果是阵列卡的问题,那浪潮的 bios 也很不人性化,反正就是不好用,DELL 的在配置 raid 的热备盘中就直接选项可以直接点击选中,就很人性化, 浪潮,你就慢慢学吧!

      在这里插入图片描述

  5. 那流程流转至此, 时间已然来到了 10:30左右, 接下来的操作便是 王哥操作其他节点的 raid5 的磁盘阵列操作,我安装这台重装系统的节点。王哥操作这每台节点的磁盘阵列速度那是噌噌噌的啊,最影响的还是浪潮的初始化和快速启动时间,王哥说,DELL 的快速启动差不多 1min 左右,而这 浪潮 的快速启动,哦不,好像么滴快速启动,因为不快速,整体启动至少15-20min。浪潮,你就慢慢学吧!【该流程近乎 1h】

  6. 那流程流转至此, 时间已然来到了 11:30左右,启动各个节点,配置重装节点的网络后,便 ssh 远程操作,磁盘的挂载分区操作了,终于离开了呜呜作响的机房了。

  7. 那接下来的配置便是查询 VD 的UUID, 并挂载在指定目录,该流程在此就不在赘述了,在网优秀博客比比皆是!

  8. 8台节点全部挂载调试完成后,用 dd 命令测试各个节点的 数据盘读写性能:

    1. 测试写速度

      dd if=/dev/zero of=./test1.img bs=1G count=10 oflag=dsync
      

      在这里插入图片描述

    2. 测试读速度

      dd  if=/storage/test1.img of=/dev/null bs=1G count=10  iflag=direct
      

      在这里插入图片描述

    3. 8台的性能均在写 800MB+/s, 读取的速度在 1.7GB+/s

  9. 后续的优化便是将在浪潮的BMC 中设定 SMTP,一般服务器出问题直接给我们发送邮件以获悉情况, 但是浪潮的 SMTP 设置是真难用,且理解不透,

    在这里插入图片描述

    ​ 已经设定的很规范了,但是依然设定失败,一点也不人性化。浪潮,你就慢慢学吧!

    1. 那流程流转至此, 时间已然来到了 下午的 2点 左右,8台节点的升级调试逻辑全部完成,接下来便是一步步的安装服务,恢复业务,但是难度很大,相关影响的业务也只得无限期延后了!

Result

​ 在本此的升级过程中,由于小白操作,经过 21 个小时的修复和补救逻辑,才使得部分业务可以启动,而那些重装系统致使服务逻辑断裂,业务至此无限期延后。以此本文也劝诫大家,在这中专业的领域中,还是需要专业人做专业事的,切勿以为自己会一点就去上手,否则造成的后果无法形容哦!
​ 另外,编写该文档较为仓促,解决过程并能及时做到图文并茂,且后期确实难敢复现,还请谅解!

Discussion

​ 也想借本文和大家讨论下一下几点:

  1. 浪潮的 SMTP 如何设置,网查的配置都无效,且很老了
  2. 你们遇错也会无限死循环吗?如果有,如何快速跳出来呢?

Note

唐锅:我学生时期的外聘云计算老师,化学出身,先后从化学厂员,由于环境和身体原因弃厂转编程,一路狂飙之现在的 云计算/大数据 运维开发 “老法师”!

王哥: 我们公司的长期的运维外包老哥,我们造成的烂摊子,基本都交给王哥了。

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐