简介这份文档是IBM System x3650 M3服务器RAID配置的实操指南主要面向需要独立完成存储阵列部署的服务器运维工程师、系统集成商和机房管理人员。内容围绕ServeRAID MR系列控制器的WebBIOS配置工具展开按实际配置顺序介绍了启动进入配置界面的快捷键、多控制器选择方式、逻辑视图与物理视图的区别以及适配器属性、虚拟磁盘、物理磁盘、热备盘、事件日志等常用菜单的具体作用。同时文档重点说明了配置向导中清除配置、新建配置、添加配置三种模式的差异和数据安全风险并对RAID 0、1、5、6、10各等级在冗余能力、性能表现和可用容量上的特点做了归纳。整个资源为单个doc文档压缩包大小约1.31MB便于下载后直接在服务器旁查阅或打印。目前该资源已有104人学习下载适合刚接触IBM服务器RAID配置的入门者也适合需要快速核对WebBIOS菜单功能的日常运维人员作为参考手册。1. x3650 M3 做 RAID为什么绕不开 CtrlH一台老服务器的开篇接手一台转手过好几轮的 IBM System x3650 M3最头疼的不是机器点不亮而是它插着六块盘你却不知道哪块是系统盘。开机自检的时候每块硬盘都正常亮灯进系统之后只能看到一块盘十有八九是上一手把 RAID 配置留在阵列卡里或者阵列压根没建。这台 2010 年前后发布的服务器到今天还大量出现在旧机房、二手市场、虚拟化测试环境里靠的是 Intel 5500 平台配 ServeRAID 阵列卡的成熟组合。所谓“做 RAID”在 M3 上基本就是一件事开机按 CtrlH 进入 WebBIOS把物理盘组织成虚拟驱动器。这篇文章把完整流程、参数取舍、批量命令和容易翻车的几个现场一次讲清楚。2. 动手之前先认硬件M5015 与 M1015 的差别、RAID 级别怎么选x3650 M3 整个生命周期里出现过两种主流的盘控方案板载的 M1015 和 PCIe 插槽上的 M5015。你在网上搜“x3650 m3 raid”出来的问题帖一半以上的翻车现场都跟这两块卡分不开。做规划之前先低头看一眼机器别上来就按快捷键。2.1 一眼认出 M5015 还是 M1015M1015 是 LSI SAS2008 芯片的方案通常板载直连背板没有独立缓存也没有电池。M5015 是 LSI SAS2108 芯片带 512MB 缓存和一颗可更换的 BBU 电池一般插在机箱后部或侧面的 PCIe 槽上。区分方法很简单开机进 WebBIOS 之后看 Adapter 信息里有没有 Cache Size 和 BBU 字样有就是 M5015另外直接拆侧板看阵列卡上有没有一块小方电池也能一眼认出来。这两张卡决定了你能用的 RAID 策略。M1015 没有缓存做 RAID 5 的随机写入性能很难看因为每条写 I/O 都要做奇偶校验并落到物理盘上M5015 有写缓存加电池保护RAID 5 的写入才有实用价值。所以配置之前先确定手里是哪张卡后面的 Write Policy 和 RAID 级别选择都依赖这个前提。提示如果手头机器连 WebBIOS 都进不去先别急着拆机。很多情况下不是硬件坏了而是阵列卡的 Option ROM 被上一手关闭具体处理方式看第 5 章。2.2 RAID 0/1/5/10 的区别与选型一张表讲透“RAID 0 1 5 10 区别”是搜索这个标题时最常被带出来的问题。在 x3650 M3 上M5015 支持 RAID 0、1、5、6、10 和 50、60M1015 也能支持其中大部分级别但硬件缓存差异让实际表现差很多。先看这张选型表级别最少盘数可用容量随机写表现容错能力M3 上建议用途RAID 01100%好无临时计算数据、测试环境RAID 1250%一般1 块盘操作系统盘RAID 53(n-1)/n差写惩罚1 块盘数据盘、备份存储RAID 10450%好每个镜像组 1 块数据库、虚拟机存储M3 最常见的组合是两块 SAS 10K 盘做 RAID 1 装系统四块以上盘做 RAID 5 或 RAID 10 放业务数据。RAID 0 在服务器上只建议放临时数据坏了能重新生成的东西才丢上去。机器内存小于 64GB、跑传统数据库的数据盘优先 RAID 10因为 RAID 5 在随机写入场景下延迟偏高如果是文件服务器、备份库这类顺序读写为主RAID 5 的容量利用率更好。2.3 盘位、背板与 SSD 混插的边界x3650 M3 前面板有 2.5 英寸或 3.5 英寸盘位背板同时支持 SAS 和 SATA。配置之前把每块盘的型号、容量、序列号顺着盘位记下来不要相信盘位标签。很多时候上一手把盘插乱了你在 WebBIOS 里看到的是按背板端口枚举的编号不是物理位置。M3 这代机器对 SSD 的支持属于“能用但别指望高速”因为背板是 6Gbps SAS 接口SATA SSD 也能识别但没有 U.2/NVMe 的概念。如果计划用 SSD 做虚拟化缓存SATA SSD 直连阵列卡做 RAID 1 可行但不要和老机械盘混在同一组里。3. WebBIOS 建阵列全流程从 CtrlH 到系统认盘的分步操作M3 上没有图形化的 RAID 管理界面WebBIOS 就是最直接的交互入口。这章按实际操作的顺序走一遍每个界面选什么、为什么这样选边上解释到位。3.1 如何进入 RAID 设置进 WebBIOS 前的两个 BIOS 开关开机自检时屏幕下方会出现类似 “Press for WebBIOS” 的提示这时候按 CtrlH 就能进入阵列卡配置界面。但如果你发现这个提示根本没出现或者按了没反应先检查两个地方。第一个是 F1 进入的 UEFI Setup 里Devices and I/O Ports 菜单下阵列卡的 Option ROM 必须设为 Enabled。这个开关控制着自检时是否加载阵列卡 BIOS被关掉后 CtrlH 自然失效。第二个是启动模式如果 BIOS 设成 UEFI Only部分 M5015 固件版本不会显示 WebBIOS 入口需要改成 Legacy Only 或 Both。和浪潮、曙光服务器开机按 CtrlR 进 RAID 的方式不同IBM 的 x86 服务器走的是 CtrlH这个差异经常让习惯了其他品牌的运维在 M3 上找不到北。# 传统 BIOS 引导下开机自检按 F1 进入 UEFI Setup # 在 Devices and I/O Ports 菜单中确认 # IBM ServeRAID M5015 (or M1015) Option ROM Enabled # 若使用 UEFI 引导需要在 Boot Manager 中选择 # IBM ServeRAID M5015 Configuration Utility 作为启动项这段操作里最关键的是 Option ROM 开关和启动模式两个前提。M3 的 UEFI 菜单是 IBM 定制过的不要拿其他品牌服务器的 BIOS 菜单结构去套。如果机器跑的是传统 Legacy 引导只需确认 Option ROM Enabled然后重启等 CtrlH 提示即可。3.2 从 Configuration Wizard 到 Virtual Drive 创建进入 WebBIOS 后会先让你选控制器如果机器插了多块阵列卡会列出多个 Adapter选中目标卡后点 Start。主界面左侧是菜单树右侧是物理盘和虚拟驱动器状态。创建阵列的入口在 Configuration Wizard这里有几个关键选项# Adapter Selection选择 M5015 或 M1015 - Start # 主界面 - Configuration Wizard - New Configuration # New Configuration 会清空所有虚拟驱动器除非是全新机器否则先确认旧配置没用 # 配置方式选 Manual不要选 Redundant后者会自动重组旧配置容易出歧义 # 从 Available Drives 中勾选物理盘加入 Drive Groups # 点击 Accept DG 后进入 Virtual Drive 配置界面 # RAID Level RAID5 # Select Size 使用全部容量 # Strip Size 256KB # Read Policy Read Ahead # Write Policy Write Back with BBU # IO Policy Direct # Initialize 选择 Initialize 做后台初始化 # Accept - Yes - 回到主界面确认 Virtual Drive 状态为 OptimalManual 配置方式意味着你自己控制哪些盘进阵列、什么级别、什么策略逻辑清晰排查问题也方便。Strip Size 的取值影响顺序读和随机读的比例OLTP 类数据库建议 64KB大文件存储建议 256KB。Read Policy 选 Read Ahead 适合顺序读混合负载可以选 Adaptive Read Ahead让阵列卡自己判断。Write Policy 单独说有 BBU 的 M5015 选 Write Back with BBU性能最好M1015 没有电池选 Write Back 会出现掉电丢缓存数据风险建议选 Write Through。3.3 初始化、启动项与系统识别创建完成后虚拟驱动器处于 Initializing 状态。初始化有三种选择No Init 速度快但元数据没完全建立生产环境不建议Fast Init 几秒完成标记后台慢慢建Full Init 耗时最长但最干净。我一般用 Full Init同时继续装系统或做其他事等初始化在后台跑完。# 阵列状态确认WebBIOS 主界面查看 Virtual Drive 状态 # 状态为 Optimal 表示阵列正常 # 状态为 Degraded 表示有盘掉线先别急着装系统 # Raid Level 栏确认是 RAID5 / RAID1 / RAID10别把级别建错装系统时还有一个常见问题Windows Server 2008 R2 或 2012 安装界面认不到逻辑盘需要提前加载 MegaRAID 驱动Linux 发行版一般能直接识别到 /dev/sda。如果你在 UEFI 引导下装系统记得启动项里选虚拟驱动器而不是把物理盘当作启动设备否则重启后可能又掉回 BIOS。阵列建完、系统装好之后还有一件事要在这一章收尾把控制器型号、固件版本、逻辑盘序号、物理盘序列号记录下来后续排障全靠这份台账。4. 批量配置不靠鼠标用 MegaCLI 与 storcli 在 Linux 下快速建 RAIDWebBIOS 适合一台台处理但一次性配置十几台 M3或者机器放在远端机房只给你 SSH再用界面操作就不现实了。M5015/M1015 都是 LSI 芯片Linux 下可以用 MegaCLI 和 storcli 做同样的操作。这一章解决一个具体问题Linux 如何查询是否有 RAID、怎么批量建阵列。4.1 MegaCLI 的安装与查询命令先摸清现有阵列MegaCLI 是 LSI 为 MegaRAID 系列提供的命令行工具IBM 的 OEM 版本也沿用这套命令。安装后执行文件通常在 /opt/MegaRAID/MegaCli/ 目录下。装完第一件事不是建阵列而是查询当前状态# 查看阵列卡整体信息 /opt/MegaRAID/MegaCli/MegaCli64 -AdpAllInfo -aALL # 查看所有逻辑盘的状态级别、容量、状态 /opt/MegaRAID/MegaCli/MegaCli64 -LDInfo -Lall -aALL # 查看物理盘状态里面包含 Enclosure 和 Slot 编号 /opt/MegaRAID/MegaCli/MegaCli64 -PDList -aALL-aALL 表示对所有阵列卡执行-Lall 表示列出全部逻辑盘。PDList 输出里最有用的是 Firmware state 字段Online 表示这块盘正常在阵列里Rebuild 表示正在重建Failed 就是已经掉了。另一个关键信息是 Enclosure Device ID 和 Slot Number这两个数字会直接用在后面的建阵列命令里。4.2 用 MegaCLI 创建、删除阵列的参数说明查询清楚之后创建阵列就是一条命令的事。MegaCLI 用方括号把盘位分组格式是 [EnclosureID:SlotNumber]多块盘用逗号分隔# 三块盘创建 RAID5Enclosure 252 的 0、1、2 号槽位 /opt/MegaRAID/MegaCli/MegaCli64 -CfgLdAdd -r5 [252:0,252:1,252:2] -a0 # 两块盘创建 RAID1 /opt/MegaRAID/MegaCli/MegaCli64 -CfgLdAdd -r1 [252:5,252:6] -a0 # 删除逻辑盘注意数据会全部清空 /opt/MegaRAID/MegaCli/MegaCli64 -CfgLdDel -L0 -a0-a0 后面的数字是 Adapter 编号单卡机器就写 -a0。创建 RAID 5 三块盘可用容量约等于最小盘容量乘以两块盘的大小如果有盘容量不一致阵列按最小容量盘计算。删除命令 -CfgLdDel -L0 表示删除第一个逻辑盘执行前一定用 LDInfo 确认 L0 是你要删的那组这条命令没有后悔药。4.3 storcli新系统里的替代工具与 ESXi 场景MegaCLI 的旧版本在 RHEL 7/8、Ubuntu 18 以上的 glibc 版本里经常报错这时候建议用 storcli命令语法更统一输出也更易读# 查看控制器和逻辑盘状态 storcli /c0 show # 创建 RAID10Enclosure 252 的 0~3 号盘 storcli /c0 add vd typeraid10 drives252:0-3 sizeall # 查看某一块物理盘的具体信息 storcli /c0/e252/s0 show/c0 是控制器 0/e252 是 Enclosure 252/s0 是 0 号槽位drives252:0-3 表示连续槽位的简化写法。如果你要管理的机器跑的是 ESXiMegaCLI 不具备直接安装条件storcli 也没有原生版ESXi 场景我一般分两步先用 Linux 引导盘把 RAID 建好确认逻辑盘状态 Optimal再正常安装 ESXi。还有一类情况是安装 ESXi 时认不到逻辑盘这通常不是阵列问题而是安装镜像缺 M5015 的驱动属于第 5 章要展开的一个翻车点。5. 避坑x3650 M3 配 RAID 最容易翻车的五个现场M3 这代机器的问题有个特点故障本身不复杂但症状藏得深。以下五个现场是我在实际处理中遇到过的经典场景按“现象 → 原因 → 解决”的路径记录方便你对照排查。5.1 开机按 CtrlH 没反应自检提示一闪而过现象开机自检时看不到 “Press for WebBIOS” 提示或者看到了但按键没反应系统直接进入启动流程。原因最常见的是阵列卡 Option ROM 被上一手在 BIOS 里关闭了自检阶段根本不加载 WebBIOS。其次是启动模式改成 UEFI Only 后部分固件版本不再显示传统入口。还有一个容易被忽略的细节键盘插在 KVM 延长线或 USB HUB 上BIOS 阶段枚举不到。解决F1 进 UEFI SetupDevices and I/O Ports 里把阵列卡 Option ROM 设为 Enabled启动优先级改成 Legacy Only 或 Both键盘直接插机箱前面板 USB 口再重启试一次。这三步能解决九成以上的进不去问题。5.2 新盘上机全部变成 Foreign 状态现象把上一台机器拆下来的盘插进 M3WebBIOS 里硬盘状态不是 Ready 而是 Foreign配置向导里无法把这些盘加入新阵列。原因盘上残留了上一块阵列卡的 RAID 元数据。M5015 或 M1015 检测到非本控制器生成的配置会把它标记为 Foreign Configuration防止你误操作覆盖数据。解决先确认盘上没有你需要保留的数据然后 WebBIOS 主界面选择控制器点击 Clear Foreign Configuration 清除残留配置。清完之后盘的 Firmware state 会变成 Ready再进 Configuration Wizard 正常创建阵列。注意如果机器里存在多块卡的旧配置清除前逐一确认是哪个 Adapter 的。5.3 BBU 报错后写性能骤降阵列卡自动降级现象日志里出现 BBU failed 或 battery learning cycle 报错WebBIOS 里 Write Policy 从 Write Back 自动变成 Write Through数据库写入延迟明显升高。原因M5015 的电池几乎永远处在“充电 → 自检 → 学习放电 → 再充电”的循环里。电池老化或者学习周期触发时阵列卡检测不到掉电保护能力自动把写策略降级为 Write Through性能随之塌陷。解决用 MegaCLI 的 AdpBbuCmd -GetBbuStatus 查看电池状态状态不是 Optimal 就考虑换新电池。新电池装上后要允许它跑完一次完整的充放电学习学习期间性能会偏低规划好维护窗口。创建阵列时把 Write Policy 显式选为 Write Back with BBU让阵列卡了解你有电池保护而不是让它自动揣测。5.4 装 ESXi 认不到逻辑盘现象WebBIOS 里阵列状态明明 Optimal但 ESXi 安装界面只看到本地 USB 或 SATA 设备逻辑盘完全不显示。原因ESXi 安装镜像里没有包含 M5015 的 MegaRAID 驱动。老版本 ESXi 的兼容性列表里能找到新版本官方逐步移除了对 M3 平台的支持需要手动注入驱动。解决常见做法是用 IBM 官方提供的 M5015 驱动文件配合 ESXi Image Builder 打包一个自定义安装镜像或者用带驱动的启动盘。图省事的话先装 Linux 把阵列建好并确认系统能识别到 /dev/sda再考虑 ESXi 的驱动问题。5.5 换上新盘后重建反复失败Rebuild 卡死在半路现象某块盘报警换上同容量的新盘后自动开始重建但执行到中途 Rebuild 失败阵列状态一直停在 Degraded。原因现在市面上的大容量 SATA 盘大量采用 SMR 叠瓦式记录这种盘的重建过程是长时间随机写负载SMR 盘写放大严重容易超时掉盘。老阵列卡的固件对 SMR 盘的容忍度很低这也是最近几年“换新盘反而翻车”的主要源头。解决M3 这种老平台换盘优先选 SAS 10K 盘或企业级 CMR 的 SATA 盘数据库和虚拟化场景尤其不要用消费级 SMR 盘。买盘前查清楚型号是 SMR 还是 CMR可以通过盘片数、缓存大小等参数做初步判断。别为了省预算在关键阵列里混入 SMR 盘重建失败的恢复成本远高于省下的差价。6. 阵列建完不是结束验证、重建演练与日常巡检配置完成只是第一步。一个 RAID 能跑三五年不出岔子靠的是建完后的验证和长期巡检。我的固定套路是下面这三件事每件都不复杂但缺一件都容易在关键时刻被坑到。6.1 用命令验证状态认准几个关键字段# 查看逻辑盘状态和重建进度 /opt/MegaRAID/MegaCli/MegaCli64 -LDInfo -Lall -aALL # 查看物理盘错误计数重点看 Media Error 和 Other Error /opt/MegaRAID/MegaCli/MegaCli64 -PDList -aALL | grep -E Firmware state|Media Error|Other ErrorLDInfo 输出里看 State 是否为 Optimal以及如果有重建在跑能看到重建进度百分比。PDList 的 Media Error 和 Other Error 两个计数正常应该是 0只要出现非零值不管系统跑起来有没有异常都该提前准备更换这块盘。错误计数是磁盘健康度最直接的信号比看指示灯靠谱。6.2 换块盘做一次真实的重建演练头一回给 M3 换盘时建议在业务低峰期做一次演练用 LDInfo 确认哪块是数据盘拔掉它观察阵列状态变成 Degraded再插回去触发自动重建全程盯着 PDList 里的 Rebuild 进度。拔错盘的概率比你想象的高尤其是多台机器堆在一个机柜里、盘位标签又模糊的情况下。演练一次之后你才能确认自己记录下来的 Enclosure 和 Slot 编号是对的真正出故障时不会手忙脚乱。6.3 电池保养与巡检习惯# 查看 BBU 电池状态 /opt/MegaRAID/MegaCli/MegaCli64 -AdpBbuCmd -GetBbuStatus -aALL # 手动触发一次电池学习便于安排维护窗口 /opt/MegaRAID/MegaCli/MegaCli64 -AdpBbuCmd -BbuLearn -a0电池的自动学习周期默认是三个月左右学习期间写策略会短暂降级。如果业务不允许动不动性能跳水可以手动触发学习把时间安排在计划停机窗口。我的习惯是每次配完阵列把控制器型号、固件版本、VD 序号、物理盘序列号和换盘记录写进维护台账下次任何人接手都不用再猜。M3 上那些说不清的 RAID“玄学”故障拆开看大多是掉电策略、驱动加载、盘类型这三个基础问题没排干净。希望这篇能帮你的 x3650 M3 从一块黑匣子变成一张清清楚楚的配置单少走几步弯路省几次返工帮到你。本文还有配套的精品资源点击获取
