中科曙光服务器培训全解析:从硬件选型到系统部署与排障
简介这是一份面向服务器基础知识入门与培训场景的PPT课件适合运维新人、技术支持工程师以及需要系统了解服务器构成与分类的读者可作为企业内训或个人自学的参考材料。课件从服务器基本定义讲起通过与PC机、工作站、小型机的多维对比梳理了塔式、机架式、刀片式等外形分类并按CPU数量、指令集架构、应用功能等维度展开介绍同时涵盖硬件部件与服务器软件基础帮助读者建立完整的知识框架。目前已有600人学习浏览说明这套基础内容对不少入门者有帮助。整包内容为1个pptx文件大小约42.47MB内容集中在一个文档内便于随开随学。对于刚接触服务器或准备开展内部技术分享的读者这份课件提供了清晰的知识脉络和可直接使用的培训素材能有效缩短自学摸索时间。1. 中科曙光服务器培训 PPT 教什么从零认识一台能上架的服务器拿到这份《中科曙光服务器培训教程汇总服务器基础知识-v0.3.pptx》的人多半是刚接手机房、或者准备从桌面运维转向服务器方向。这份材料把零散的知识点压到了一个多小时的培训里硬件构成、BMC 带外管理、RAID 阵列、系统安装和基础排障。这里不把 PPT 念一遍而是按一线运维的干活顺序把这套东西捋成一版能直接照着做的流程——从开箱加电到能装系统再到日常维护。看完之后至少敢接一台裸机回来自己配完。适合没上过手的新手也适合给讲培训的老师当提纲。2. 认识曙光服务器的“四件套”CPU、内存、硬盘与阵列卡怎么选服务器培训的第一课永远是硬件认知但很多人把它背成了型号大全。实际上选型只要抓住一件事这台机器将来跑什么。跑数据库、跑虚拟化、跑日志采集选型方向完全不同。下面按一套通用的 2U 机架式服务器展开兼顾最常见的 12 盘位和 24 盘位场景。2.1 CPU 与内存先看业务跑什么再决定买什么配置机架式服务器通常是双路 CPU 设计也就是主板上开两个 CPU 插座。中科曙光的主流机型同样沿用了这个结构好处是内存插槽跟着翻倍整机的并发处理能力也线性提升。选 CPU 不是单纯看核心数核心数、主频、缓存和指令集是四个维度数据库和大数据分析这类应用吃主频和内存带宽虚拟化平台吃核心数科学计算则更看重缓存与向量指令集。如果业务是多个虚拟机在同一台物理机上跑核数要多主频反而可以适当让一让。内存方面服务器必须用 ECC 校验内存不能拿家用内存往上顶。常见形态是 RDIMM 和 LRDIMMRDIMM 兼容性好、价格适中LRDIMM 适合插满大容量内存的密集场景。这里有个容易被忽略的点内存通道。双路服务器的内存控制器分布在两颗 CPU 上内存条要按通道配对插最好先插满近端通道再扩展远端通道。我见过不少机器配了 16 根内存槽只插了 2 根业务一上就出现性能瓶颈查下来才发现插法不对内存带宽只跑了一小半。内存容量没有绝对标准但有一个经验线跑虚拟化至少给每台虚机预留 2~4G 的额外开销跑数据库先算业务热数据量再乘 1.5 的余量。容量可以冗余但插法必须正确否则再大的内存也发挥不出来。服务器培训里最常考的就是这种“看起来简单、实际上决定成败”的细节。2.2 硬盘形态与接口从 SATA、SAS 到 NVMe 的取舍硬盘是服务器里故障率最高的部件也是选型时最容易纠结的部分。先分清接口和形态接口决定传输速度形态决定物理尺寸。当前主流的接口有三种各自的适用场景差异明显。接口典型速率常见形态适用场景价格倾向SATA6Gb/s3.5 寸 7.2K 企业盘大容量归档、备份、冷数据低SAS12Gb/s2.5 寸 10K/15K传统数据库、高并发小文件中NVMe U.2PCIe 3.0/4.02.5 寸 / EDSFF高性能数据库、虚拟化存储高SATA 和 SAS 的盘位通常可以混插但阵列卡和背板必须支持。SAS 背板可以兼容 SATA 盘反过来不行。NAS 或者分布式存储跑大文件顺序读写SATA 企业盘就够用数据库在线事务处理这种随机读写密集的场景SAS 或者 NVMe 更稳妥。NVMe 的延迟能低到几十微秒对数据库日志、虚拟化存储这类写敏感业务提升非常明显但价格也明显上了一个台阶。看一台服务器的硬盘能力不能只看接口还要看背板和线缆拓扑。24 盘位的机型多数会分成前 12 盘和后 12 盘两组接不同的阵列卡控制器。做培训材料时我建议把整机硬盘拓扑图画出来标清楚哪块盘接在哪个控制器上后面做 RAID 时才不会把盘选错。2.3 RAID 级别怎么选容量、性能、安全三者只能取二服务器磁盘阵列怎么做是培训里问得最多的话题。RAID 的本质是把多块物理盘组合成一个逻辑盘核心目标有两个冗余和性能。但没有任何一个级别能同时满足容量、性能、安全三个诉求选型的本质是做取舍。RAID 级别最少盘数可用容量容错能力典型场景RAID 02 块全部容量无临时计算、可重建的数据RAID 12 块50%单盘故障系统盘RAID 53 块(n-1)/n单盘故障文件服务、应用数据RAID 104 块50%每组镜像各坏 1 块数据库、虚拟化RAID 1 是系统盘的稳妥选择两块盘镜像坏一块直接换盘不用太担心系统崩溃。RAID 5 在容量上划算写性能略差因为每次写入都要计算奇偶校验。RAID 10 是性能和安全的平衡点代价是容量利用率只有一半。我一般建议系统盘 RAID 1数据盘追求容量选 RAID 5业务并发高且数据重要选 RAID 10。不建议在 RAID 5 里塞满大容量 SATA 盘比如单盘 8T 以上因为重建时间很长重建期间再坏第二块盘的风险会明显上升。阵列卡还有一个容易被忽略的参数缓存策略。带电池或电容保护的阵列卡可以开启写回模式写入性能提升明显没有掉电保护就一定用直写模式否则断电时缓存里的数据会丢。配置 RAID 时顺手把热备盘安排好全局热备比专用热备更灵活适用于同一控制器下有多组阵列的场景。注意RAID 只解决磁盘故障问题不解决误删、中病毒和逻辑损坏重要数据仍然要有一份异机备份。3. 开机即配置BMC、BIOS 与 RAID 卡配齐一台裸机新机器从开箱到能装系统中间隔着三样必须配的东西带外管理地址、启动引导方式、磁盘阵列。顺序也很固定——先配带外管理再调 BIOS最后建阵列。这样做的原因很简单带外管理配好后后续所有操作都能在远程控制台上完成不用一直蹲在机房。3.1 BMC 带外管理先给服务器配一个能远程开机的 IPBMC 是服务器上独立于操作系统的一块管理芯片只要机器通了电它就能工作。这也是服务器和个人电脑最明显的差异之一。通过 BMC 可以远程开关机、查看硬件状态、挂载安装镜像甚至接管屏幕键盘不需要操作系统先起来。机房里的常见做法是机器一上架就先给它分配一个管理网段的 IP后续的远程操作全部走带外通道。首次连 BMC需要先确认默认管理地址。新机器的 BMC 地址通常标注在机箱贴纸或快速指南上常见网段在 192.168.0.x 或 192.168.1.x 附近。也有的是出厂默认 DHCP 模式把网线插到管理口后去路由器或交换机上找它分配到的地址或者通过厂商的 IP 扫描工具直接发现。这个地址修改一般有两种途径进 BIOS 的 IPMI 配置页面或者登录 BMC 网页界面后改网络参数。这里有一个极其容易踩的坑网线插错口。一台服务器通常有两个网口区域管理口往往独立且带标识插到业务网口上是永远访问不到 BMC 的。BMC 登录后第一件事是改默认密码第二件事是开启远程虚拟介质功能。虚拟介质的意思是把你本地的 ISO 安装镜像虚拟成服务器上的一个光驱或 U 盘远程装系统全靠它。培训 PPT 里这一页往往只讲概念但实际干活时这是机房运维每天都要用的功能。3.2 BIOS 启动顺序与引导模式UEFI 与 Legacy 怎么选BMC 配好之后远程控制台上就能看到服务器画面了这时候按提示进 BIOS。BIOS 里要做的事情可以收敛成三个设置启动顺序、开启虚拟化支持、确认引导模式。启动顺序的设置直接决定机器重启后从哪个介质引导。远程装系统时要把虚拟光驱或虚拟 U 盘放到第一启动位装完系统后再把硬盘挪回第一启动位。很多人装完系统拔掉安装盘重启结果又进了安装界面就是因为启动顺序没调回来。引导模式是 UEFI 和 Legacy 二选一。现在的服务器默认基本都是 UEFI但要注意 UEFI 和 Legacy 之间切换后原来的系统会无法引导因为分区表格式不对。UEFI 配 GPT 分区表Legacy 配 MBR 分区表。新装系统、超大容量磁盘以及 NVMe 引导都建议直接选 UEFI 模式。另外虚拟化支持选项通常叫 Intel VT-x 或 AMD SVM做服务器虚拟化技术实验或部署虚拟化平台之前要确认这里处于开启状态。还有一项时间设置容易被忽略。BIOS 的系统时间最好校到当前时间再配合系统内的 NTP 时间同步避免后面看日志时时间对不上。时间混乱导致证书错误、集群节点互信失效的问题在运维中非常常见。3.3 RAID 卡建阵列把物理盘变成逻辑盘再装系统进 RAID 配置界面的方式有三条路开机自检时按阵列卡提示的快捷键多数机型是 CtrlR 或 CtrlC从 BIOS 菜单里找到阵列卡配置入口或者登录阵列卡的管理界面远程操作。第一次上手建议直接在远程控制台的键盘上操作。整个建阵列流程可以拆成六步照着做基本不会迷路第一步先检查物理盘列表确认目标硬盘都被阵列卡正确识别。这里要特别留意盘位顺序拿已经规划好的盘位图对照避免把系统盘和数据盘的物理位置搞反。第二步创建一个新的阵列配置选择要加入的物理盘。此时画面会列出所有空闲盘勾选时只看盘位编号不要靠容量猜因为同样容量的盘可能有多块。第三步选 RAID 级别和条带大小。系统盘用 RAID 1数据盘按业务场景选 RAID 5 或 RAID 10。条带大小默认 64K 通常够用如果跑大文件顺序读写可以改成 128K数据库随机读写用 64K 甚至 32K 更稳。第四步设置热备盘。在热备配置项里指定一块全局热备盘后续任何一组阵列磁盘故障它都会自动顶上。第五步初始化虚拟磁盘。初始化时间跟盘容量和数量相关大容量阵列要等一段时间。业务虚拟机可以先建阵列再初始化不耽误并行干别的。第六步检查虚拟磁盘状态确认状态为“在线”或“正常”然后退出配置界面重启服务器。RAID 配置完成后服务器才算真正具备安装操作系统的条件。很多培训教程把 RAID 和系统安装分到两节课讲实际部署中这两步经常连在一起确认阵列状态正常后直接加载系统镜像一气呵成。4. 从裸机到可用系统Linux 与 Windows 部署的完整路径服务器装系统有两条主路Linux 优先选 Ubuntu Server 或 CentOS 系发行版Windows 环境则用 Windows Server。无论选哪条流程骨架都是相通的引导介质、分区、网络配置、驱动确认。下面按实际部署顺序拆开讲。4.1 Ubuntu Server 最小化安装U 盘引导、分区与网络配置Ubuntu Server 22.04 LTS 是当前非常常见的服务器系统选择这里就以它为主线。先做一个可引导 U 盘写盘工具有很多选择默认用开源的写盘工具把 ISO 写入即可注意写盘不是复制文件要用镜像写入模式。插入 U 盘从 BMC 远程控制台挂载后重启进入安装界面后语言选 English避免编码问题。安装过程中的引导方式要与 BIOS 里的设置保持一致前面如果选了 UEFI这里就对应 UEFI 的启动项。磁盘分区建议采用下面的方案分区大小挂载点文件系统说明ESP 分区512M/boot/efiFAT32UEFI 引导必需根分区剩余空间/ext4系统与应用数据swap视内存而定无swap内存小于 16G 建议开启系统盘用 RAID 1 的场景下分区落在虚拟磁盘上正常识别即可。安装过程中勾选安装 OpenSSH server这个步骤很重要装完系统后就能直接用 SSH 连接远程管理不用再跑一趟机房接显示器。安装完成后第一个要改的就是网络配置。Ubuntu Server 22.04 用 netplan 管理网络修改/etc/netplan/01-netcfg.yaml设置静态 IP示例配置如下# /etc/netplan/01-netcfg.yaml 示例 network: version: 2 ethernets: enp1s0: dhcp4: false addresses: - 192.168.10.20/24 routes: - to: default via: 192.168.10.1 nameservers: addresses: [192.168.10.1, 114.114.114.114]这段配置里enp1s0是网卡名称要通过ip link先确认实际名称不同机型网卡名可能不一样。addresses指定服务器自身的 IP 和掩码格式是 CIDR。routes里写默认网关nameservers配置 DNS。改完后执行sudo netplan apply生效。如果远程连接突然断开多半是网卡名写错或 IP 与网关冲突通过 BMC 上的虚拟控制台回到系统里再排查。4.2 Windows Server 部署阵列卡驱动注入是第一道坎Windows Server 部署的第一步跟 Linux 一样挂载系统镜像并引导。但这里有一道新手最容易撞上的坎安装界面里看不到磁盘。表现是磁盘列表空白无法分区直接卡在选盘一步。原因基本都指向阵列卡驱动。Windows 安装镜像默认不自带服务器厂商的阵列卡驱动尤其是硬件 RAID 模式下系统看不到虚拟磁盘。解决办法是在安装界面的“加载驱动程序”入口把厂商提供的驱动文件喂进去。实际操作时驱动文件通常在厂商支持页面按操作系统版本单独下载解压后放到 U 盘或通过 BMC 的虚拟介质挂载进去。找到对应的.inf或.inf_amd64文件后系统会识别出阵列卡并列出虚拟磁盘。Windows 装完后的网络配置与 Linux 不同它默认 DHCP要注意在“服务器管理器”里把网卡改成静态 IP、加入正确的 DNS 和网关。另外Windows 系统安装完成后建议立刻启用远程桌面和防火墙放行端口后续维护就不用再去机房操作了。标题里那份培训材料把 Windows 部署放在 Linux 后面讲也是遵循从简单到复杂的教学顺序。4.3 固件与驱动升级在装系统前后各做一次很多人装完系统觉得万事大吉忽略了一个重要环节固件升级。服务器主板 BIOS、BMC 固件和阵列卡固件的版本直接决定了硬件功能的完整性和稳定性。新机器出厂时固件版本往往不是最新的厂商会在支持页面发布修复特定问题的版本比如 BMC 的存活性问题、阵列卡在特定系统下的兼容性问题。固件升级的时机建议放在装系统之前或刚装完系统之后。升级流程按厂商提供的方式进行但有几条通用的血泪经验升级 BIOS 和 BMC 时一定确保供电稳定不能断电否则可能损坏管理芯片一次只升级一个组件不要并行操作升级前检查当前版本把升级工具和固件文件放在本机磁盘不要从网络共享盘启动升级程序。阵列卡固件和驱动的匹配也要注意。高版本驱动配低版本固件或者反过来都可能出现阵列状态显示异常的问题。升级完成后重新进 RAID 配置界面检查一下阵列是否依然在线再重启进系统确认所有磁盘正常识别。这一步做到位后面基本能少很多莫名其妙的硬件告警。5. 常见问题与排障从亮灯报警到日志定位服务器维护的核心不是“会修”而是“会看”。绝大多数硬件问题在发生之前都会有预兆面板上的告警灯、BMC 里的告警事件、系统日志里的错误记录。下面按值班时最常用的处理顺序来展开。5.1 告警分级处理电源、风扇、硬盘、温度谁先看机房值班时最怕的就是服务器突然发出蜂鸣声或者面板灯变红。先不要慌把告警源分个优先级按影响面从大到小排查。告警源典型表现可能影响处理优先级电源模块电源指示灯不亮、日志报电压异常冗余失效一旦故障即宕机最高温度传感器进风口/CPU 温度超阈值CPU 降频、强制关机高风扇转速转速过低或为零散热不足引发高温告警高硬盘状态硬盘灯闪烁异常、SMART 告警阵列降级、数据风险中电源和风扇属于先看的一类因为它们直接决定机器能不能活着。机房里的常见做法是电源模块至少配置双电源接在两个不同的 PDU 上单一电源故障不会导致整机断电。风扇出现告警时不要直接拔风扇先确认是转速归零还是转速过低再结合温度传感器判断是否积灰或卡死。硬盘告警往往不会立即宕机但如果 RAID 阵列已经降级就要尽快处理。处理流程是先通过阵列卡管理界面确认坏盘位置再准备替换盘。这里有一条原则不要直接拔掉 RAID 阵列里一个指示灯正常但报警的盘先看日志确认是它的问题还是背板的问题拔错了盘可能导致整个阵列数据不可用。5.2 日志与时间BMC 事件日志和系统时间不同步的连锁风险告警处理到最后都要回到日志上。BMC 里的事件日志记录着硬件的历史事件包括异常断电、温度越限、风扇故障、内存纠错等。这些信息在解决那些“机器偶尔重启但没证据”的问题时特别管用。通过 ipmitool 可以快速查看这些日志# 查看 BMC 事件日志 ipmitool sel elist # 查看当前传感器读数重点是 CPU、风扇和温度 ipmitool sensor list | grep -E CPU|FAN|Tempipmitool sel elist会列出 SEL 里的所有事件每一行的关键看时间和事件类型。时间字段是 BMC 自己的时钟如果发现时间不对先通过 BIOS 或 BMC 设置校准。ipmitool sensor list能直接看到硬件即时状态适合远程巡检时快速判断机器健康状况。日志和时间是一对连体婴。很多集群环境里节点之间通信失败、证书校验报错追到最后都是时间不同步的问题。各节点时间相差超过一定阈值就会出现互信失败、任务调度异常等奇怪现象。标准做法是部署一台内网时间服务器所有节点通过 NTP 协议与它同步同时把时区设置成业务实际的时区比如 Asia/Shanghai。集群场景下时间不同步的影响范围远超单机必须把时间同步纳入巡检项。5.3 避坑清单初始化阶段最容易翻车的 5 个操作这些年接触过的服务器初始化问题大部分集中在下面五个操作上一条条说清楚遇到的时候就不用再翻车了。第一个坑U 盘引导后卡在系统安装界面。现象是安装程序起来了但找不到启动镜像或者读取到一半报错。原因通常是 BIOS 引导模式和 U 盘制作的分区格式不匹配U 盘用了 UEFI 引导但 BIOS 里开了 Legacy或者反过来。解决方法是先确认 BIOS 里的引导模式再重新写盘保证两边一致。第二个坑RAID 配置界面里看不到物理盘。现象是阵列卡管理中磁盘列表为空。原因可能是磁盘背板线缆松了、硬盘盘位没插到位也可能是阵列卡工作在直通模式下盘被直接透传给系统了。解决方法是先从盘位物理接触查起再看背板线缆和阵列卡模式设置。第三个坑Windows 安装时找不到磁盘。现象和原因前面说过是阵列卡驱动缺失。解决方法是提前准备厂商驱动并挂载到安装环境在“加载驱动程序”里指定路径。这个坑最常见的错误做法是反复重启重试正确方向是把驱动加载进去。第四个坑风扇满速转噪音大到以为机器坏了。现象是开机后风扇全速运行不降速。原因可能是 CPU 或内存未完全识别、温度传感器读数异常、BMC 策略未初始化。解决方法是先看 BMC 传感器读数确认没有真实高温然后升级 BMC 固件并恢复默认散热策略通常能恢复智能调速。第五个坑改完静态 IP 后网络不通。现象是业务 IP 配置后 ping 不通重启后又恢复到原来地址。原因可能是网卡名写错、掩码网关冲突或者配置未持久化。解决方法是先在系统里确认当前网卡名称再检查配置格式执行配置生效后立即测试连通性不要重启后才验证。6. 给服务器做一次体检巡检脚本与带外管理进阶设备交付不是结束真正决定日常省心程度的是能不能收到故障苗头。下面给一套能直接放在生产环境用的巡检思路以及带外管理的两个进阶命令。6.1 快速巡检脚本CPU、内存、磁盘、RAID 状态一目了然日常巡检没必要每次都登进机房写一个脚本放在服务器上跑一遍输出关键指标就够了。下面这个脚本覆盖了最常见的几个检查点#!/bin/bash echo 负载与运行时长 uptime echo 内存使用 free -h echo 磁盘空间 df -h | grep -vE tmpfs|udev|loop echo RAID 阵列状态 storcli64 /c0 show 2/dev/null || megacli -LDInfo -Lall -aALL 2/dev/null echo 硬件传感器 ipmitool sensor list 2/dev/null | grep -E CPU|FAN|Tempuptime看负载和运行时间负载长期高于 CPU 核数说明资源吃紧。free -h看内存总量和使用率注意观察 available 值不是只看 free。df -h过滤掉虚拟文件系统后确认业务分区有没有接近写满。storcli64和megacli是常见阵列卡管理工具输出里重点看虚拟磁盘状态是否为 Online。ipmitool sensor list筛选 CPU、风扇、温度三类关键传感器非 root 用户可能需要加权限执行。这个脚本可以直接放到 crontab 里每天定时执行输出重定向到日志文件。更进一步的方案是接入开源的服务器维护软件做统一告警和可视化但底层的巡检逻辑和这里是一致的。6.2 带外管理进阶IPMITool 命令行下的远程电源与 SOLBMC 网页界面功能齐全但逐台点击效率太低。ipmitool 在命令行下就能完成远程电源管理和控制台接管# 远程开机 ipmitool -I lanplus -H 192.168.1.1 -U admin -P password chassis power on # 查看电源状态 ipmitool -I lanplus -H 192.168.1.1 -U admin -P password chassis power status # 打开串口控制台 ipmitool -I lanplus -H 192.168.1.1 -U admin -P password sol activate-I lanplus指定走 IPMI 2.0 网络协议-H是 BMC 地址-U和-P是认证账号密码。chassis power子命令管理电源状态适合批量开关机和重启。sol activate打开 SOL 串口重定向可以在网络不通的情况下看到系统的串口输出对排查启动卡住的问题很有效。把这些命令写到运维脚本里遇到批量维护时就不用逐台登录管理页面了。这些年经手过的服务器最大的教训就是初始化阶段把基础配置做扎实后面能少加一半的班。我自己的习惯是机器一上架就把 BMC IP、资产编号、RAID 级别、系统 IP 写到一张标签纸上直接贴在机箱前面板。这样不管过多久回来哪怕换人接手也能一眼知道这台机器是怎么配的。这个习惯救过我不少次希望帮到你。本文还有配套的精品资源点击获取