华为路由器状态查看全攻略:display命令详解与运维实战
干这行十几年不管你是刚入行的网工小白还是整天泡在机房里救火的运维老鸟日常连上华为路由器之后干得最多的一件事一定是敲display开头的命令。很多人觉得查看设备基本状态就是随便敲几条命令看一眼其实这里面的门道不少。很多故障之所以处理得慢不是不会配而是连“看状态”都没看全、没看透。这篇就把华为路由器查看基本状态这件事掰开揉碎讲清楚涉及华为AR系列路由器的常用查看命令、输出回显怎么读、关键指标怎么判断以及我实际踩过的一些坑。先说清楚这里讲的“基本状态”不只是看设备通不通、接口 up 没 up而是指设备运行是否健康、硬件是否正常、资源是否够用、配置是否生效这一整套信息。查清楚了这些你才敢在变更前拍胸脯也才能在故障时第一时间定位问题。这篇文章适合所有用华为路由器的人不管是企业网出口的 AR 系列还是园区网里做汇聚的型号思路完全通用。1. 先搞清楚为什么要查“设备基本状态”1.1 日常运维的第一个动作我见过不少同事登录设备之后第一件事就是进系统视图敲配置配完就下机从头到尾不看一眼设备状态。短时间看不出问题但时间一长隐患全埋在里头。设备基本状态就像人的体检报告你不能只等生病了才去医院。定期查看 CPU 占用、内存余量、温度、接口错包是网络运维最基础也最有效的习惯。华为路由器上查看基本状态不需要额外的工具命令行就是最直接的入口。通过几条display命令你能掌握设备当前运行的各项指标。这些指标可以分成三类一是硬件健康度温度、风扇、电源二是资源占用度CPU、内存三是业务运行度接口状态、路由表、会话数。把这三类状态串起来看设备的“身体状况”基本就有数了。1.2 哪些场景必须尽快查看设备状态除了例行巡检有几个场景是必须马上查状态的千万别偷懒变更前检查要加 ACL、改路由、扩接口配置之前先看一眼 CPU 和内存余量避免在资源已经吃紧的情况下做高风险变更。业务投诉排查用户反映“网很卡”“某系统访问不了”第一件事不是去改配置而是查接口流量、查日志、查会话数。改配置前不查现状等于蒙着眼睛修车。设备重启之后机房断电或者设备意外重启恢复上线后要立即检查接口是否全部 up、关键配置是否还在、路由是否正常收敛。告警推送之后如果接了网管平台收到温度高、电源异常、设备离线这类告警第一时间上设备核对实时状态确认告警是真故障还是误报。这些场景都有一个共同点需要快速、准确地把设备当前的运行状态捞出来。下面我就把最实用的命令一条一条说清楚。2. 核心查看命令实操状态信息全部在这里2.1 display version先看“户口本”登录设备之后我习惯第一个敲display version。这条命令是一条信息量极大的命令相当于设备的“户口本”。它不仅显示设备型号还包含软件版本、补丁信息、系统启动时间、设备运行时长、设备序列号等关键信息。Huawei display version Huawei Versatile Routing Platform Software VRP (R) software, Version 8.180 (AR6575 V200R010C00SPC600) ...看回显时重点关心这几样软件版本版本号决定了设备支持哪些功能、有哪些已知缺陷。遇到问题报障时厂商工程师第一个问的一定是版本。我之前遇到过一台设备 NTP 同步总是失败排查了半天最后发现是版本缺陷升级后解决。所以养成看到设备就确认版本的习惯很有必要。补丁信息SPC、SP 后面的字段表示加载的补丁包。补丁加载状态很重要缺补丁可能意味着已知问题没修复。启动时间uptime字段会显示设备连续运行了多久。查看这个能判断设备是不是刚重启过。如果一台设备明明没人动过运行时间却被清零了那就要立刻查是不是有异常重启、电源故障或者温度过高导致重启。PCB 版本序列号序列号在向厂商报修、查询维保时要用。我在实际工作中会把所有核心设备的版本信息记录在一个表里每次巡检时核对一遍。版本统一、补丁一致能省掉很多“因为版本行为不一致”带来的坑。2.2 硬件健康三件套display device、display cpu-usage、display memory-usage如果说display version是看软件身份那下面这三条就是看硬件状态和命脉资源。display device用来查看设备各个硬件模块的运行状态包括电源、风扇、单板等。回显中会出现Status字段正常是Normal。如果出现Fault或者Offline就要重视。Huawei display device Chassis 1 (Uptime: 300 days, 16 hours, 10 minutes): Slot Board Type Status Online Register 1 AR6575 Main Board Normal Online Registered PWR1 Power Module Normal Online Registered FAN1 Fan Module Normal Online Registered重点关注电源和风扇。电源模块如果出现异常意味着设备随时可能断电宕机风扇异常则可能导致温度升高、芯片降频甚至烧板。我在机房巡检时会同时看设备的温度告警灯命令行里用display temperature all可以看具体温度值。CPU 和内存是设备资源的核心。display cpu-usage默认查看的是设备整机的 CPU 占用率。华为路由器上这条命令可以跟上slot参数查看指定单板的 CPU 占用不过大部分企业网设备是框式或单板式直接用就够了。回显里最重要的字段是CPU occupancy也就是 CPU 当前占用率。另外它还会显示最近 5 秒、1 分钟、5 分钟的平均占用率这些历史数据对判断 CPU 压力趋势很关键。Huawei display cpu-usage CPU Usage Statistic Slot 1 : CPU occupancy: 23% ...内存用display memory-usage查看。需要同时关注“系统已用内存”和“空余内存free”两个值。如果内存占用持续高于 80%并且空余内存抖动剧烈建议马上查是哪个进程占用高。用display memory-usage只能看到整体水位进一步定位可以配合查看display process来确认是哪个进程占资源。不过一般企业网场景里只要内存占用没有持续跑高、业务没有异常可以先观察不必过度紧张。2.3 display interface接口状态才是真正的前线硬件健康没问题资源也充裕接下来就要看接口了。接口是数据进出的唯一通道接口状态不对其他一切免谈。display interface如果不带参数会把所有接口的状态刷出来回显比较长。我通常带具体的接口名查看比如display interface GigabitEthernet0/0/0。Huawei display interface GigabitEthernet0/0/0 GigabitEthernet0/0/0 current state : UP (ifindex: 27) Line protocol current state : UP Description: To-Core-Switch ... Input: bytes/peak 1024 bytes/sec, errors 0, drops 0 Output: bytes/peak 2048 bytes/sec, errors 0, drops 0回显里最关键的有三段第一段是接口当前状态和链路协议状态。current state必须为UPLine protocol current state也必须是UP两者都 up 才表示链路真正可用。如果物理 up 但协议 down多半是协商问题或对端设备配了封桥协议需要进一步排查。如果物理 down检查网线、光模块和对端设备是否 up。第二段是接口的 IP 地址、掩码等三层信息。查看的时候顺带核对接线是否符合预期很多故障其实就是 IP 配错导致的。第三段是流量统计包含 Input/Output 的字节数、错误包数、丢包数。这里要加倍注意errors和drops的数值。正常情况下这两个值应该很小甚至为 0。如果 error 持续增长说明链路上存在 CRC 校验错误常见原因是网线老化、光模块光衰、接口速率不匹配。drops 增高则可能意味着 QoS 策略丢包或设备处理能力到瓶颈。注意display interface里的字节数是累计值不是实时速率。要看去实时速率华为路由器上有display interface后按i键间隔刷新也可以配合网管平台看流量曲线。命令行里更直观的方式是用display interface brief把接口摘要列出来一条命令就能看到所有接口的 up/down 状态和端口速率、错误计数。3. 从状态查看延伸到配置核对别等故障了再后悔3.1 display 命令的通用操作技巧分屏、过滤、保存华为 VRP 平台的display命令在回显较长时会在底部出现---- More ----提示敲空格键翻页敲回车键逐行显示。如果输出很长不想一页页翻可以直接在命令后面加管道符做过滤这是我每天用最多的技巧。# 只看和状态相关的行 Huawei display interface brief | include up # 只查看某个字段出现的位置 Huawei display current-configuration | include acl # 把命令回显保存到设备存储中再通过 FTP 或管理面拷出来 Huawei display current-configuration | save huawei.cfg这里有个细节管道符在 VRP 上支持include、exclude、begin这几种过滤方式。include up是只看包含 up 的行exclude是去掉某些行begin是从匹配的行开始显示。熟练掌握这三个用法查看配置和状态能节省大量时间。另外如果你要在脚本里批量获取状态建议给命令加| save参数保存到本地文件再自动拉取。我写自动化巡检脚本时就是靠display ... | save /cpu.txt这种方式把输出落盘再由脚本解析关键字段效率比人肉看屏高得多。3.2 配置生效状态检查display acl、display dhcp static光看设备硬件状态还不够配置的“生效状态”也要会查。这就要说到大家搜索时经常出现的热词——ACL 配置和 MAC 与 IP 绑定。很多人在设备上配了 ACL以为配完就万事大吉结果业务访问还是不通原因往往是 ACL 没生效或者顺序不对。查看 ACL 配置及命中计数属于“设备基本状态”范畴里很重要的一环。Huawei display acl 2001 Advanced ACL 2001, 3 rules Acls step is 5 rule 5 permit ip source 192.168.10.0 0.0.0.255 (4 matches) rule 10 deny ip source 192.168.20.0 0.0.0.255 (0 matches) rule 15 permit icmp (100 matches)回显里每个规则后面的matches数值就是命中计数。如果一条规则后面的计数始终为 0说明流量根本就没走到这条规则上。要么是流量路径不对要么是规则被前面的规则提前匹配了要么是接口应用方向搞反。排查 ACL 问题第一件事就是看这个计数而不是反复改规则内容。MAC 与 IP 绑定也是一样的道理。配了静态绑定之后如何确认绑定生效华为路由器上如果是 DHCP 场景下做的 IP-MAC 绑定可以用display dhcp static查看绑定表如果是在接口视图下做的 IPMAC 过滤可以查看接口的流量统计和 ARP 表来确认。Huawei display dhcp static ... IP Address MAC Address Lease Time Type 192.168.10.10 xxxx-xxxx-xxxx -- Static做完绑定后我一般会做两个动作一是从客户端释放重新获取地址确认拿到预期的 IP二是从路由器上 ping 该地址确认通信正常。很多时候配置写对了但客户端还保留着旧 IP这时候设备状态是好的实际业务却不对所以状态是“结果”但配置生效与否必须验证。3.3 忘记 console 密码先会看状态再谈恢复再聊一个大家经常搜的热门话题——华为路由器的 console 密码。不少人在现场管理设备console 密码忘了登不进去慌得不行。这里先厘清一个概念如果你还能通过 SSH/Telnet 登录设备那根本不用慌。你可以直接用远程方式进入系统视图重新配置 console 密码然后保存用新密码下次登录即可。Huawei system-view [Huawei] user-interface console 0 [Huawei-ui-console0] authentication-mode password [Huawei-ui-console0] set authentication password cipher NewPass123 [Huawei-ui-console0] return Huawei save如果远程登录方式全都不可用只能通过 console 口登录又忘记密码那就比复杂一些。华为 VRP 系统提供了基于CtrlB进入 BootROM 菜单的方式在设备重启时快速按键进入引导菜单选择清除 console 密码后重启设备。这里要注意不同型号、不同 VRP 版本按键时机不全相同有的是CtrlE有的是CtrlB进入后的菜单项也可能不一样。千万不要在不了解具体型号的情况下盲目操作建议操作前先查对应型号产品文档。注意执行密码清除操作会导致设备配置不丢失但会提示你重新设置密码或清空配置不同版本处理方式不同。操作前一定要确认设备配置已备份。我有一次在客户现场处理旧设备重启进 BootROM 菜单后因为版本太老菜单结构完全不一样差点把启动配置删了后来靠现场的配置备份兜底才没出事。密码恢复这种事稳字当头。4. 常见问题与排查技巧实录4.1 现象一CPU 占用率反复飙升CPU 占用率高是华为路由器最常见的“业绩表现”之一。我处理过很多次 CPU 高的问题套路基本固定。先用display cpu-usage确认是哪块单板 CPU 高再用display cpu-usage history看趋势最后用display process cpu查看占用 CPU 最高的进程名称和 PID。华为路由器上常见的高 CPU 进程有LF转发面、STP生成树、RIP/OSPF路由协议。不同进程的高 CPU 原因完全不同。比如STP进程高常常是网络里有环路导致 BPDU 报文风暴RIP进程高往往是有路由震荡接口反复 up/down触发大量路由更新。定位到进程之后再查具体原因比盲目重启设备靠谱得多。如果 CPU 是因为某个接口收到大量广播报文飙高可以用display interface查看该接口的广播报文计数。再结合风暴控制、流量抑制等策略去收敛效果立竿见影。这里特别想提醒一句千万别一看到 CPU 高就重启设备。重启之后 CPU 确实降了但过一段时间可能又涨上去了而且重启期间业务中断得不偿失。4.2 现象二接口物理 up 但协议 down这种故障很经典接口状态看着是UP但Line protocol是DOWN。我遇到过的最常见原因是两端设备的二层协商不一致比如一端配了 trunk另一端是 access或者两端 VLAN 划分不一致导致协议协商失败。另一种常见原因是对端设备把接口 shutdown 了但物理层仍然检测到信号所以物理 up 协议 down。排查时先查看接口的详细配置display current-configuration interface GigabitEthernet0/0/0核对两端的三层 IP 网段、VLAN 封装、速率双工协商模式。如果两端速率双工不一致也会出现物理 up 但协议 up 但丢包的情况。还有一种情况容易被忽略一端接口配置了negotiation auto另一端手写了速率两边协商结果异常。把两端都改成自协商问题往往就解决了。4.3 现象三display 命令回显卡住 / 设备响应慢设备响应慢敲命令半天不出结果这时候很多人会反复敲回车结果越敲越卡。实际上 VRP 平台本身有保护机制当设备 CPU 繁忙时命令通道的优先级是最高的通常都能正常执行。如果真的卡住首先要做的还是用display cpu-usage看 CPU 是不是已经被打满。如果 CPU 确实 100% 并且难以进入系统视图可以尝试用控制台口连接因为 console 口的优先级通常比 VTY 更高。如果 console 也卡住那就只能考虑设备是否存在硬件故障需要重启或者更换了。有些时候是用户敲了terminal monitor导致日志不断刷屏看起来像卡住其实只是日志刷得太快。这时候敲undo terminal monitor关掉日志显示就能缓解。Huawei undo terminal monitor这个小技巧救过我很多次尤其是设备日志量大时终端被刷得根本没法看命令回显。4.4 附一份速查表最后整理一份查看状态命令速查表可以直接抄作业贴到自己的笔记里。查看内容命令关键字段设备型号与版本display versionVRP 版本、补丁、uptime硬件模块状态display deviceStatus 是否为 NormalCPU 占用display cpu-usageCPU occupancy 及历史均值内存占用display memory-usageMemory usage 百分比、free 大小温度状态display temperature all当前温度与上下限阈值接口状态摘要display interface briefPhysical / Protocol 状态接口详细信息display interface GigabitEthernet0/0/0错包计数、CRC、丢弃、速率ACL 命中计数display acl 2001rules 后的 matches 值路由表display ip routing-table路由前缀、下一跳、协议会话数display firewall session tableTotal sessions 等系统日志display logbuffer日志等级、告警事件我个人在实际操作中强烈建议把display version、display device、display cpu-usage、display memory-usage、display interface brief、display logbuffer这六条命令作为每次巡检的固定组合花不了两分钟但基本能让设备的整体健康状况见底。尤其是display logbuffer很多隐性故障端口闪断、协议震荡、过热告警都会在日志里留下痕迹不查日志等于放弃了一半的排查线索。再提醒一句所有display出来的状态只是一个瞬间截面。要彻底掌握设备基本状态的动态变化有条件还是建议接入 NMS 网管平台做历史数据采集通过曲线趋势判断设备是否在劣化。命令行解决的是“现在怎样”的问题网管平台解决的是“接下来会怎样”的问题两者配合起来运维才真正省心。