1. 一个标题里的两个关键词Gemini与牛客SHELL5是怎么凑到一起的最近在调整自己的Shell练习计划顺手翻到牛客SHELL5这道打印空行的行号的题目同时又刷到不少关于Gemini会员的讨论两个看似不相关的话题摆在手边反而让我想认真整理一下这一段时期的体会Shell基础到底该怎么练AI工具在中间能帮上什么忙又不该替你做哪些事。这道题本身没什么门槛文件叫nowcoder.txt你要把里面空行的行号一行一个地输出。可就是这么个基础需求你去搜索引擎或者AI对话工具里翻一下能翻出五六种写法而且每一种写法背后对应的文本处理思路都不一样。有的解法依赖工具自带的行号能力有的解法把行号当成一个内建变量有的解法干脆绕开所有外部命令、自己用循环逐行判断。对于一个想真正搞懂Shell的人来说这恰恰是最好的一题多解教学素材。我见过不少刷题的人目标就是通过复制一段看起来对的代码提交绿了下一题。这道题绿得太容易反而容易让人错过真正值钱的部分。所以这篇我打算换个方式把四种主流解法逐行拆开讲清楚为什么这么写、它和另一种写法的边界差异在哪里然后再落到牛客判题系统的考察点以及AI辅助学习的方法论上。这样定位的话这篇文章适合谁看一是刚开始刷牛客Shell题、对grep/sed/awk似懂非懂的初学者二是已经在写Shell脚本、但经常在本地能跑线上报错之间反复横跳的人三是正在纠结要不要为AI工具付费、拿不准它到底能帮开发做什么的人。2. 四种解法从直觉到底层grep、sed、awk、while循环2.1 grep -n最直接但输出格式要再处理先来最简单直接的版本grep -n ^$ nowcoder.txt对Linux有一定使用经验的人遇到找出行第一个想到的必然就是grep。加上-n参数后grep会在匹配行前面打印行号。这里匹配空行的正则很直白^锚定行首$锚定行尾中间没有任何内容含义就是这一行只有一个行首和一个行尾中间长度为0。但直接这样提交到牛客很可能是过不了的。原因在于grep -n的输出格式3: 7: 12:行号后面永远跟着一个冒号冒号后面是被匹配到的行内容而空行的内容就是空所以你看到的是3:。如果判题系统期望的答案是逐字节匹配的纯行号这种带冒号的输出会被判成错误。想让它变成纯行号加一步过滤grep -n ^$ nowcoder.txt | cut -d: -f1用cut以冒号为分隔符切第一列这样拿到的就是纯粹的行号。也可以用tr -d :直接删冒号效果一样。有些人觉得grep答案多此一举但你只要理解了grep -n输出冒号的原因就会明白这不是bug而是特性grep的核心能力是打印匹配行-n里的行号只是辅助标记行号与内容之间必须有一个稳定的分隔符冒号就是这个约定。2.2 sed -n /^$/把行号当成编辑命令第二种解法在牛客题解区不算最多但却是最优雅的sed -n /^$/ nowcoder.txtsed平时被用到最多的功能是替换文本比如s/old/new/g。不过它内部包含很多冷门但实用的命令就是其中一个作用是在当前行上方打印这一行的行号。配合-n参数关闭默认的逐行输出再把/^$/作为匹配空行的地址范围整条命令的含义就变成了只对空行执行输出空行的行号。输出格式很干净3 7 12没有冒号没有额外内容每一行就是一个行号。这是四种解法里最贴合打印空行的行号这句话的版本也是我如果要提交牛客时的首选。值得注意的是命令打印的行号并不会吞掉后面的匹配行。因为这里我们没有写p命令而且用了-n所以匹配行本身不会被打印。这个行为一开始会让人有点困惑明明命令里没有p为什么行号会出来注意区分和p是两个不同的编辑命令就是把行号输出这个动作本身。2.3 awk NF0 {print NR}用字段模型判断空行第三种是awk流派也是我认为最值得玩味的一种awk NF0 {print NR} nowcoder.txt先看awk处理文本的基本模型它把输入拆成一条条记录默认一条记录就是一行每条记录又按空白字符拆成一个个字段。NF是当前记录的字段数NR是当前已经读过的记录总数单文件场景下NR就是行号。一个真正的空行由于没有任何内容即使按空白拆分也切不出字段所以NF等于0。NF0命中后print NR输出当前行号。这就把是不是空行的判断转化成了字段数是不是0的判断是awk视角下一个非常典型的问题建模。同样效果的写法还有awk /^$/ {print NR} nowcoder.txt注意这两种awk写法在严格空行前提下等价但对只有空格或Tab的行态度不一样这里先留个扣子下一章详细展开。awk的解法看起来不比sed简洁但它胜在可扩展性。比如你想同时输出空行的行号和空行的数量或者想统计空行占比awk只需要加一个变量计数而sed就相对难扩展。这也是为什么在处理复杂文本统计场景时人们更愿意选择awk。2.4 while read原生循环逐行读文件时的三个细节坑最后这个解法不是最省事但我建议每个人至少亲手写一遍#!/bin/bash n0 while IFS read -r line; do n$((n 1)) if [ -z $line ]; then echo $n fi done nowcoder.txt思路是纯命令式声明一个计数器n每次从文件读一行不管内容是什么先把n加一然后判断这一行读进来的字符串是不是空字符串如果是空就输出n。完全不需要外部文本处理工具只要有bash就能跑。这个写法里有三个细节每一个都是初学者容易踩的坑。第一个是IFS。read命令在读入一行时默认会做字段切分并把行首和行尾的空白字符去掉。如果你不把IFS置空 这种只含空格的假空行读进来会变成空字符串原本不该被当成空行的会被误判输出行号。加上IFS等于告诉read不要给我做任何切分和trim原样拿进来。第二个是-r参数。read默认会把反斜杠当作转义字符处理例如某行含有\t不加-r时反斜杠和后一个字符会被解释成转义关系导致读进来的内容不是文件里的原样内容。加上-r表示禁用转义保留原文。第三个是算术计算的语法。Shell里没有n这种直接写法必须用$((n 1))或者n$((n))。这里的双小括号是Shell的算术展开语法容易和条件判断里的单中括号、命令替换里的反引号混淆。很多人第一次写循环时写成了nn1结果被当成字符串赋值循环直接出问题。这个解法虽然代码最多但它能把Shell如何逐行读取文件这个过程彻底暴露出来。理解了这三点以后再写什么批量处理、逐行日志清洗都有底气。3. 能这么写的原因正则语义与三种文本处理工具的定位差异3.1 ^$匹配的是长度0的严格空行很多教程直接告诉你^$匹配空行但没有解释为什么。^是行首锚点匹配一个位置$是行尾锚点也匹配一个位置。当这两个锚点之间什么都没有时表示这一个位置既是行首又是行尾换句话说这一行的长度为0。这就是严格空行的定义。现实世界里的日志、导出表格经常出现一种看起来是空行其实里面有几个空格的行。这种行用^$是匹配不到的必须用grep -n ^[[:space:]]*$ nowcoder.txt[[:space:]]是POSIX字符类它匹配空格、Tab、换行等空白字符星号表示出现0次或多次。整个正则的含义是从行首开始允许有任意个空白字符然后立刻到行尾。换句话说这就是空白行blank line的匹配方式。进入awk世界后定义又微妙地变化了。awk NF0匹配的不只是长度0的行它匹配的是不包含任何非空白字段的行。换句话说一行里全是空格NF依然是0会被awk当成空行。所以如果你用awk /^$/它严格匹配长度0用awk NF0它匹配的是没有有效内容的行。两个写法的覆盖范围差了整整一个只含空白字符的集合。这个区别放在牛客这道很简单题目默认空行就是严格空行怎么答都对。但放到真实业务里日志文件某一行是 你的统计结果会因为用错定义而出现细微偏差。文本处理最怕的就是这种看着对数据差一点的情况。3.2 找、改、算grep/sed/awk的三套世界观初学者最容易问的问题之一是同一个需求为什么grep能做、sed也能做、awk还能做要回答这个问题得看到三者的世界观差异。grep的世界非常简单判断每一行是否匹配一个正则匹配就把这行输出。它的特长是找对文本本身不做修改行号只是附加装饰。sed的世界是逐行编辑读一行执行编辑脚本把结果输出。它的指令集里有替换、删除、插入、追加、打印行号等所以它适合改。注意sed里这种命令其实就是一种编辑指令它的存在说明sed不是只能做替换。awk的世界最重它把输入当作结构化数据操作的是记录和字段这两个概念内部支持变量、条件、循环、数组、函数因此适合算。比如这道题里用print NR输出行号本质是在访问一个内建变量而不是调用某个显示行号的功能。用这道题可以做一个很精炼的对照在grep里行号是-n参数附加的标记在sed里行号是命令这个编辑动作的产物在awk里行号是NR这个数据模型的内建字段。理解了这三者区别你在不同场景下选工具就不会纠结。如果非要给一句选型建议只要判断某一行是否匹配并输出行号这种简单需求sed一行最干净如果后面还要按字段聚合、统计、累计直接上awk如果只是想快速看一眼哪里有匹配grep永远最快。3.3 NR、FNR、NFawk内建变量的行号关系awk新手最痛苦的一件事就是把NR、FNR、NF三个变量混在一起。这里一次性讲透。NF是字段数和行号没关系。它表示当前记录按输入分隔符切出了几个字段。NF0判断空行、NF5过滤字段不足的行都是围绕字段展开。NR是记录数可以理解为awk进程从输入开始一共读过了多少条记录在默认行模式下就是行号。重点在于它是累计的。FNR是当前文件的记录数每切换一个文件FNR会重新从1开始计数NR不会。单文件时NR和FNR完全相等所以这道题写NR没问题。一旦处理多个文件比如awk {print FILENAME, FNR, NR} a.txt b.txt你会看到FNR在读到b.txt时又变成1、2、3而NR继续累加。这个区别在日常脚本里很实用想要每个文件各自的行号用FNR想要整个任务的总行号用NR。顺带提醒一下print NR默认输出后会换行所以每一行行号占一行。如果你想要行号之间用逗号分隔可以用printf %d, NR这类写法。在牛客这类判题场景里换行是标准答案千万别画蛇添足。4. 牛客SHELL5的判题细节与实战踩坑清单4.1 输出格式决定提交版本在线判题系统对Shell脚本的判定逻辑本质是你的脚本stdout输出 vs 期望输出做比对。这说明一个残酷的事实脚本逻辑正确但输出格式不对照样判错。就这道题而言3:这种带冒号的输出很可能就是那个格式错误。我个人的建议非常明确优先提交sed -n /^$/ nowcoder.txt如果你习惯用grep记得补上过滤grep -n ^$ nowcoder.txt | cut -d: -f1如果你用awk注意NF0和/^$/在空白行上的差异牛客默认按严格空行判两种都不会误伤但建议脑海里清楚差异。还有一个细节脚本入口加不加#!/bin/bash。牛客的Shell题通常要求你提交一个脚本文件而不是一行命令。因此开头写清shebang更规范。它不会影响判题逻辑但能让脚本在任何环境下手动执行时有更确定的行为。4.2 空行的两种定义决定匹配模式把上一章的细节落成一份简单的对照表以后查阅起来方便需求正则/命令覆盖范围严格空行长度0^$/awk /^$/真正没有任何字符的行空白行允许空格/Tab^[[:space:]]*$严格空行 只含空白字符的行无有效字段awk NF0近似空白行按字段维度判断把这个表刻在脑子里以后凡是统计空行数的需求先问清楚业务要的是哪一种。写代码前定义一个边界比上线后修数据快得多。4.3 文件结尾没有换行符的边界行为Unix下一行的结束标志是换行符\n。如果一个文件的最后一行没有换行符它算不算一行答案是算。grep、awk、sed、read循环都会把它当作一行来处理。但如果最后一行是一个空行且没有换行符情况会有点微妙。比如文件内容是abc def这里第3行末尾严格来说不是一个空行因为文件在def处直接结束中间没有换行符所以不存在第3行。如果题目文件长这样那打印空行的行号理论上不输出任何内容假设第1、2行不为空。不过牛客给的测试文件一般不会拿这种反直觉的边界来卡人。真正重要的是你得知道判断行的边界依赖换行符处理真实文件时文件末尾到底有没有换行符会影响循环和统计的结果。我处理脏日志时的习惯是拿到文件先执行一下tail -c 1 file | od -An -t x1看看最后一个字节是不是0a换行符心里就有数了。4.4 两个我在实际提交中踩过的坑第一个坑就是grep -n的冒号。这个前面讲过了属于典型本地看着正常提交就错的案例。后来我长了个教训凡是输出类题目先把期望输出样例复制下来用cat -A或者od -c看看到底有哪些隐藏字符。很多判错不是逻辑问题而是多了个空格、多了个空行、少了末尾换行。第二个坑是测试文件路径。牛客Shell题固定会在脚本运行时提供一个叫nowcoder.txt的文件它就在当前目录。我有一回在本地测试时自作聪明地建了子目录脚本里写的是./data/nowcoder.txt提交前忘了改回来结果判题系统找不到文件直接输出空害得我debug了十分钟。后来我习惯把脚本执行的当前目录和文件路径都打印出来先确认环境再跑逻辑。第三个值得一提的坑不是牛客的是日常脚本里的sed在Linux上是GNU sed在macOS上是BSD sed两者的命令行为基本一致但替换命令的-i参数差异巨大。你在牛客上练的是GNU环境可一旦回到macOS本地很多在牛客上写得好好的sed命令会报错。这不怪你学得不扎实是环境差异本身就是一个必须学的知识点。5. 借Gemini聊AI辅助Shell学习哪些该交给AI哪些必须自己练5.1 AI确实给出了第五种解法但过程比答案更重要我写这道题的时候顺手把问题丢给了AI对话工具除了grep/sed/awk/while read四种方案它还给了一个我当时确实没想到的版本cat -n nowcoder.txt | awk $2 {print $1}思路是先让cat -n给每一行都加上行号输出格式是行号、Tab、内容然后用awk按空白字符切分$1是行号$2是内容内容为空就打印行号。这个思路本质上是一种先标记、再过滤的预处理模式和直接判断空行的工具原生活儿路径完全不同。这件事给我的启发不是AI真厉害而是如果你自己连基础的四种解法都没写过AI给再多思路你也判断不出优劣甚至看不懂它在干什么。相反的当我先把四种解法都跑通、理解了各自的优劣之后AI给的第五种解法立刻就能被我归入预处理过滤这个框架里变成自己的东西。所以我一直建议让AI解释而不是让AI代写。你可以问为什么sed的命令能输出行号它和grep -n有什么区别这种问题能把工具讲透比直接复制一段答案有用得多。5.2 关于永久会员我是怎么判断值不值的回到标题里永久会员四个字。很多人在买AI工具会员前都会犹豫我也被问过很多次。我的判断标准很朴实先看你在真实工作流里用不用得上它的高级能力。拿Shell学习举例子如果你只是偶尔查一条命令、看一个语法免费档完全够用。如果你每天要处理大量文本需要让AI在一个很长的对话里持续理解上下文比如这是我日志清洗脚本的完整背景后面每个问题都结合这个背景来答那更强的上下文窗口和推理能力确实能带来明显效率差。我自己的方法很简单先用免费档老老实实用一个月统计每周因为上下文不够长对话轮次受限而被迫中断的次数只有当这个次数明显影响工作流时才认真考虑付费。还需要提醒一句AI给出的Shell命令一定要自己跑通再使用。模型训练数据里GNU sed和BSD sed是混着的它在Linux环境给替换命令可能没问题换个环境可能就翻车。这个环境差异不是AI的锅恰恰是你必须自己积累的经验。如果你在牛客上做题我推荐你直接记这个模板答案sed -n /^$/ nowcoder.txt但如果只是为了应付题目那这篇文就白看了。把四种解法分别跑一遍再试着用AI解释它们的差异你才算把这道题吃透。5.3 从SHELL5延伸出去的系统练习路线最后给想认真练Shell的人一条可执行的路线。牛客的Shell题有二十多道SHELL5属于文件内容处理这一挂。做完这道以后建议按这个顺序往下刷先练统计类题目比如统计文件行数、单词个数、字符数自然就会用到wc -l、tr -s、sort | uniq -c这些组合。再练范围类题目比如打印指定行区间、删除指定行这会逼你熟悉sed的行地址语法。接着练词频统计这是awk数组加sort排序的综合题比SHELL5高一个难度等级。最后练批量重命名、遍历目录、后台执行这类需要组合命令的题这是走向真实脚本的第一步。我自己刷题的一个习惯是每道题至少写三种解法然后在终端里分别跑一遍再用diff对比输出。这个习惯让我在写真实Shell脚本时面对为什么本地和线上结果不一样的排查速度快很多。Shell的学习曲线很特别它不靠背题靠的是对底层机制的理解。牛客SHELL5这道题能做出来的人很多但能把它讲透的人不多。希望这一篇能把你在AI工具和基础命令之间的那条线连起来。
