版权与内容来源声明本文为原创整理。文中涉及官方文档、开源仓库、论文与公开报道的内容均在附表 A 中标注来源引用官方原文保持原样不作改写。文中命令、版本号与界面截图以本文成文时的实测/核验结果为准标注「待验证」的部分请以你本地环境实际输出为判断依据。本文不推荐任何不合规的软件获取方式也不对任何收益结果作承诺。转载请注明出处。第1章 外包人的真本事在一套跑着的系统里活下来1.1 外包到底训练了什么很多人把外包经历当成简历上的减分项觉得那是给别人打杂、做边角功能。但从用人方的角度看外包经历里藏着一种很贵的能力你能在别人的、已经跑起来的、你并不完全理解的代码库里把一件事办成。传统技术岗转 AI 大模型时最容易产生的误区是我得先自己从零搭一个 Agent、从零搭一个 RAG才算真正会了。但真实岗位上大多数公司要你做的可能不是从零搭而是接手一个已经上线、已经有一堆历史包袱、文档还不全的系统然后在不搞崩它的前提下改对地方。外包出身的人其实天天在做这件事进组第一周没人带你从头讲架构你得自己读代码、读数据库、读线上日志需求来了不是让你重做而是让你在现有流程里加一个小改动改完要能交付不能说我不会因为客户等着上线。这套训练恰好就是大模型岗位里接手能力的雏形。1.2 读懂别人的代码本身就是一项稀缺能力大模型项目有一个特点它的代码不只是一堆函数还包括提示词、检索策略、向量库、评测集还有一堆调用外部工具的链路。一个 RAG 系统能跑靠的是数据流、模型、检索器、重排器几部分咬合在一起。你接手它的时候最重要的不是马上写新功能而是先搞清楚这个系统现在到底是怎么运转的。会读别人代码的人能快速回答三个问题用户的一个请求是从哪进、到哪出、中间经过了什么现在线上用的模型、提示词、检索参数分别在哪配置的如果我想改一个点会影响哪些下游这三个问题答不上来就动手是从零搭 demo 的人和接手存量系统的人最大的分水岭。1.3 为什么这件事在 AI 时代更值钱从零搭一个 demo网上教程一搜一大把新人两周就能照着跑通。但接手一个陌生的大模型系统、还保证不把生产环境搞坏这件事没法靠教程速成——它靠的是在真实系统里反复踩坑练出来的判断力。所以本文的核心判断是岗位真正缺的是能在别人的存量系统里定位问题并安全改动的人。外包经历恰好高强度训练了这件事。你的简历和面试要展示的应该是接手能力而不是从零搭 demo 的能力。第2章 从零搭 demo 与接手存量系统难点完全不同2.1 一张表说清两种活儿的差别维度从零搭 demo接手存量系统目标跑通一个能演示的最小闭环在不动原有功能的前提下改对一个点并安全交付最大风险做不出来、跑不通改坏了别的功能、引入回归、线上出事故成功判据本地能演示、效果看起来还行改动可验证、没影响其他路径、能回滚常见失败卡在环境、卡在调参顺手重构、没看调用链、没有评测兜底很多转行的人把接手当成从零搭来做一上来就想推翻重写得更优雅。结果往往是旧功能崩了新功能也没交付还背了事故。2.2 大模型项目里的存量长什么样你接手的大模型项目通常不是一张白纸而是一堆已经成型的零件一个已经接了公司知识库的 RAG 服务检索质量忽好忽坏一个线上跑着的 Agent偶尔调用工具失败但大多数时候能跑一份两年前写的提示词模板没人敢动因为不知道动了会怎样。这些存量的共同点是它们能跑但脆弱它们有历史但没文档它们需要的是被理解和被最小改动而不是被重写。2.3 转行的人最容易踩的坑把接手当成从零搭会让你在面试里讲错重点。面试官问你做过什么你讲我搭了一个 RAG这只能证明你会照教程。但如果你讲我接手了一个线上的 RAG发现它检索召回不稳定我加了一条评测用例锁定行为然后用最小改动换掉了重排器没影响其他问答——这就证明你有接手能力。记住demo 谁都能搭存量系统里的判断力才是稀缺品。第3章 接手一个陌生 RAG / Agent 项目的前 30 分钟先看什么3.1 第一件事画出数据流别急着读每一行代码。先搞清楚一条主线用户的问题是怎么变成答案的。对 RAG 来说典型链路是用户提问 → 向量化 → 检索 → 重排 → 拼上下文 → 大模型生成 → 返回。你把这条链路在纸上画出来标出每一步用到的模块名和配置文件位置就完成了接手第一步。3.2 第二件事找到调用链入口光知道链路还不够要知道代码里它从哪个文件、哪个函数开始。下面这组命令是接手期很实用的摸底动作——当然具体到你的项目路径要替换⚠️代码待验证tree-L2-Ivenv|node_modules|.git.grep-rndef src/|head-50把输出记下来主入口在哪、检索函数在哪、生成函数在哪。找不到入口就改代码等于蒙着眼睛走路。3.3 第三件事确认有没有评测集和日志这一步最关键也最容易被忽略。你要确认两件事这个项目有没有一套能反复跑的评测哪怕只有几条用例线上出问题时日志里能不能看到完整的调用轨迹如果都没有你后面任何改动都是盲改——你没法证明自己没改坏。Anthropic 在工程博客里明确说过好的评估能让问题和行为变化在影响用户之前就暴露出来没有评估团队只能陷入被动循环等到生产环境出了问题才发现修一个故障又引入另一个。这句话放在接手场景里再贴切不过你连改坏没改坏都量不出来还谈什么安全改动。前 30 分钟该确认的怎么确认确认到什么程度算过关数据流主链路画一张图标模块能说出提问到答案经过了哪几步调用链入口找主文件和函数能定位检索、生成分别在哪评测集是否存在找 tests / evals 目录知道有没有、在哪、怎么跑日志能否看全轨迹看日志配置与字段能查到一次请求的完整过程第4章 最小改动原则为什么顺手重构是接手期最大的坑4.1 接手期重构的隐性成本接手一个系统最危险的冲动是这代码写得真烂我顺手重构一下。但顺手重构在接手期几乎是亏本买卖你还没完全读懂旧逻辑重构很容易把隐藏的边界条件改丢旧代码丑但它是线上正在用的丑它和一堆你不知道的下游咬合着一旦重构引入回归你没法快速证明这不是我这次改动导致的。所以接手期的第一条纪律先不动架构只做最小改动并且让改动可验证、可回滚。4.2 用 SRE 的渐进发布思路保护自己Google 的 SRE 公开书里讲得很直接几乎所有服务的更新都分阶段渐进进行并穿插验证步骤非紧急发布必须分阶段把变更应用到小比例流量和容量来降低风险一旦发现异常先回滚再诊断以缩短恢复时间。这套思路搬到接手大模型项目上就是三件事用开关把新改动和旧逻辑隔开别直接替换先在小的范围比如一条评测用例、一个灰度流量验证出问题能快速关回而不是现场救火。下面是一种很轻量的开关隔离写法示意⚠️代码待验证feature_flags:new_retrieval:enabled:falserollout_percent:04.3 怎么判断这件事现在能不能动一个简单判据如果你改完之后没法用一条已有的评测或一次可重复的请求来证明没影响其他功能那这件事现在就别动或者先补一条评测再动。情况建议改动只影响新增功能有开关隔离可以动灰度验证改动触碰核心检索/生成链路无评测先补评测再动改动为了代码更好看而非解决具体问题接手期别动第5章 把改动变成可验证的加一条评测用例比加一百行代码更值钱5.1 为什么评测用例是接手期最值钱的东西接手存量系统真正的护城河不是你写了多少新代码而是你能不能证明我改了之后旧的功能还在。Anthropic 把评测分成两类一类是能力评测问智能体现在能做什么另一类是回归评测问智能体是否还能处理它以前能处理的全部任务这类评测的通过情况应接近全部目的是防住退化。他们还强调能力评测在通过情况变高之后可以毕业成一套持续运行的回归套件——原来测能不能做后来测还能不能稳定做。对刚接手项目的人来说最有价值的一步就是给这个陌生系统补上第一条回归用例。它不需要多完美只要能锁住一个已知正确的行为。5.2 给陌生项目补一条最小评测用例假设这个 RAG 系统对一个已知问题一直能答对你就把它固化成一条测试用例。以后任何改动跑一遍答错了就说明你改坏了⚠️代码待验证deftest_known_question_still_answered():answerrag_pipeline.run(退款政策是什么)assert7天inansweror七天inanswerassertlen(answer)20Claude 平台的官方文档也强调成功的 LLM 应用始于先明确定义成功标准再设计评测去衡量好的成功标准要具体、可衡量、可实现、相关。你给接手项目补的第一条用例就是一次最小的定义成功标准。5.3 把没改坏变成可断言的事实有了评测你和原来的系统之间就有了一道契约每次改动都跑一遍全绿说明没退步有红说明改坏了。这比你拍胸脯说我检查过了靠谱得多也比顺手重构安全得多。这一条评测往往是你接手一个项目后最先能写进周报、写进简历、也最能让同事信任你的东西。配套评测模板我整理了一份「给陌生 RAG / Agent 项目补最小评测」的起步模板和几个可直接套用的断言写法放在资料包里扫码即可获取第6章 怎么把「接手」类经历写进简历与面试6.1 别写负责 XX 模块写改了什么、怎么确认没改坏、结果如何简历里最常见的浪费是把接手经历写成负责 XX 模块的开发与维护。这句话什么都没说。招人方想知道的是你在一个已有系统里具体改了哪一点怎么证明没改坏结果是什么。把句式从负责……“换成在已有系统里我做了 X 改动用 Y 方式验证了没影响其他功能结果 Z”。6.2 一个可套用的表达结构旧写法没信息量新写法展示接手能力负责 RAG 系统的优化接手线上 RAG定位到重排器召回不稳定加回归评测锁定行为后最小改动替换问答准确率回升且无误伤参与 Agent 项目开发在已有 Agent 里新增一个工具调用用开关灰度出问题可快速关回未影响主链路维护大模型服务补了数条评测用例把改坏没改坏从人工检查变成自动断言上面表格里的条数只是表达结构的示例占位不是真实统计。你在自己的简历里要填你真实补的条数宁可写数条也不要编具体数字。6.3 面试时怎么主动讲接手故事不要等面试官问你遇到过什么难题才讲。你可以主动抛一个接手故事我接手过一个 XX 系统第一周先画数据流、找入口、确认有没有评测发现没有评测后我先补了一条然后用最小改动解决了 XX 问题全程可回滚。这个故事展示的不是我会搭而是我能在别人的系统里安全地把事办成——这正是岗位缺的那类人。第7章 要补的能力 一个可交付练习 小结7.1 外包出身的人要补的三块能力外包训练了接手和交付但转大模型还要补三块大模型基础链路搞懂 RAG、Agent、Embedding 这些到底解决什么问题别只会调 API评测意识把改没改坏变成可断言的事实这是接手能力的放大器工程化兜底开关、灰度、回滚这些 SRE 的老办法在大模型项目里一样救命。已有能力外包给的要补的能力读别人代码、定位问题大模型链路原理在约束下最小改动交付评测与回归意识按需求交付、对结果负责渐进发布与回滚兜底7.2 一个可交付练习接手一个开源 RAG 项目并加一条评测找一个开源的 RAG 项目别急着改它先做三件事跑通它确认基线能答画它的数据流和调用链给它补一条最小回归用例锁住一个已知正确的回答。等你能稳定地跑通—加评测—做最小改动—全绿交付你就已经具备了岗位最看重的接手能力。⚠️代码待验证gitclone开源RAG仓库地址cd项目目录pipinstall-rrequirements.txt pytest tests/-q7.3 小结本文想纠正一个转行误区大模型岗位不是比谁更能从零搭 demo而是比谁更能在别人的存量系统里定位问题、做最小改动、并且安全地交付。外包经历恰好训练了这件事——你过去在别人跑着的系统里活下来的能力正是这个岗位稀缺的那部分。把简历和面试的重心从我搭过什么转到我接手过什么、怎么确认没改坏、结果如何你会发现自己比想象中更有竞争力。接手能力练习包我把本文提到的「数据流摸底清单 最小评测模板 渐进发布开关示例」整理成了可照做的练习包放在资料包里扫码即可获取附表 A本文引用事实与出处对照表事实出处本文位置好的评估能帮助团队更自信地交付智能体没有评估容易陷入被动循环——只在生产环境发现问题修一个故障又引入另一个Anthropic《Demystifying evals for AI agents》https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents第3章、第5章回归评测问智能体是否还能处理它以前能处理的全部任务通过情况应接近全部能力评测通过后能毕业为持续运行的回归套件同上第5章成功的 LLM 应用始于明确定义成功标准再设计评测衡量好的成功标准要具体、可衡量、可实现、相关Claude Platform《Define success criteria and build evaluations》https://platform.claude.com/docs/en/test-and-evaluate/develop-tests第5章、第6章几乎所有 Google 服务的更新都分阶段渐进进行并穿插验证首阶段称为金丝雀未通过验证期则自动回滚Google SRE《Reliable Product Launches at Scale》https://sre.google/sre-book/reliable-product-launches第4章非紧急发布必须分阶段把变更应用到小比例流量与容量来降风险发现异常先回滚再诊断以缩短恢复时间Google SRE《A Collection of Best Practices for Production Services》https://sre.google/sre-book/service-best-practices/第4章附表 B术语速查表术语一句话人话解释RAG检索增强生成先去知识库查资料再把资料喂给大模型生成答案让回答有依据Agent智能体能自己调用工具、分步完成任务的程序不是只答一次就结束Embedding把文字变成一串数字向量方便按意思相近去检索评测 / Eval给系统出一组成绩单式的考题自动判断它答得对不对回归评测专门测以前能做对的现在还做不对防止改出新毛病灰度 / 金丝雀先把新改动放给一小部分流量用没问题再逐步放大出问题就缩回回滚新改动出问题时快速退回到上一个能用的版本写在最后这篇用到的资料写这篇文章时我把自己过去在外包项目里接手别人系统的那套方法和 Anthropic、Google SRE 关于评测与渐进发布的官方文档对照着又理了一遍顺手也整理了几份配套的东西大模型学习路线图从零基础到能自己动手做 Agent按阶段说明每一步该学什么、哪些可以先跳过《LangChain LangGraph MCP 智能体开发实战》视频课7 个模块从私有化部署、EmbeddingRAG 到 MCPAgent 全流程AI 大模型知识库在线可查Agent Skills 从入门到落地、Claude Skills 完全指南等专题按目录浏览即可640 套 AI 大模型行业报告 经典 PDF 书籍看行业落地案例和别人怎么做的时候用得上大模型零基础到精通教学视频跟着敲一遍比只读文档快得多资料是我自己整理的放在下面这个码上扫码即可获取添加时备注「AI」优先通过。资料按「先路线、再动手、最后查漏」的顺序整理好了建议先看学习路线那一份照着它挑一条适合自己当前基础的路径再往下看。
