目标这是我给自己制定的一个学习手册。一句话定位从能用 API到能把 LLM 能力工程化地交付到生产环境并拥有从数据、模型、后端到前端 UI 的端到端 ownership。目录什么是 AI 全栈工程师技能地图五大层修炼路线图12 个月五阶段项目实战清单由浅入深6 个每日修炼纪律与自测标准资源清单常见误区与心法一、什么是 AI 全栈工程师1.1 定义传统全栈工程师负责前端 UI → 后端服务 → 数据库 → 部署的完整链路AI 全栈工程师在这条链路上把模型 / 数据 / 推理服务作为新的核心层能够端到端地把 AI 能力交付为可上线、可观测、可迭代的产品┌────────────────────────────────────────────────────────┐ │ 前端层 React / Next.js / 流式交互 / 多模态 UI │ ├────────────────────────────────────────────────────────┤ │ 应用层 业务 API / 鉴权 / 队列 / 计费 / 会话状态 │ ├────────────────────────────────────────────────────────┤ │ AI 编排层 Prompt 工程 / RAG / Agent / MCP / 评估(Eval) │ ├────────────────────────────────────────────────────────┤ │ 模型层 模型选型 / 微调(LoRA) / 推理部署(vLLM) / 成本 │ ├────────────────────────────────────────────────────────┤ │ 数据层 数据管道 / 向量库 / 特征 / 日志与反馈回流 │ └────────────────────────────────────────────────────────┘1.2 与普通全栈 / 算法工程师的区别角色核心差异普通全栈工程师擅长 Web 应用但对 LLM 能力边界、幻觉控制、Token 成本、非确定性输出缺乏工程经验算法 / ML 工程师擅长训练与调模型但常止步于 notebook缺少产品化、前后端与用户侧交付能力AI 全栈工程师居中而偏应用不要求从零预训练但必须理解模型是组件——像调用数据库一样调用 LLM并处理它特有的非确定性、延迟、成本与安全属性1.3 岗位画像2025–2026 招聘市场真实要求摘要招聘市场上高频出现的职责与要求端到端 ownership“独立负责一个能力 Agent 的全链路——prompt、工具、检索、评估、监控、接口契约”典型 Agent Builder 岗。Agent 编排框架LangGraph强优先、LangChain、CrewAI、AutoGen / Microsoft Agent Framework多步图、tool calling、流式输出是硬技能。RAG 系统embedding、向量库、检索与 rerank 全链路而不只是调一下向量库 API。生产级 LLM API 经验流式SSE、重试与降级、Token 计量、多模型路由、成本与延迟预算。评估Evals意识为 LLM 应用建立自动化评测集与回归测试——这是 2026 年区分会调 API与能上生产的分水岭。3–5 年扎实的后端Python/Go/TS基础 真实线上系统经验不再是加分项而是底线。结论AI 全栈 扎实的后端/前端工程功底 × LLM 应用工程 × 数据与评测素养 × 产品与成本意识。二、技能地图五大层图例★★★ 必须精通★★ 熟练使用★ 了解原理即可2.1 工程底座传统全栈仍是护城河技能深度要点Python必选★★★异步asyncio/aiohttp、类型注解、打包uv/poetry、FastAPI前端TS React/Next.js★★★流式渲染SSE/WebSocket、Markdown/代码块渲染、Chat 交互范式后端架构★★★REST/gRPC、消息队列Redis/RabbitMQ/Kafka、幂等与重试设计数据库★★★Postgres含 pgvector、Redis 缓存、向量库pgvector/Qdrant/Milvus云与部署★★Docker、CI/CD、K8s 基础、GPU 实例A10/L4/4090 选型与成本、S3/对象存储可观测性★★结构化日志、OpenTelemetry、成本监控、Token 用量看板安全★★Prompt 注入防护、输出护栏guardrails、密钥管理、数据脱敏、合规内容审核2.2 AI 应用编排层本岗位的核心增量技能深度要点Prompt 工程与系统设计★★★结构化输出JSON mode / function calling、few-shot、系统/用户 prompt 分层、版本管理LLM API 工程★★★流式输出、超时/重试/熔断、多模型 fallback 与路由便宜模型做初筛、缓存semantic cacheRAG 全链路★★★文档解析PDF/表格/OCR→ 切分策略chunking→ embedding 选型 → 混合检索BM25向量→ rerank → 引用溯源Agent 开发★★★ReAct/工具调用、多步状态机、LangGraph、MCPModel Context Protocol、多 Agent 协作、人机审批human-in-the-loop评估与数据飞轮★★★评测集构建、LLM-as-judge、回归测试prompt 改动必跑 eval、线上 badcase 回流Function Calling / Tool Use★★★工具 schema 设计、参数校验、错误信息回传给模型的写法2.3 模型层理解 会用不要求造轮子技能深度要点模型原理★★Transformer 直觉、上下文窗口/注意力成本、温度与采样、幻觉来源模型选型★★★开源Llama/Qwen/DeepSeek/Mistral 系vs 闭源 API 对比效果、延迟、成本、私有化可行性微调★★何时微调 vs 何时 RAG/PromptLoRA/QLoRA 实操、数据标注、防过拟合与遗忘推理部署★★vLLMPagedAttention、吞吐与显存、Ollama 本地实验、量化AWQ/GPTQ/INT8、KV cache 与并发多模态★视觉理解VLM、语音ASR/TTS、图像生成 API 的接入模式2.4 数据层技能深度要点数据管道★★文档摄取ingestion、增量更新、清洗与去重、元数据管理向量与检索★★★向量库运维索引、分片、权限、检索质量评估Recallk、MRR反馈回流★★用户点赞/纠正/重试数据的采集 → 评测集与微调数据2.5 软技能与产品意识被严重低估的进阶项成本与延迟预算每个功能先回答一次调用多少钱、多少毫秒、P99 多少。不确定性思维LLM 输出是概率的——设计允许犯错并优雅降级的系统而非追求 100% 正确。产品判断什么场景该用 LLM、什么场景规则引擎更便宜更稳不是所有需求都值得上 AI。沟通能向非技术干系人解释幻觉、边界与评测结果管理预期。三、修炼路线图12 个月五阶段节奏建议每周 ≥ 15 小时投入每阶段以一个可部署的小项目作为通关条件禁止只看不写。阶段 0地基自检第 1–2 周通关条件能用 FastAPI React 写一个带鉴权、队列、Docker 部署、CI/CD 的普通 CRUD 服务。补齐 Python 异步、TS 前端、Postgres、Docker 的短板哪弱补哪。装好环境uv、Poetry、Docker Desktop、一个 GPU 云实例先跑通ollama run qwen3即可。阶段 1LLM 工程入门第 3–8 周目标把调 API变成工程化调用。学习Transformer 直觉 → Token 与上下文成本 → 采样参数 → 结构化输出 / function calling → 流式SSE与错误处理。实操清单用 OpenAI/Anthropic/通义/DeepSeek 任一 API 写 10 种场景的 prompt翻译、抽取、分类、改写、评分、代码生成……为每种场景写 3 个边界用例。给任意一个 API 封装生产级客户端超时、指数退避重试、多模型 fallback、Token 用量日志、语义缓存。做一个 Chat 前端流式打字机效果、停止生成、历史会话、Markdown/代码渲染。通关项目 P1一个带会话历史的流式 Chat 应用含用量统计页Docker 一键部署。阶段 2RAG 全链路第 9–16 周目标能独立构建并调优一个企业级文档问答系统。学习路线chunking 策略对比 → embedding 模型评测MTEB 榜单 自建小数据集实测→ 混合检索 → rerank → 引用与幻觉抑制。必读书/项目Datawhale《All-in-RAG》中文 RAG 全栈实战、RAGas 评估框架、LlamaIndex 文档。实操清单用 ≥ 3 种切分方式处理同一批 PDF量化对比召回效果。实现 BM25 向量 rerank 的混合检索对比单路检索。用 RAGas 或自建 50 题评测集跑 Recall / Faithfulness / 答案相关性记录每次改动前后的分数开始建立 eval 肌肉记忆。通关项目 P2企业知识库问答支持 PDF/网页、答案带出处引用、检索分数透明化附评测报告。阶段 3Agent 与多步系统第 17–24 周目标从一问一答进化到多步任务自主执行。学习ReAct 范式 → LangGraph 状态机 → 工具设计 → MCP 协议 → 多 Agent 分工 → human-in-the-loop 审批。实操清单为 Agent 设计 5 个工具搜索、查库、写文件、调 API、计算每个工具写清错误信息回传规范。实现一个失败可恢复的 Agent任意步骤失败能重试、降级、或请求人工介入。接入 MCP server文件/浏览器/数据库体验标准化工具生态。通关项目 P3一个研究型 Agent——接收自然语言任务自主规划→检索→整理→产出带引用的报告全程可观测trace 每一步。阶段 4模型层与推理服务第 25–34 周目标能选型、能微调、能部署开源模型并算清成本账。学习量化AWQ/GPTQ→ vLLM 部署与压测吞吐、TTFT、P99→ LoRA/QLoRA 微调全流程。实操清单在一台 GPU 上用 vLLM 部署 Qwen/Llama 系模型压测并调出最优并发/显存配置。用 ≤ 2k 条数据做一次 LoRA 微调领域改写或分类场景对比基座模型在自建评测集上的提升诚实记录没提升的场景。写一份《闭源 API vs 自部署》成本/效果/延迟对比报告。通关项目 P4把 P2 的 RAG 系统切到自部署 vLLM 后端延迟与成本不劣化的前提下跑通附压测报告。阶段 5生产化与个人体系第 35–52 周目标达到独立交付 AI 产品水平形成个人方法论。主题清单评估体系为 P1–P4 各建一套自动回归 evalprompt/模型任一变更必须过评测。安全Prompt 注入红队自测、输出护栏、敏感数据脱敏、内容审核。可观测全链路 traceLangSmith/Langfuse/Phoenix 任选其一、badcase 看板、成本看板。架构设计写一份 30 页内的大型 AI 产品架构设计文档多租户、配额、审计。通关项目 P5一个完整 AI SaaS多用户、计费配额、管理后台、eval 看板、部署流水线开源并写高质量 README。并行动作从第 20 周起开始写技术博客/公开分享每两周 1 篇——输出倒逼输入也是求职/接单的杠杆。里程碑速查表时间里程碑验收标准第 2 周工程地基CRUD 服务上线 CI/CD第 8 周P1流式 Chat 应用可部署第 16 周P2RAG 系统 评测报告第 24 周P3可观测的研究型 Agent第 34 周P4vLLM 自部署 LoRA 实验第 52 周P5AI SaaS 开源 个人方法论沉淀四、项目实战清单由浅入深6 个#项目训练重点难度P1流式 Chat 应用会话管理 用量统计API 工程、SSE、前端流式渲染★★P2企业知识库 RAG引用溯源 混合检索 评测报告检索工程、chunking、RAGas★★★P3研究型 Agent规划→检索→报告全链路 traceLangGraph、工具设计、MCP★★★P4RAG 系统迁移自部署 vLLM压测 LoRA 实验推理部署、量化、成本核算★★★★P5AI SaaS多租户 配额计费 eval 看板架构、可观测、商业化思维★★★★P6加分多模态产品文档解析含表格/OCR或语音入口VLM/ASR 集成、工程复杂度★★★★原则每个项目必须部署到公网 写 README 留评测数据否则等于没做。作品集 部署链接 架构图 eval 曲线。五、每日修炼纪律与自测标准5.1 每周节奏模板2h 输入读源码/博客/论文摘要LangGraph、vLLM、RAG 相关 repo 是必读源码。5h 实操推进当前阶段项目写代码不查答案优先。2h 评测跑 eval、看 trace、记录 badcase 到badcase.md。1h 输出更新博客/笔记哪怕 200 字。5.2 自测题每阶段结束前自答答不上未过关LLM 工程一次请求的 Token 成本由什么构成缓存能省哪部分流式接口如何做到可取消 断线不丢模型升级后你的 eval 回归流程是什么RAG4. 为什么固定长度 chunking 常失败你如何验证自己的切分更好5. 混合检索中 BM25 和向量各解决什么问题rerank 放哪一步6. 用户问这份报告里的数字是多少你的系统如何避免编造Agent7. Agent 陷入循环调用工具你在哪些层面防御8. 什么任务该用 Agent什么任务一个函数调用就够说出 3 个反例生产化9. 给这个功能做一次成本预算月 10 万次调用P99 要求 3s。10. 一次线上 badcase 如何 5 分钟内定位到是 prompt、检索还是模型问题5.3 红线规则不写没有评测的 prompt 改动。不把生产密钥、未脱敏数据贴进 prompt 或博客。不在没有超时/重试/降级的设计里上线 LLM 调用。不迷信框架LangChain/LangGraph 用熟后至少亲手用裸 SDK 重写一遍核心链路。六、资源清单官方/一手文档优先级最高OpenAI / Anthropic 官方 API 文档与 cookbookcookbook 质量极高LangGraph 官方教程与 examplesAgent 状态机LlamaIndex 文档RAG 与数据接入vLLM 文档与 benchmark 示例Hugging Face 文档Transformers、PEFT/LoRA、MTEB 榜单MCP 官方规范modelcontextprotocol.ioRAGas 文档RAG 评估中文体系化资源Datawhale《All-in-RAG》中文 RAG 全栈实战教程覆盖架构、场景、部署阶段 2 主力教材通义/DeepSeek 官方技术报告理解国产开源模型能力边界选型参考课程选 1–2 条主线即可贪多必输DeepLearning.AI 短课程系列Chatbots / RAG / Agent / Fine-tuning 各 1–2h性价比最高FastAPI 官方教程 Next.js 官方 docs工程底座《Attention Is All You Need》原文 3Blue1Brown 的 Transformer 可视化视频原理直觉论文按需读不必全读ReAct / ToolformerAgent 基础RAG 原始论文 Self-RAG / Corrective RAG进阶检索LoRA / QLoRA 论文微调原理各模型技术报告Qwen/Llama/DeepSeek 系列看能力与限制章节社区与信息源GitHub Trending 的 LLM 应用 repo、Hacker News “Who is hiring”持续校准岗位要求本地跑模型Ollama实验→ vLLM服务两条腿走路七、常见误区与心法误区心法“先刷完课再动手”每个知识点 24 小时内落到代码里项目是唯一老师“微调万能”顺序永远是Prompt → 结构化输出 → RAG → 微调。微调是最后手段且先用 2k 条数据验证收益“框架即能力”框架会过时你对 Token、延迟、成本、非确定性的理解不会“demo 炫技”生产价值 稳定性 × 成本 × 可评估性。能讲清 eval 曲线的工程师比只会贴 demo 的稀缺 10 倍“什么都上 AI”能用 10 行规则解决的别花 10 美分调 LLM。选型判断力是高级标志“孤狼式学习”第 20 周起强制输出博客/开源/分享让市场替你校准方向三句话总结AI 全栈工程师的护城河 传统工程功底 × LLM 应用工程 × 评测素养。把 LLM 当作贵、慢、不确定的数据库来设计系统就掌握了 80% 的秘诀。每 8 周一个可部署项目 一份评测报告12 个月后你的作品集会替你面试。本手册基于 2025–2026 招聘市场公开岗位要求的趋势整理Agent 编排、RAG 全链路、Evals、vLLM 自部署为高频硬技能建议每 6 个月对照最新岗位 JD 校准一次路线。
