大模型横向盘点:从闭源到开源,场景化选型与本地部署实战指南
这几年网上关于大模型的榜单和盘点铺天盖地但说实话大部分要么是厂商通稿味儿太浓要么就是把几百个模型名字罗列在一起看得人头晕最后也没整明白到底该用哪个。我花了不少时间把全球主流的大模型从闭源到开源捋了一遍结合自己的使用经验和部署踩坑记录整理出这份横向盘点。内容不说废话谁家强在哪、短板在哪、什么场景选谁、本地部署要什么配置尽量一次性说清楚。如果你想快速了解大模型生态、准备选型或者入行学大模型这篇应该能帮你省不少事。这份盘点不是简单列参数而是围绕“能不能用、好不好用、在什么场景下好用”来展开。毕竟大模型这东西跑分再高实际用起来拉胯也没用。我拆成闭源商业模型、开源可部署模型、场景化选型、本地部署、微调实战、避坑经验这几个部分挨个讲透。1. 为什么需要一份“不吹不黑”的大模型盘点1.1 盘点前先搞清楚大模型到底比什么很多人一上来就问“哪个大模型最强”这个问题本身就问错了。大模型不是单一体测项目更像选车轿车、SUV、跑车各有各的用处。同样是顶级模型有的擅长逻辑推理和数学有的擅长长文写作和润色有的多模态能力突出能看图看懂视频还有的代码生成能力强到可以当半个程序员用。横向盘点首先要解决的就是维度问题。我一般从四个维度看综合能力也就是常说的跑分MMLU、GPQA、HumanEval这些基准测试能反映模型的推理、知识和编程底子。上下文长度也就是一次能“记住”多少内容1万token和100万token的体验完全是两个世界。场景适配写论文、写代码、做客服、搞数据分析各有各的最优解。落地成本API价格、本地部署的硬件门槛、是否可以商用这个对个人开发者和中小企业来说往往比跑分更重要。把这几个维度搞清楚再去看那些五花八门的榜单你就能自动过滤掉很多营销噪音。1.2 横向盘点的框架闭源/开源、通用/垂直、参数/硬件我把知名大模型分成两大阵营闭源商用和开源可部署。闭源商用的代表有OpenAI的GPT系列、Google的Gemini、Anthropic的Claude以及国内的豆包、通义千问、文心一言、Kimi、智谱清言等。它们的优势是开箱即用效果经过大规模打磨API稳定但劣势是数据隐私存在第三方长期成本随调用量上升而且模型迭代方向不完全由你控制。开源可部署的代表有Meta的Llama系列、阿里的Qwen系列、DeepSeek、Mistral、微软的Phi等。它们可以下载权重部署在自己的服务器上也能进行微调但需要自己承担硬件成本和维护工作。开源模型这几年进步极快很多场景下已经逼近甚至反超闭源模型比如Qwen系列的中文能力和DeepSeek的推理能力都是同级别里让人惊喜的存在。至于参数和硬件简单说参数量越大智商基线越高但需要的显存和内存也越大。同一个模型还能通过量化压缩体积这背后就是“效果换体积”的反复权衡。这部分我在本地部署章节会详细展开。1.3 看完这份盘点你能得到什么我自己做技术选型时最烦的就是“这个模型强那个模型更强全都推荐”最后等于没推荐。所以这份盘点的目标很明确给你一套可落地的选择方法论。比如你是个写科研论文的研究生我会告诉你闭源里谁最会润色学术语言、开源里哪个中文模型性价比最高你是个独立开发者想在低配电脑上跑个私有模型我会告诉你该下载哪个量化版本、用哪个框架你想给公司私有化部署一个行业客服模型我会告诉你怎么评估参数量、要不要微调、微调到底做LoRA还是全量。这些都是实操中真正绕不开的问题也是我接下来要分章节讲透的内容。2. 闭源模型篇商用首选的实力派2.1 OpenAI GPT系列综合实力标杆但不是万能药GPT系列可以说是大模型浪潮的引爆者从GPT-3.5到GPT-4再到后来的GPT-4o系列每次迭代都能把“通用能力”这个词拉高一个档次。用GPT-4o处理复杂逻辑推理、多步数学题、代码debug这类任务整体成功率仍然是闭源模型里的第一梯队。它的思维链能力也让它在做规划类任务时明显更“懂人话”不会答非所问。但我必须泼点冷水。GPT系列在国内使用时存在网络访问和账号门槛API还需要处理跨境支付等问题。在实际项目里如果你做的是中文场景强、并发量高的业务成本会是一个绕不开的坎。GPT-4o单次多轮对话的综合成本比国内很多商业化模型贵一到两个数量级。如果你只是日常写写文案、聊聊天它当然是好选择但要做大规模商业化应用就得精打细算了。2.2 Google Gemini长上下文和多模态的优等生Gemini是Google押注全生态的模型系列Ultra、Pro、Flash几个档位对应不同算力和成本需求。它最让我印象深刻的地方有两个一是上下文窗口的长度Gemini 1.5 Pro支持100万token级别的输入什么概念呢一套几百页的技术文档、几十个代码文件可以一次性丢进去让它通读分析这种体验在别的模型上很难复制。二是原生多模态它从一开始就是图文音视频一起训练的不像很多模型是先做文本再做视觉扩展。Gemini在文档分析场景里非常抗打。我试过把一份几十页的PDF财报丢给它让它提取关键指标并做横向对比它输出的结构化表格几乎不需要二次修改。如果你经常处理长文档、长会议记录、大代码库Gemini的长上下文能力值得认真考虑。2.3 Anthropic Claude长文写作与代码的一把好手Claude系列尤其是Claude 3.5 Sonnet和Claude 3.7在写作和编程这两个方向的口碑一直很高。它生成的文字风格自然、结构感强特别适合作家、编辑、科研人员用来润色文稿。很多搞内容创作的朋友反馈Claude对中文长文的语感和段落节奏把握比GPT更细腻。在代码生成上Claude的Happening代码能力也经常在各种编程基准里霸榜尤其是在跨文件重构、理解整库代码架构这类任务上表现相当惊艳。不过Claude也有它的短板。它的多模态能力相对常规图像的精细识别不如GPT-4o和Gemini。另外官方API对某些地区的网络访问也有限制国内开发者直接调用并不方便。如果你是纯文本深度用户Claude目前依然是闭源模型里最值得考虑的那一个。2.4 国产闭源模型豆包、通义、文心、Kimi、智谱国产闭源模型这几年进步速度惊人很多场景下已经和国际一线掰手腕了。字节跳动的豆包依托强大的算力和流量生态在移动端Agent、实时语音交互上做得非常流畅日常问答和口语化对话很适合。阿里的通义千问在中文理解、企业知识库集成、复杂业务场景落地方面积累了丰富经验开放平台也完善。百度的文心一言在中文知识问答、古文解读、中国式长文本上有一定优势但对复杂推理的稳定性稍弱。月之暗面的Kimi以超长上下文闻名最初靠“高性能长文本处理”出圈处理超长PDF和网页内容时非常顺手。智谱的GLM系列则在中文逻辑推理和Agent能力上持续发力其开源和闭源产品线梯队完整企业级应用案例也很多。这些模型在API定价上普遍有优势且合规备案齐全国内开发者接入门槛低。坦诚讲如果你做的业务面向国内用户国产闭源模型往往是商用首选。它们内部也有差异需要大文件处理选Kimi需要多模态识图选豆包或通义需要深度逻辑推理选GLM需要接入企业流程选通义和文心。2.5 闭源模型怎么选一张表看懂模型核心优势适合场景需要注意GPT-4o综合能力强、推理稳定复杂任务、英文场景、Agent访问门槛、成本高Gemini 1.5 Pro超长上下文、原生多模态长文档分析、视频理解中文细节有时不稳定Claude 3.7长文写作、代码重构内容创作、编程开发多模态弱、访问限制豆包中文口语化、实时交互智能助手、移动端应用严肃分析稍弱通义千问中文理解全面、企业生态企业知识库、业务流程创意性写作一般Kimi超长上下文处理PDF阅读、网页分析通用推理不如头部智谱GLM中文逻辑推理、Agent复杂任务编排、客服生态还在完善3. 开源模型篇本地部署与二次开发的基石3.1 Meta Llama系列开源界的“Linux”Llama系列对开源大模型的贡献怎么强调都不过分。Llama 2让开源模型第一次真正具备了商用能力Llama 3和Llama 3.1则是直接把开源模型的能力拉升到了接近闭源第一梯队的水平。Llama 3.1 405B在多项基准上已经能和GPT-4扳手腕而Llama 3.1 8B和70B则成了很多中小团队私有化部署的默认起点。为什么说它像Linux因为整个开源生态的工具链、微调方案、量化格式、部署框架几乎都是围绕Llama系列建立起来的。你踩过的坑别人大概率也踩过搜一下就有现成方案。如果你第一次做本地部署从Llama系列入手遇到的问题会最少。缺点也不是没有。Llama的中文能力相对弱原生训练语料以英文为主中文场景需要依靠微调或者外部知识库来弥补。另外405B级别的模型本地部署的门槛很高没有多卡服务器基本跑不动。3.2 阿里Qwen系列中文场景的王者如果说Llama是开源界的坐标系那Qwen通义千问开源版就是中文开源模型里绕不开的存在。Qwen系列从0.5B到72B再到混 MoE 大模型覆盖极其完整。我最常用的是Qwen2.5-7B和Qwen2.5-14B这两个尺寸不管是效果还是资源消耗都卡得恰到好处。Qwen2.5系列在中文理解、中文写作、数学推理上同尺寸几乎没有对手。7B的Qwen2.5在多项中文测试里能打赢很多13B甚至更大的模型这对硬件紧张的个人开发者来说简直是福音。它对应的量化GGUF格式在Ollama上直接一条命令就能下载运行本地玩起来非常顺滑。还有一个亮点Qwen的开源版本和阿里云上的闭源版本不是一个路线开源版权重完全开放可以商用可以任意微调社区生态好到爆炸。我做微调项目时首选基座模型几乎都是Qwen2.5-7B后面会专门讲微调实战。3.3 DeepSeek性价比与推理能力的双优生DeepSeek是这两年开源界杀出来的黑马技术路线非常独特大规模采用MoE混合专家架构用更少的激活参数量撬动更强的效果。DeepSeek-V3和DeepSeek-R1系列推出后在推理和代码任务上表现极其突出尤其在数学和逻辑推理这类硬核任务上能对标甚至超过同尺寸的Llama和Qwen。DeepSeek的开源模型对开发者非常友好尤其在显存预算有限的情况下它的MoE架构让你可以用较小的显存跑一个“观感”很大的模型。比如DeepSeek-R1-Distill-Qwen-7B就是把R1的推理能力蒸馏到7B小模型上效果依然很能打。不过DeepSeek在长文本生成和多轮对话的自然度上相对专门的对话模型还有提升空间。它更适合推理密集型任务比如数学计算、逻辑分析、代码生成而不是陪你闲聊。3.4 Mistral、Phi、Gemma等值得关注的开源选手除了前面几位还有些开源模型在特定场景值得关注Mistral系列来自欧洲主打的法语等欧洲语言能力出众Mixtral 8x7B采用稀疏专家架构是MoE路线的先行者之一在英语任务处理上也有很高性价比。微软的Phi系列主打小模型1.5B到4B级别就能跑出远超同尺寸的效果特别适合端侧设备、边缘计算也是CPU推理的常客。Google的Gemma以Gemini技术为底子做开源小模型2B和7B在指令跟随和多语言上表现不错。国内的还有书生·浦语InternLM、Baichuan等也各有千秋。开源生态真正丰富的意义在于你不必非得用那个“最大最强”的模型完全可以为你的场景选一个尺寸最合适、能塞进你硬件里的模型。3.5 开源模型选型参考模型参数量核心优势本地部署难度Llama 3.18B/70B/405B生态完善、英语强8B易、70B需专业卡Qwen2.50.5B-72B中文能力全面7B/14B非常友好DeepSeek7B-671B推理和代码突出MoE省显存但部署复杂Mistral/Mixtral7B-8x7B欧洲语言、MoE先驱中等Phi-30.8B-14B小尺寸高效果极低可跑CPUGemma2B-27B多语言、指令跟随好低4. 场景化选型科研、编程、多模态与Agent怎么搭配4.1 写科研论文到底用哪个AI大模型这是热搜里非常高频的问题我身边也确实有很多研究生问。我自己的体验是不同阶段应该用不同模型。文献调研和知识问答阶段推荐用长上下文能力强的模型。把PDF文献直接丢给Kimi或者Gemini让它们帮你总结研究方法、对比实验数据效率极高。写作和润色阶段Claude的文本生成质量最好它擅长让表述更地道、逻辑更严密中文润色尤其自然。如果你要用LaTeX写公式GPT-4o对复杂Latex的理解和生成很稳定。数据分析和图表解读阶段找出一堆实验数据里的规律还是GPT-4o和Claude更可靠。如果学校要求代码和论文的原创性审查务必注意不要直接把大模型生成的内容原样提交。正确的用法是把它当作“深度学习助手”让模型帮你理思路、改语法、生成初稿框架然后你亲自改、亲自验证数据这个习惯建议大家从第一天就养成。4.2 编程与Agent场景Codex接入国产模型等实践现在编程辅助已经成为大模型最成熟的应用场景之一。GitHub Copilot、Codex这些工具的背后模型一直在迭代同时越来越多的开发者开始尝试把国产模型接入到编程工作流里。比如开源的Cline、Continue这类IDE插件就可以在配置里填写任何兼容OpenAI格式的API地址。我实际测试过把通义千问或者DeepSeek的API填进去在VSCode里做代码补全和简单重构体验已经非常接近GitHub Copilot而且中文注释能力更强。用的时候有几条经验值得分享代码模型的上下文管理非常重要一次丢太多文件会让模型抓不住重点需要提前用项目地图或者只选相关文件让模型先说出修改方案再动手比直接要代码可靠得多。编程场景的选型逻辑很简单复杂的架构设计和跨文件重构选Claude或GPT-4o日常补全和中文注释生成选国产模型就够用追求完全离线、隐私安全就本地部署一个Qwen2.5-14B或者DeepSeek蒸馏版。4.3 多模态需求识图、视频与文档解析多模态大模型是当前竞争最激烈的赛道。它要解决的不只是“看一眼图片说出是什么”而是把图像、音频、视频和文本统一理解。比如你拍一张电路板照片模型能不能根据引脚标注判断故障给它一段视频能不能理解运动轨迹。Gemini在原生多模态和超长上下文上领先GPT-4o在多模态指令跟随和细节识别上依然可靠国内的通义千问VL、豆包视觉版在中文图文理解上同样表现不俗。文档解析是多模态最实用的场景。以前解析一份扫描版PDF要么OCR后一片乱码要么手动录入现在一个多模态模型就能把表格、图片、手写批注整体理解掉。我自己处理技术文档时会同时用两个模型交叉验证提取结果正确率能提升好几个点。4.4 提示词工程与上下文工程把模型用到六成以上模型再好不会用也是白搭。提示词工程是基础操作但你更该关注“上下文工程”在给定上下文窗口里你怎么选择和排列信息。核心原则是把最重要、最直接的指令放在开头和结尾模型对这两处的注意力最高中间放背景和参考资料格式要求尽量写在需求后面。尝试给模型一个“角色设定”加“输出模板”比空泛地说“帮我分析”效果好得多。另一个实用技巧是“先总结后提问”如果资料很长先让模型总结出提纲再基于提纲追问既节约token又减少错误。还有个细节很多模型支持系统提示词和用户提示词分离。把固定的行为准则放在系统提示词里把每次任务变化的部分放在用户提示词里上下文管理和效果控制都会更清晰。5. 本地部署与模型落地从Ollama到vLLM5.1 先搞清楚显存与内存的账量化格式GGUF很多想玩本地大模型的人第一反应是“我的显卡行不行”但这里有个误区大模型部署吃的主要是显存但显存不够时可以用内存顶速度慢一点但能跑。你首先要算清楚模型需要多大空间。参数量的计算很简单模型大小约等于参数量乘以精度字节数。一个70亿参数的模型用FP16精度大概是14GB用INT4量化4bit只需要约4GB。这就是为什么GGUF量化格式能火它把32位或16位的权重压成4位或8位整数模型体积直接缩到四分之一甚至更小效果损失在可接受范围内。以Qwen2.5-7B为例Q4_K_M量化版体积大约是4.7GB。一块8GB显存的显卡就能完整放进显存里跑14B模型量化后约9GB16GB显存刚好32B模型量化后约20GB就需要24GB甚至更大的显存或者用CPU内存硬扛。这个账算明白选硬件就有底气了。5.2 部署工具怎么选Ollama、llama.cpp、vLLM工具选型是另一门学问我按使用场景推荐三个Ollama最适合个人玩和轻量应用一条命令就能拉模型、跑起来自带OpenAI兼容APIWindows、Mac、Linux通吃还能在Docker里跑。我平时测试模型就用它几乎没有上手成本。llama.cpp是大模型C推理框架性能极致CPU也能跑很多衍生工具如LM Studio、Jan都建立在它之上GGUF格式就是它家推广开的。如果你要自己编译、调底层参数选它。vLLM是做AI服务的高并发推理引擎支持Continuous Batching连续动态批处理吞吐量比前两者高一个数量级适合把模型封装成正式API服务对接多个用户同时调用。专业团队部署服务基本都会选vLLM。如果只是本地自己用Ollama足够如果要做产品给几十上百人用直接上vLLM。5.3 低配置硬件实战RX 6750 GRE、Mac与Windows 11提到显卡很多人第一反应是NVIDIA但AMD的RX 6750 GRE 16GB版本凭借16GB显存和相对便宜的价格成了很多预算有限的玩家训练和部署大模型的选择。AMD显卡跑大模型需要看推理框架的支持程度。Ollama在新版本里已经加入对AMD显卡ROCm的支持Windows下也能通过DirectML后端调用。在RX 6750 GRE上实测Qwen2.5-7B Q4量化模型推理速度大约每秒10-20个token日常问答完全够用但是跑14B以上模型就会开始吃力因为显存带宽不如N卡旗舰。Mac用户其实有天然优势。M系列芯片的统一内存架构让CPU和GPU共享内存一个M1 Pro 16GB的MacBook都能轻松跑7B-14B模型速度还很快。我这段时间在Mac mini M2上部署Qwen2.5-14B体验可以打8分。Windows 11下最简单的方式是装Ollama然后下载模型即可想有个可视化界面就装LM Studio鼠标点点就能选择模型、调整参数。这里有个关键经验显存不够时会有一部分层被放到内存里计算速度会明显下降但至少能跑。所以低配硬件不要追求大模型7B和14B是甜点位。5.4 Android等端侧集成GGUF模型移动端跑大模型是另一个热门趋势对应热搜里“Android app集成AI大模型GGUF”。核心思路就是利用llama.cpp的跨平台能力把GGUF模型直接打包进Android应用。实际做法是下载一个量化好的小模型比如Qwen2.5-1.5B或Phi-3-mini然后在安卓项目里引入llama.cpp的Android库通过JNI调用加载模型文件通过输入文本返回生成结果。现在很多AI应用里的离线翻译、离线语义搜索就是这么做出来的。小模型1.5B-3B在手机端跑起来很快但能力有限更适合做意图识别、关键词提取、摘要这类轻任务。如果要强的推理能力还得靠云端API端侧和云端结合是当前最合理的产品架构。6. 微调实战什么时候该动手怎么动手6.1 先泼冷水什么时候不该微调很多团队一上来就说“我们需要微调一个大模型”实际上大部分情况根本不需要。如果你的目标是让模型了解你的私有知识那正确的做法是用RAG检索增强生成把知识放在外部知识库里让模型检索后再回答。RAG的好处是知识可以随时更新、不需要昂贵的训练资源、不会破坏模型的原有能力。微调真正适用的场景有三个让模型学会一个全新的数据格式比如把用户query转成数据库查询语句、生成特定JSON结构让模型模仿特定的文风或表达习惯比如客服的说话方式、行业的报告风格让模型掌握非常垂直的领域推理模式比如医疗诊断建议、法律条文分析这些光靠提示词压不住。如果不在这个范围内微调就是浪费算力。6.2 LoRA/QLoRA选型与显存估算确定要微调后下一个问题就是全量微调还是参数高效微调全量微调要更新几十亿参数7B模型用bf16训练至少需要70GB以上显存普通消费级显卡根本跑不动。LoRA只微调一小部分低秩矩阵参数量只有原来的1%左右QLoRA更进一步把基座模型量化成4bit再挂LoRA7B模型的微调显存需求可以压到12GB以内一张中高端显卡就能跑。实际经验是单卡16GB显存选QLoRA微调7B模型比较稳32GB以上可以尝试LoRA多卡或企业级硬件才考虑全量微调。选LoRA还是QLoRA看你对效果丢失的容忍度QLoRA训练速度稍慢但显存压力小很多。新手从QLoRA起步踩坑成本最低。6.3 以Qwen2.5-7B为例的微调全流程以最常用的Qwen2.5-7B为例一套完整的微调流程分四步。第一步环境配置。推荐基于Python 3.10安装CUDA、PyTorch、transformers、peft、bitsandbytes、datasets。如果在AutoDL这类云GPU平台上跑选一张RTX 3090或4090就行。第二步准备数据。数据格式常用ShareGPT的对话格式一个JSON文件里每个样本包含若干轮对话。数据质量比数量重要几百条精心标注的数据效果往往强过几万条爬来的语料。第三步训练配置。用transformers的Trainer加载QLoRA配置设置学习率2e-4、批大小根据显存调整比如1-4、训练3-5个epoch。注意设置梯度累积和混合精度防止显存溢出。模型保存用checkpoint机制每几百步保存一次。第四步合并与导出。训练完成后LoRA适配器权重和基座模型合并导出为完整模型再转成GGUF格式交给Ollama或vLLM部署。这套流程被我复现过很多次踩过的坑包括中文数据忘了加结尾的|endoftext|标记导致生成混乱学习率设太大导致损失爆炸数据里有空字段导致训练中断。这些问题其实都有预兆提前检查数据格式能省一半时间。6.4 微调后的部署与效果验证微调完成后别急着上线。先跑一组验证集对比前后效果原来不会的格式是不是会了原来会的通用知识有没有退步常见的现象是微调后模型格式对了但通用知识变差这叫“灾难性遗忘”。对策是在数据里混入20%-30%的通用对话数据让微调不至于被垂直数据带偏。部署时如果只是内部工具用直接Ollama加载GGUF就够如果要做成服务用vLLM部署合并后的模型设好API端口同时保留一套回退逻辑一旦新版效果有问题能秒切旧版。这套“微调RAG部署验证”的闭环是我目前认为最实用的大模型应用落地路径。7. 高频问题与避坑实录7.1 排行榜不能直接抄作业各大评测榜单一出来总会引发“谁比谁强”的争论。但榜单有严重的局限性评测集本身存在污染模型可能训练时见过这些题榜单分数对中文场景、长文本场景的反映往往不准同一次测评、不同温度参数结果都会波动。我看到排行榜的正确用法是先筛出候选集再用自己的真实业务数据做对比测试。比如你自己的任务是抽取合同里的金额条款就拿真实合同去测每个模型统计抽取准确率。这样十个模型跑下来谁最适合你的场景一目了然。脱离业务谈排名大概率会选错。7.2 API调用与SSE流式输出的工程细节把大模型接入自己的应用最常用的协议是OpenAI兼容的API格式。调用时需要注意流式输出和中断请求这两个工程细节。流式输出通过SSEServer-Sent Events实现服务端把回答按token一个个推给前端前端实时渲染体验比等完整回答返回好太多。中断请求的场景是用户在AI打字的过程中点了“停止”这时前端要发一个abort信号后端立刻中断生成否则算力白白浪费。前端如果用JavaScript调用核心逻辑就是创建一个AbortController在fetch的signal里传入点击停止时调用abort。后端如果用Python FastAPI可以用StreamingResponse把生成器吐出的token流式返回。这些细节直接影响用户对产品的“丝滑感”值得好好打磨。7.3 知识抽取、数据安全与模型“投毒”问题大模型应用走深后知识抽取会成为一个高频需求尤其是想把非结构化文本变成结构化知识图谱时。开源方案里有专门的知识抽取框架能识别实体和关系。我在项目中试过用OneKE这类框架把技术文档里的关键实体抽取出来建索引再配合大模型做问答效果比直接把整篇文档丢给模型更好。这里必须提醒数据安全问题微调数据如果被恶意数据污染比如在训练数据里注入恶意指令可能让模型被“投毒”产生越狱或错误输出。所以训练数据必须严格清洗和审查不可靠来源的公开数据别直接灌给模型开源模型权重也要从官方渠道下载最好比对一下哈希值。这条对做企业项目的朋友尤为重要。7.4 大模型学习路线与资源推荐很多人想系统学习大模型但总觉得内容太多、无从下手。我给入门者画个简单路线第一阶段搞清楚基础概念Transformer架构、Token、注意力机制这些不用啃源码理解原理就行第二阶段学会调API用Python或其他语言跑通最基础的对话流程再学会流式输出、参数调节第三阶段上手开源模型本地部署一个7B模型跑通Ollama或者llama.cpp第四阶段做微调项目找一个垂直场景准备好数据走一遍QLoRA全流程第五阶段学习RAG和Agent把模型接进知识库和工具链。资源方面GitHub上有很多开源的学习项目比如上海交大的“动手学大模型”相关的项目仓库整理成了教程加实战非常适合跟着练。B站、知乎、公众号上也有一大批高质量教程但注意筛选信息的过期程度大模型迭代太快旧教程的模型版本和方法可能已经落后优先看近半年内的内容。个人实操体会盘点了这么多模型和工具我最后说一下自己的使用原则。第一不迷信最大模型75%的业务场景7B-14B模型就能高质量完成没必要硬堆大参数。第二闭源负责效果天花板开源负责成本和定制权两者是互补关系而不是对抗关系。第三每次模型选型都必做真实业务测试跑分和榜单只用来下候选集永远不等同于最终结论。第四落地项目优先考虑RAG只有RAG解决不了问题才考虑微调这样省钱省力还方便后续迭代。大模型领域可以说月月都有新变化今天的榜单明天可能就过时但这套“看懂生态、算清账、做测试、再落地”的方法论不会过时。希望这篇盘点对你选型和学习能有点实际帮助。如果你也在做模型落地欢迎按这套思路去试一遍大概率能帮你少走很多弯路。