本文介绍了TypeSafe AI发布的Jev模型它不同于传统语言模型能直接对输入材料回答限定形式的问题并返回概率答案。文章回顾了Transformer架构的发展包括BERT、GPT等模型的分化路径以及Decoder-only模型成为主流的原因。Jev作为新一代模型通过并行采样和RLCD训练方法实现了快速、准确的决策支持。此外文章还对比了Jev与开源模型Laya并探讨了未来大模型的发展方向。对于想要了解和学习大模型的程序员来说本文提供了宝贵的参考和指导。01 Transformer 与翻译提出 Transformer 的论文《Attention Is All You Need》针对的任务是机器翻译因此原始结构是两段式的Encoder 读取源语言句子输出一组上下文向量Decoder 通过 cross-attention 读取这组向量同时逐词生成目标语言句子。Encoder 对源句子只运行一次Decoder 每生成一个词运行一次生成的词接回输入后再生成下一个。两段式框架本身并不是这篇论文的贡献RNN 时代的 seq2seq 模型已经采用同样的结构。它的贡献在于用注意力attention完全取代了循环结构。循环网络逐词读入每一步的状态由上一步传来第 n 个词必须等前 n−1 个词处理完注意力则在处理每一个词时直接查看句子里的其他词按相关程度加权汇总它们的信息所有位置可以同时计算。一层注意力加一层前馈网络构成一个基本单元堆叠数十层就是一个 Transformer。并行计算让 GPU 得以充分利用后来模型规模扩展到千亿参数这是工程上的前提。Encoder 与 Decoder 的差别也在注意力上Encoder 读取源句子时每个位置都能看到整句注意力是双向的Decoder 生成时每个位置只能看到自身及之前已生成的词注意力是因果的下一节的可见范围图会以具体句子展示这一区别。模型实际处理的单位是分词器切出的 token中文约对应一个字到一个词英文约对应一个单词或其一部分。02 三条技术路线的分化2018 年前后研究者发现 Transformer 的两个部件可以拆开单独使用并且各自适合不同的预训练任务。由此形成三条技术路线。它们在层结构上几乎相同实质差异只有两点注意力的可见范围即读取输入时能否看到后文以及预训练任务即训练时做的是填空还是续写。这两点决定了模型适合什么任务。Encoder-only 路线由 BERT2018 年 10 月开创只保留读的那一半预训练任务是完形填空随机遮住句子里的一部分词让模型依据前后文还原。Encoder-Decoder 路线以 T52019 年 10 月为代表两半都保留预训练任务是遮住一段话由 Decoder 补出来适合翻译、摘要这类输入输出形态固定的任务。Decoder-only 路线由 GPT-12018 年 6 月开创只保留写的那一半预训练任务就是续写给定前文预测下一个词。这里顺带说明一个容易混淆的名称Decoder-only 模型中的 Decoder 已经不包含 cross-attention因为没有 Encoder 可供读取它在结构上等价于一个施加了因果掩码的 Encoder沿用 Decoder 之名只是历史原因。Encoder-only 路线退出了通用能力的竞争但一次前向、毫秒级延迟的特点使其在检索、推荐、内容审核等高吞吐判别场景中仍被广泛使用2024 年发布的 ModernBERT 即为例证。这类模型的使用方式是“预训练加微调”预训练得到的 BERT 本身只会填空要让它做某个具体判断需要在输出端接一个分类头用该任务的标注数据微调整个网络。微调后的模型读取输入一次直接输出各类别的概率但它只会这一个任务类别集合在训练时就已固定换一个任务就要重新标注、重新微调。03 Decoder-only 成为主流推理过程prefill 与 decode对 Decoder-only 模型而言“理解输入”与“生成输出”并不对应两个网络而是同一个网络、同一套参数在推理时的两个阶段。第一阶段称为 prefill整段 prompt 一次性输入网络所有 token 并行计算各层的键、值向量存入缓存KV cache供后面的 token 查阅。这一阶段计算密集对应用户感知到的首 token 延迟。第二阶段称为 decode网络基于 KV cache 逐 token 生成每生成一个 token 就将其键、值追加进缓存。这一阶段串行且访存密集每一步都要读取全部权重与全部缓存对应用户感知到的生成速度。“输出读取输入”这件事在 Decoder-only 结构里同样发生只是不再通过 cross-attention而是通过普通的自注意力回答的每个 token 与 prompt 处于同一条序列直接查看 prompt 各位置的键、值即可。代价是 prompt 内部只能单向可见但经过数十层堆叠后prompt 末尾位置已经聚合了前文的信息实践中这一限制没有成为明显的短板。成为主流的原因训练信号更密集。续写任务在句子的每一个位置上都能出一道题每个词都是前文的预测目标填空任务只能在被遮住的少数位置上出题。同样一批文本前者提供的训练信号要多得多。任务形态统一。对话、代码补全、思维链推理、工具调用都可以表述为“在同一序列上继续生成”不需要为每类任务重新定义输入与输出的边界。GPT-32020175B展示的上下文学习能力即仅在 prompt 中给出少量示例就能完成新任务正是这种统一带来的。KV cache 可以复用。因果掩码保证已处理 token 的键、值不受后续内容影响多轮对话与 agent 循环只需追加。双向 Encoder 不具备这一性质每次新增输入都要重新计算。Wang 等人 2022 年的系统对比给出了经验上的结论在只做大规模无监督预训练、不做针对性微调的设定下Decoder-only 配合续写目标的零样本泛化能力最强双向可见性配合填空目标的优势要在多任务微调之后才体现。行业的投入方向恰好是前者。04 后训练与推理模型ChatGPT 是 OpenAI 在 2022 年 11 月发布的对话产品最初的底层模型是 GPT-3.5此后随 GPT-4、GPT-4o、o 系列直到当前的 GPT-5.x 不断更新OpenAI 自 GPT-4 起不再公开架构细节但它们都是自回归、逐 token 生成的 Decoder-only 模型。ChatGPT 的对话能力并非来自结构上的变化而是预训练之后的若干轮后训练。2024 年之后的推理模型如 OpenAI o1 和 DeepSeek-R1同样没有改变架构而是通过强化学习使模型在给出答案之前先生成较长的思考过程。RLHF 的做法是由人对模型的多个回答排序训练一个奖励模型去拟合人的偏好再以强化学习使模型输出向高奖励方向偏移。这使模型的输出风格贴近标注者的偏好但也带来两个已被证实的副作用。其一是校准性下降OpenAI 在 GPT-4 技术报告里给过一组对照预训练模型给出的置信度与实际正确率基本一致自称八成把握的题目约有八成答对经过后训练之后这种一致性明显变差。其二是过度自信因为标注者倾向于偏好语气确定的回答。推理模型的思考过程本身仍是逐 token 的自回归生成只是不呈现给用户。它提高了模型在数学、代码等可验证任务上的能力代价是单次回答的延迟从秒级提高到分钟级。05 前沿模型与发展主线以 2026 年的两个开源模型为例9 月发布的 DeepSeek-V4.1-Flash 与 8 月开源的 Qwen3.8-27B可以看到前沿模型与上述主线的关系。两者仍然是自回归、逐 token 生成的 Transformerprefill 与 decode 两阶段、后训练流程均原样适用。近几年的架构创新没有改变这一骨架而是集中在骨架内部的组件上目标基本一致在同等能力下降低计算量与显存占用。变化最集中的是两处。一是前馈网络改为 MoE混合专家将每层的前馈网络拆分为数百个子网络每个 token 只激活其中少数几个使总参数量与每 token 的计算量解耦。DeepSeek-V4.1-Flash 总参数 552B、每 token 激活 16B即属此类Qwen3.8-27B 则是 27B 全部激活的密集模型。二是KV cache 的压缩长上下文与 agent 场景下缓存占用超过权重本身各家路径不同。DeepSeek 采用低维潜向量压缩加稀疏选择并在 V4.1-Flash 中将前 20 层作为因果 encoder、后 20 层的键值由其投影得到使 prefill 只需运行一半网络Qwen 自 Qwen3-Next 起将每 4 层中的 3 层替换为线性注意力Gated DeltaNet以固定大小的状态替代逐 token 缓存。V4.1-Flash 的“encoder-decoder”与第 01 节面向翻译的两段式结构含义不同它的 encoder 仍为因果掩码整个模型仍是标准的自回归语言模型只是 decoder 层不再自行计算全局键值。判断一个模型属于哪条路线看的不是名称而是两点注意力是否为因果掩码以及结果是否由逐 token 生成得到。DeepSeek 与 Qwen 在这两点上与 GPT-3 完全一致Jev 在第二点上不同。06 Jev为什么要另做一类模型TypeSafe AI 于 2026 年 9 月 15 日发布 Jev。创始人是 InstructGPT 论文的作者之一曾在 OpenAI 负责后训练发布文章的第一句话是他们的问题所在“Models have been superhuman at chat for years, so where is all the automation?”他们的解释是RLHF 训练出来的模型从设计上就是为协助人而准备的奖励模型拟合人类评分者的偏好模型学会让回答看起来正确而不是让概率反映真实的正确率。一个模型如果在 95% 的情况下能完成任务却无法指出剩下的 5% 在哪里就不能用于无人值守的自动化。TypeSafe 把自己的方法 RLCDReinforcement Learning for Calibrated Decisions与 RLHF、RLVR 并列为第三种后训练范式前两者分别优化人类偏好和可验证奖励RLCD 优化校准的决策训练出的模型“不生成文本返回决策与概率”。“System One”一名取自卡尼曼的快慢两种思考LLM 被归为慢的系统二Jev 定位为快的系统一。状态与问题每次请求提供一段state待判断的材料可以是字符串、JSON 对象或数组再附上任意数量的问题。问题限定为三种原语原语问题类型返回示例Choice从最多 255 个选项中选一个各选项的概率以及一个置信度这张工单应交给哪个团队Score在 2–10 个有序等级中评级概率加权的分数客户的不满程度Noul判断一个陈述是否成立一个 0–1 的概率这条消息是否紧急文档中的一个例子对同一条客服消息同时问三个问题返回的是每个问题上的概率分布而不是文本。// 请求 { state: Hi, Ive been trying to connect my Stripe account for 3 days and the integration keeps failing. Im losing sales. Please help ASAP., questions: { department: { type: choice, instructions: Which team should handle this, criteria: { billing: …, technical: …, sales: … } }, frustration: { type: score, instructions: How frustrated the customer appears, criteria: [ Calm, Frustrated but civil, Very angry ] }, is_urgent: { type: noul, instructions: The message conveys urgency } } } // 响应 { answers: { department: { choice: technical, confidence: 0.78, probabilities: { technical: 0.85, billing: 0.15, sales: 0.0 } }, frustration: { score: 1.0, probabilities: { 0: 0.0, 1: 1.0, 2: 0.0 } }, is_urgent: { noul: 1.0 } } }confidence由概率分布的形状算出分布均匀时为 0完全集中时为 1文档建议按它分流高置信度自动执行低置信度交给人处理。官方指标多数查询约 100 ms同一请求内增加问题几乎不增加延迟每百万输入 token $0.042输出免费仅支持文本英语为主不开源。拆分问题TypeSafe 主张的形态是代码掌握控制流只在需要常识判断的地方调用模型而且每个问题都要拆到原子。以垃圾邮件识别为例不问“这是不是垃圾邮件”而是对同一封邮件同时问六个 Noul是否索要凭据、是否声称意外奖励、是否制造时间压力、发件人与域名是否冲突、链接域名是否冲突、链接文字是否掩盖目标。六个问题并行评估返回六个概率由代码加权合成风险分数并设阈值。与语言模型的关系Jev 很可能以预训练的 Transformer 作为底层网络它能理解任意自然语言问题的能力就来自这里这一部分与 LLM 同源。不同的是结果的产生方式。LLM 无论输出普通文本还是 JSON都要经过 decode 阶段逐 token 生成再由调用方解析字符串Jev 在 prefill 之后不进入 decode而是直接从网络中读出每个问题在各选项上的概率分布。这与给 LLM 加一个强制 schemaJSON mode、structured output 之类不是一回事后者只是约束了生成出来的字符串的格式逐 token 生成的过程一步没少前者根本没有生成过程。发布文章里把这一区别写作“串行采样”与“并行采样”所谓“类型安全”也由此而来输出被限定在给定选项上不可能出现选项之外的内容。另一个参照是第 02 节的 BERT 分类器。两者计算形态最接近都是读取输入一次、直接给出类别概率。区别在任务怎么指定BERT 分类器的任务在微调时写进参数类别固定换一个判断就要重新标注和训练Jev 的问题与选项是请求的一部分调用时用自然语言写出。这种通用性来自 LLM 级的底层网络BERT 只做过填空预训练、规模数亿读不懂“发件人显示名与邮箱域名是否冲突”这样的指令。代价也对应存在在标注充足的固定任务上专门微调的 BERT 往往更准。对 Jev 的理解官方没有公开架构只有“新的模型架构、并行采样器、RLCD 训练方法”几句。但从 API 的行为可以推断它的形态同一请求里增加问题数量几乎不增加耗时说明 state 只读取一次、各问题并行处理255 个选项与 2 个选项耗时相同说明没有逐 token 解码选项的位置会影响准确率第 06 节把 Jev 拆成两部分一个 LLM 级的底层网络和一种一次前向直接读出概率的输出方式。Jev 发布三天后的 9 月 18 日以 Apache 2.0 开源了 Laya定位是“33 ms 的开源 System 1 决策引擎”其思路源于2025年的研究社区则普遍称之为开源版的 Jev。它的输出方式与本文对 Jev 的推断相近底层网络则是一个公开的、小得多的 encoder。Laya 的结构可以从开源代码直接读出。底层网络是 ModernBERT-large一个 4 亿参数量级的双向 encoder即第 02 节 Encoder-only 路线的当代版本其上接一个小的决策头。每个问题被拼成一条序列问题类型和指令在前各个选项在中间每个选项前放一个 [MASK] 标记state 接在最后。序列经过 encoder 和决策头后在每个 [MASK] 位置取出隐向量打一个分对同一问题的所有选项做 softmax就得到概率分布。三种原语与 Jev 相同训练目标同样是概率的校准。它一次最多读入 512 个 token约一封邮件的长度。发布版本给出的概率整体偏高即声称的把握高于实际的正确率建议使用者先在自己的数据上做一次校准再依据这些概率做决策。按前文的划分Laya 是 BERT 分类器往前走了一步把选项写进输入而不是写进参数于是不必为每个任务重新训练。这一步正是第 06 节里 Jev 与 BERT 分类器之间的差别Laya 用一个 4 亿参数的 encoder 走了同一步。就结果的产生方式而言它与本文对 Jev 的推断相近一次前向、按选项读出概率、以校准为训练目标。差别在底层网络。Jev 的参数量与结构均未公开本文依据其零样本表现推断它以 LLM 级的因果 Transformer 为底层Laya 的底层则是确定的一个只做过填空预训练、4 亿参数的双向 encoder。同样的输出方式装在 4 亿参数的 BERT 上零样本判断的表现远不及 Jev公布的最好成绩也来自针对评测集微调后的版本而输出方式本身用开源 encoder 加一个读出头即可实现Laya 和随后出现的多个类似项目都是例子。两相对照Jev 与这些开源实现的差距不在读出方式而在读出方式之下的网络能在不训练的前提下读懂任意问题依赖的是 LLM 级的理解能力。对使用者而言在自己的数据上做固定判断微调后的 Laya 是可用的开源方案需要零样本处理任意问题目前仍要 LLM 级的底层网络。08 全貌回到开头的问题。从 Transformer 到今天主流模型的骨架没有变过ChatGPT 与推理模型改变的是训练方式DeepSeek 与 Qwen 改变的是内部组件。Jev 保留了这套骨架的读取部分和 LLM 级的理解能力去掉了生成部分Laya 的对照则说明去掉生成这一步本身并不难难的仍是底层网络的理解能力。Jev 不是 LLM 的替代而是同一底层网络在另一类任务上的另一种用法。是否适用取决于任务本身需要的是自由的文本生成还是在有限选项之间做出判断。最后2026 年一晃已经过半AI 大模型的热潮不仅没有降温反而持续升温金融行业用大模型做风控、医疗依靠 AI 解析影像电商、制造、教育各行各业都在把 AI 融入日常业务。曾经热闹的 “百模大战”早就告别单纯比拼模型参数正式进入落地应用时代。现在企业疯狂紧缺一类人才懂业务、懂 AI、能做出可上线项目的大模型开发工程师岗位缺口大薪资待遇十分可观。风口再好不如手握高薪 offer 实在。行情火热普通人、程序员该怎样从零入门大模型抓住这波机会今天整理好【2026 最新版】AI 大模型全套免费学习资源覆盖零基础入门、项目实战、理论知识、大厂面试从基础一路进阶。所有资料分类归档没有多余杂料无套路免费分享给想要入局 AI 赛道的程序员与零基础小白扫码免费领取全部内容1、大模型系统化完整学习路线2、大模型经典书籍文档3、AI 大模型最新行业研究报告4、企业级实战项目 完整配套源码5、大厂大模型面试真题汇总6、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
