手撕Transformer④:完整Encoder编码器实战(单层+多层堆叠+全链路维度闭环)
手撕Transformer④完整Encoder编码器实战单层多层堆叠全链路维度闭环摘要前三篇我们逐一拆解了Transformer所有基础零部件输入层词嵌入位置编码、多头自注意力、残差连接、层归一化、FFN前馈网络。但会单个模块≠懂Transformer绝大多数新手的卡点模块都看懂了拼在一起就完全看不懂数据流。本篇彻底打通最后一公里从零组装完整单层Encoder、详解6层堆叠逻辑、跑通完整前向传播、汇总全链路维度变化。全程沿用固定小实例把零散组件拼成完整可用的编码器彻底吃透Transformer编码端核心为后续Decoder搭建、大模型底层理解筑牢基础。前言我们用三篇文章完成了Transformer所有基础组件的拆解学习简单复盘核心模块分工输入层将自然语言 Token 转化为「含词义、含位置」的标准化向量是模型的输入基底多头自注意力全局上下文交互让每一个 Token 和句子所有 Token 建立语义关联解决序列依赖问题残差连接层归一化解决深层梯度消失、数值爆炸问题为网络堆叠提供核心保障FFN逐位置前馈网络单Token独立非线性特征强化挖掘深层语义细节。这些模块单独存在没有任何意义只有按照固定逻辑组合、层层堆叠才能形成 Transformer 真正的核心——Encoder 编码器。Encoder 的核心使命只有一个把原始输入序列转化为富含全局上下文、深层语义、位置信息的高级特征序列为解码器生成文本、分类任务、语义理解任务提供优质特征输入。本篇继续沿用系列固定实验配置全程无参数跳跃、无逻辑断层测试句子我、喜欢、打、篮球seq_len4批次大小batch1模型隐藏维度d_model4基础输入维度[1, 4, 4]一、先搞懂单层Encoder的固定流水线核心骨架Transformer 论文中单层编码器是严格固定的串行流水线不存在顺序调换、模块删减整套流程是模型训练收敛的关键。1.1 单层Encoder完整执行流程结合原版 Post-Norm 架构标准执行顺序如下输入向量 → 第一层归一化 → 多头自注意力计算 → Dropout → 残差相加 → 第二层归一化 → FFN前馈网络 → Dropout → 残差相加 → 最终输出1.2 模块分工终极复盘全篇最核心认知单层编码器内部两个子层各司其职、完美互补构成完整特征提取闭环注意力子层全局交互核心功能打破 Token 孤立状态完成句内全局信息互通解决问题让“打”关联“篮球”、让“我”关联“喜欢”学习语句语法、语义依赖输出特征每个Token都融合全句上下文信息FFN子层局部强化核心功能对融合完上下文的向量做独立非线性特征升级解决问题挖掘细粒度语义差异丰富特征表征区分相似语义输出特征语义更饱满、区分度更高的高级Token向量1.3 为什么必须是「先注意力、后FFN」很多新手疑惑能不能先FFN、后注意力答案绝对不行逻辑完全颠倒。如果先FFN单个Token还没交互上下文单独强化自身特征属于无效加工无法学习语句关联标准顺序先全局互通再局部精加工先让Token拥有上下文再对上下文特征做深度优化完全贴合人类语言理解逻辑。二、逐步骤拆解单层Encoder前向传播全流程我们以输入向量x [1, 4, 4]为例一步一步走完单层编码器全流程全程标注维度变化彻底理清数据流。步骤1输入预处理输入为上篇最终输出经过词嵌入位置编码的完整序列向量维度[batch1, seq_len4, d_model4]无无效Padding占位无需额外掩码处理。步骤2注意力子层计算含归一化残差对输入x做 LayerNorm 归一化稳定特征分布送入多头自注意力完成全局上下文融合注意力输出做 Dropout 正则抑制过拟合与原始输入x做残差相加保留底层特征与梯度通路再次归一化输出注意力子层特征。✅ 此步骤维度全程不变始终保持[1,4,4]步骤3FFN子层计算含归一化残差对注意力子层输出做 LayerNorm 归一化送入逐位置FFN网络4维升8维非线性激活再降回4维FFN输出做 Dropout 正则与注意力子层输入特征做残差相加最终归一化输出完整单层Encoder特征。✅ 全程维度恒定完美满足残差连接要求为多层堆叠提供基础。三、源码整合完整单层Encoder可直接运行整合前三篇所有模块LayerNorm、FFN、多头注意力、残差子层封装实现原版无魔改单层Encoder代码完全对齐 Annotated-Transformer 官方实现。importtorchimporttorch.nnasnnimportmath# 克隆网络层工具defclones(module,N):returnnn.ModuleList([modulefor_inrange(N)])# 层归一化classLayerNorm(nn.Module):def__init__(self,features,eps1e-6):super().__init__()self.gammann.Parameter(torch.ones(features))self.betann.Parameter(torch.zeros(features))self.epsepsdefforward(self,x):meanx.mean(-1,keepdimTrue)stdx.std(-1,keepdimTrue)returnself.gamma*(x-mean)/(stdself.eps)self.beta# 残差归一化子层classSublayerConnection(nn.Module):def__init__(self,size,dropout):super().__init__()self.normLayerNorm(size)self.dropoutnn.Dropout(dropout)defforward(self,x,sublayer):# 原版Post-Norm逻辑returnself.norm(xself.dropout(sublayer(self.norm(x))))# 多头注意力classMultiHeadedAttention(nn.Module):def__init__(self,h,d_model,dropout0.1):super().__init__()assertd_model%h0self.d_kd_model//h self.hh self.linearsclones(nn.Linear(d_model,d_model),4)self.attnNoneself.dropoutnn.Dropout(pdropout)defattention(self,q,k,v,maskNone,dropoutNone):scorestorch.matmul(q,k.transpose(-2,-1))/math.sqrt(self.d_k)ifmaskisnotNone:scoresscores.masked_fill(mask0,-1e9)p_attntorch.softmax(scores,dim-1)ifdropoutisnotNone:p_attndropout(p_attn)returntorch.matmul(p_attn,v),p_attndefforward(self,query,key,value,maskNone):ifmaskisnotNone:maskmask.unsqueeze(1)nbatchquery.size(0)query,key,value[l(x).view(nbatch,-1,self.h,self.d_k).transpose(1,2)forl,xinzip(self.linears,(query,key,value))]x,self.attnself.attention(query,key,value,mask,self.dropout)xx.transpose(1,2).contiguous().view(nbatch,-1,self.h*self.d_k)returnself.linears[-1](x)# 逐位置前馈网络classPositionwiseFeedForward(nn.Module):def__init__(self,d_model,d_ff,dropout0.1):super().__init__()self.w1nn.Linear(d_model,d_ff)self.w2nn.Linear(d_ff,d_model)self.dropoutnn.Dropout(dropout)defforward(self,x):returnself.w2(self.dropout(torch.relu(self.w1(x))))# 单层Encoder层classEncoderLayer(nn.Module):def__init__(self,size,self_attn,feed_forward,dropout):super().__init__()self.self_attnself_attn self.feed_forwardfeed_forward# 两个子层注意力、FFNself.sublayerclones(SublayerConnection(size,dropout),2)self.sizesizedefforward(self,x,mask):# 1、自注意力子层xself.sublayer[0](x,lambdax:self.self_attn(x,x,x,mask))# 2、FFN子层returnself.sublayer[1](x,self.feed_forward)# 测试运行if__name____main__:# 超参配置系列统一batch_size1seq_len4d_model4# 初始化单层Encoder组件attnMultiHeadedAttention(h2,d_modeld_model)ffnPositionwiseFeedForward(d_modeld_model,d_ff8)encoder_layerEncoderLayer(sized_model,self_attnattn,feed_forwardffn,dropout0.1)# 模拟输入向量xtorch.randn(batch_size,seq_len,d_model)# 无padding无需掩码maskNone# 单层Encoder前向传播outencoder_layer(x,mask)print(f单层Encoder输入维度{x.shape})print(f单层Encoder输出维度{out.shape})运行结果输入输出维度一致[1, 4, 4]单层编码器搭建完成四、多层Encoder堆叠为什么论文固定堆6层原版 Transformer 论文中编码器采用6层完全相同的EncoderLayer堆叠很多新手误以为“6层是固定玄学”实则是层级特征递进的最优设计。4.1 多层堆叠核心逻辑堆叠不是简单的重复计算而是特征逐层抽象、逐级升级的过程浅层Encoder1-2层学习基础语法特征、简单词汇关联、局部语序关系中层Encoder3-4层学习短句语义、主谓宾搭配、短语级上下文关联深层Encoder5-6层学习整句全局语义、逻辑关系、抽象语义特征输出最终高级表征。4.2 多层Encoder完整源码封装多层堆叠逻辑适配论文6层配置可自由修改堆叠层数classEncoder(nn.Module):def__init__(self,layer,N):super().__init__()# 堆叠N层Encoderself.layersclones(layer,N)# 最终归一化输出self.normLayerNorm(layer.size)defforward(self,x,mask):# 逐层前向传播forlayerinself.layers:xlayer(x,mask)# 最终归一化输出returnself.norm(x)# 多层编码器测试if__name____main__:batch_size1seq_len4d_model4# 初始化基础组件attnMultiHeadedAttention(h2,d_modeld_model)ffnPositionwiseFeedForward(d_modeld_model,d_ff8)encoder_layerEncoderLayer(d_model,attn,ffn,0.1)# 堆叠6层论文标准配置encoderEncoder(encoder_layer,N6)xtorch.randn(batch_size,seq_len,d_model)outencoder(x,maskNone)print(f6层Encoder最终输出维度{out.shape})✅ 无论堆叠多少层输出维度永远和输入一致完美适配深层网络训练五、全网最清晰Encoder全链路维度闭环表结合本系列固定参数汇总从输入向量到多层编码器输出所有环节维度彻底解决维度混乱问题网络环节输出维度 Shape核心说明词嵌入位置编码输入[1, 4, 4]模型原始输入向量多头注意力输出[1, 4, 4]维度不变融合全局上下文注意力残差归一化[1, 4, 4]稳定特征保留梯度FFN升维降维计算[1, 4, 4]中间维度临时升高最终还原单层Encoder最终输出[1, 4, 4]完成一轮特征提取6层堆叠Encoder输出[1, 4, 4]多层抽象后的高级语义特征核心结论Encoder 所有层、所有子层全程不改变张量维度只做特征变换、信息融合、语义升级这是Transformer架构最精妙的工程设计。六、Encoder核心能力总结通俗版用最直白的话总结编码器的作用彻底吃透核心逻辑Encoder 不生成文字只理解文字。它接收一整句完整输入通过多层注意力交互、非线性特征强化把每一个原始词向量从「孤立的字面含义」升级为「融合全句上下文、包含语法逻辑、携带深层语义」的高级向量。最终输出的特征矩阵就是模型对整句话的完整理解可以直接供给分类、聚类、语义匹配任务也可以送入Decoder完成文本生成。 本章新手避坑清单❌ 误区多层Encoder堆叠会改变特征维度 ✅ 事实全程维度恒定仅做特征迭代升级❌ 误区注意力和FFN顺序可以调换 ✅ 事实必须先全局交互、后局部加工顺序不可逆❌ 误区6层堆叠是固定参数不能改 ✅ 事实6层是论文最优配置可根据任务增减层数❌ 误区Encoder可以做文本生成 ✅ 事实Encoder仅负责语义理解无生成能力生成依赖Decoder❌ 误区残差连接会更新维度信息 ✅ 事实残差仅做逐元素相加不改变任何维度结构小结1. 单层Encoder由「多头注意力子层FFN子层」构成遵循固定的归一化、残差、正则流水线是特征提取的基础单元2. 注意力负责全局Token交互FFN负责单Token特征强化二者配合完成单轮语义升级3. 多层堆叠实现特征逐级抽象浅层学基础语法深层学全局语义6层为论文最优配置4. Encoder全程维度恒定输出的上下文特征矩阵是Transformer语义理解、文本生成的核心输入。我们已经搞定Transformer编码端全部逻辑下一篇第5篇我们攻克全网最难、最易混淆的Decoder解码器详解因果掩码、自回归生成、交叉注意力KV匹配逻辑彻底打通Transformer完整架构