PPT Master 论文精读示例实战:从《Attention Is All You Need》Figure 1 拆解 Transformer 架构总览
PPT Master 论文精读示例实战从《Attention Is All You Need》Figure 1 拆解 Transformer 架构总览【免费下载链接】ppt-masterAI turns documents or topics into real, native PowerPoint decks—with native shapes, transitions and animations,>项目地址: https://gitcode.com/GitHub_Trending/ppt/ppt-master本篇技术指南以 ppt-master 仓库中「Attention Is All You Need」论文精读示例的第五页讲稿 05_architecture_overview.md 为核心骨架系统讲解 Transformer 的整体架构——输入嵌入与位置编码、编码器栈、解码器栈、残差与层归一化以及 Linear Softmax 输出端。文中同时结合同目录下相邻讲稿、设计规格 design_spec.md 与 SVG 成品页给出这一架构知识点如何在 PPT Master 中被还原成一张可导出为原生 PPTX 的论文精读页。读完你可以独立讲清 Figure 1 每一层方块的含义并掌握该示例仓库「每页一讲稿、自底向上读论文图」的工程组织方式。一、先定位这是精读 Deck 中的哪一页讲给谁听Attention Is All You NeedVaswani et al., 2017是一份 16 页的论文精读 PPT存放于 examples/ppt169_attention_is_all_you_need/针对 AI/NLP 工程师、机器学习研究生与论文精读小组。该示例遵循 PPT Master 的每页一份讲稿约定见 design_spec.md 的 Speaker Notes Requirements每个演讲页在notes/目录下有一个与 SVG 页面同基名的.md讲稿文件例如05_architecture_overview.svg对应notes/05_architecture_overview.md同时汇总版 total.md 使用#标题组织全部 16 页。本文所述的 05 号讲稿处于整个 Deck 的Part 3The Transformer页标题为「Encoder–Decoder, stacked self-attention, point-wise FFN」是全套架构拆解的第一张总览图——它对应的就是论文 Figure 1。整页按照 design_spec 第 IX 节的规划采用论文原图 右侧编号热点图注1-5 条 sidebar legend的信息架构从原始架构图中引导出五个关注点与后续各页注意力机制、位置编码等形成先总览、后深入的阅读节奏。二、读图方法论为什么 Transformer 架构图要自底向上读讲稿开头就给出一个关键阅读指令Read it from the bottom up.自底向上读。这张图本质上是一条数据流管线而不是抽象的关系图自底向上的顺序恰好就是前向传播inference时数据真实流经的路径输入侧Encoder 下方源序列 token 先映射为嵌入向量叠加正弦位置编码数据向上穿过 N 个相同的编码器层编码器输出作为键/值供给右侧解码器的交叉注意力层输出侧Decoder 下方已生成的目标 token 经嵌入 位置编码进入解码器解码器输出向上经过一层线性投影与 Softmax最终产出下一个 token 的概率分布。05_architecture_overview.svg 中编号图注 1–5 正是按这条顺序组织的Inputs Positional Encoding→Nx Encoder block→Nx Decoder block→Add Norm包裹规则 →Linear Softmax — output probabilities把图注文字与右侧原图一一对应方便演讲者顺着数据流逐条解释。讲稿中给图的读者定的阅读契约是架构骨架与早期 seq2seq 模型相同真正的创新在于盒子里面装了什么。因此下面每一节都在做两件事——先讲清盒子间的连接方式骨架再说明每个盒子内的实现填充物。三、输入端嵌入向量 正弦位置编码自底向上的第一步是输入。架构中 Encoder 与 Decoder两侧的输入都先被表示为 embedding并叠加一份正弦位置编码sinusoidal positional encoding。为什么要显式加位置编码因为 Transformer 没有循环也没有卷积模型本身没有任何关于 token 顺序的内建概念这一点在 11_positional_encoding.md 中单独展开。论文采用的是一份确定性、不参与学习的正弦编码偶维索引2i使用正弦奇维索引2i1使用余弦波长从2π到10000·2π构成几何级数对应公式PE(pos,2i) sin(pos / 10000^(2i/d_model))d_model即嵌入维度关键性质对任意固定偏移 kpos k处的编码可以写成pos处编码的线性函数因此模型可以用简单的线性组合来按相对位置进行注意力。用讲稿的原话概括就是 Order is injected, not learned顺序是被注入的不是学出来的。该 Deck 对这条公式的处理也值得一提design_spec 的 Formula Rendering Policy 规定 block 级公式渲染为 PNGformula_003.png即位置编码公式透明背景、主色#1A365D而d_model512、O(n)这类行内短数学保留为可编辑文本兼顾公式精度与排版可编辑性。四、编码器栈六个相同层每层两块架构图左侧的Encoder 是 N 个完全相同层的堆叠示例中 N6design_spec 第 IX 节 P06 内容标注 Encoder (N6)。每一层内部包含两个子层sub-layer多头自注意力Multi-Head Self-Attention——同一层内每个位置都能关注到本层其它所有位置逐位置的Position-wise前馈网络 FFN——两个线性层中间夹一个 ReLU内维 2048且对每个位置用完全相同的一组参数、逐位置独立应用见 10_ffn_residual_layernorm.md。每个子层外面都套着一层Add Norm即残差连接 层归一化见第五节。设计细节上多头注意力会把 512 维向量切成 8 个头、每个头在 64 维投影上独立计算详见 08_multi_head_attention.md因此讲稿 06_encoder_decoder.md 特别强调所有子层与嵌入层的输出统一为 512 维向量残差相加才有意义——d_model 512是整个网络的统一交换口径。五、解码器栈对称骨架上的三处不对称架构图右侧的Decoder 同样堆叠 N6 层但每一层插入第三个子层于是每层包含三块掩码多头自注意力Masked Multi-Head Self-Attention与编码器自注意力同构但把未来位置设为负无穷再进 softmax使位置 i 只能关注到 ≤ i 的位置——causal mask 保证了自回归性质解码器无法偷看尚未生成的 token掩码机制在 09_three_uses.md 中有展开编码器-解码器注意力Encoder-Decoder AttentionQ 来自解码器自身K、V 来自编码器输出让每个解码位置都能从整个源序列中检索信息——这正是经典 seq2seq 中attention 桥接两个栈的角色逐位置前馈网络与编码器一致。讲稿把两侧差异概括为decoder 侧的三处不对称symmetric skeleton、three asymmetries对比维度Encoder左侧Decoder右侧堆叠层数N 6相同层N 6相同层每层子层数2多头自注意力 FFN3掩码自注意力 编码器-解码器注意力 FFN注意力掩码无可关注全部源位置因果掩码只能关注 ≤ i 的位置输出嵌入—右移一位one-position shift保证预测的是下一个token包裹方式LayerNorm(x Sublayer(x))相同输出端无顶层接 Linear Softmax架构的收尾在解码器栈顶端经过最后一层后一个线性投影linear projection把表示映射到词表大小再经 softmax 得到下一个 token 的概率分布——这也是每页原图最上方那块 Linear Softmax 方块的职责。六、Add Norm让深度堆叠可训练的配角三件套每个子层外面都包着同样的结构即output LayerNorm(x Sublayer(x))——这是 06_encoder_decoder.md 与 10_ffn_residual_layernorm.md 反复强调的统一包裹规则。它由三个小部件组成残差连接Residual connection把子层的输入 x 加回到子层输出Sublayer(x)上让梯度信号能够稳定穿越几十层深的堆叠层归一化Layer Normalization沿特征维度对向量做标准化稳定训练两者合成图中的Add Norm标记块。讲稿给出一个清醒的论断这三样东西单独看都不是新发明但在每个注意力子层外围组合使用才是架构能在 N6 深度下稳定训练的原因。注意它与多头注意力 / 前馈网络谁该被归一化在前、残差接在哪的细节在不同论文中有变体本页只锁定论文原始约定LayerNorm(x Sublayer(x))其中 x 为子层输入。七、骨架未变盒子已换为什么说新意全在方框里讲稿在结尾点明全页主旨The skeleton is the same as prior seq2seq models — what is new is what fills the boxes.骨架与早前 seq2seq 相同——新的东西是盒子里填的内容。放到论文语境里骨架相同指仍是经典的 Encoder-Decoder 嵌入/位置信息 线性输出的布局盒子换了则指此前 seq2seq 用循环网络RNN/LSTM/GRU填充的这些子层被替换为编码器多头自注意力解码器掩码自注意力 编码器-解码器交叉注意力位置信息显式正弦编码注入而非 RNN 的隐式逐步累积。换言之注意力成为序列建模的唯一骨干没有循环、没有卷积并带来了两大工程收益位置间的最短路径从 O(n) 缩短为常量级操作训练可并行度大幅提升。这正是为什么这页总览在整套 Deck 中扮演承上启下的角色——它先给你完整的组件地图后续页面07 缩放点积注意力、08 多头机制、09 注意力的三种用法、11 位置编码再逐个放大解释每个盒子内部的工作原理与数学形式。八、仓库里的工程还原从讲稿文本到可导出 PPTX如果要在仓库中复现并研究这一页的完整链路可以按下面的文件顺序追踪讲稿notes/05_architecture_overview.md——本文核心文本汇总版见 notes/total.md设计规格design_spec.md——第 IX 节 P05 定义了画布1280×720 / PPT 16:9、布局模式左侧放 Figure 1 原图、右侧放编号热点图注与图像资源用途spec_lock.md 记录执行的锁定参数颜色、字体、图标库等均为 SVG 生成约束页面成品svg_final/05_architecture_overview.svg——实际页面 SVG正文即讲稿图注的落地同目录svg_output/保留原始输出版本图像与公式资产images/attention_p3_0.png本页所用 Figure 1 原图、images/formula_manifest.jsonP07/P08/P11 三处 block 公式清单经 codecogs 渲染、透明底、色值#1A365D导出产物exports/attention_is_all_you_need_narrated.pptx——最终原生 PPTX。在 ppt-master 的整体流水线中这一页是Default Generate主流程见 workflows/generate-pptx.md的产物svg_output/是页面设计的唯一事实来源design_spec.md与spec_lock.md只是创作/控制输入两者不得向 SVG 注入缺失的可见内容导出阶段则由编译器将带语义标记的 SVG含formula_manifest.json登记的 block/inline 公式转换为带原生形状、过渡动画与可编辑 Office Math 的 PPTX。对读者而言这意味着想改造这一页架构总览只需编辑对应讲稿与svg_final/页面再走一次导出流程即可。结语作为整套精读 Deck 的架构总览页05_architecture_overview.md用自底向上读 Figure 1这一句话框定了全部讲述顺序嵌入与位置编码 → 编码器6 层 × 2 子层→ 解码器6 层 × 3 子层 因果掩码→ Linear Softmax。配合骨架继承 seq2seq、新意在盒子内的判别框架读者可以快速在脑内建立 Transformer 的完整组件地图。在 PPT Master 仓库中这一页同时也是理解其工程组织方式的绝佳样本——从讲稿、设计规格、SVG 页面到导出 PPTX 的一一对应关系恰好演示了一篇深度技术讲稿如何被结构化地转化为原生演示文稿。【免费下载链接】ppt-masterAI turns documents or topics into real, native PowerPoint decks—with native shapes, transitions and animations,>项目地址: https://gitcode.com/GitHub_Trending/ppt/ppt-master创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考