《深度学习》期末练习题 | 判断题第4篇(逐题精讲)
《深度学习》期末练习题 | 判断题第4篇逐题精讲前言本篇为《深度学习》期末练习题判断题系列的第4篇涵盖题号49~56涉及自注意力机制、Transformer、YOLOv5 目标检测、COCO/VOC 数据集等核心知识点。每道题均附详细解析适合期末复习与知识巩固。建议先自行判断再对照解析查漏补缺 目录第49题自注意力与词间关系第50题Transformer 的应用范围第51题多头注意力的原理第52题YOLOv5 的单阶段检测第53题YOLOv5 中的锚框第54题NMS 的 IoU 阈值第55题YOLOv5 多尺度预测第56题COCO 与 VOC 数据集对比49. 自注意力与词间关系题目自注意力可以帮助模型理解句子中词之间的关系。√ 解析自注意力机制Self-Attention是 Transformer 的核心组件其核心思想是让序列中的每一个位置词都能看到序列中所有其他位置并计算它们之间的关联程度。具体来说对于输入序列中的每个词自注意力会计算三个向量向量含义作用QQuery查询向量“我在找什么信息”KKey键向量“我能提供什么信息”VValue值向量“我实际携带的信息内容”注意力权重的计算公式为Attention ( Q , K , V ) softmax ( Q K T d k ) V \text{Attention}(Q, K, V) \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)VAttention(Q,K,V)softmax(dk​​QKT​)V举个例子在句子“The cat sat on the mat becauseitwas tired”中自注意力可以帮助模型理解代词“it”指代的是“cat”而非 “mat”因为 “it” 与 “cat” 之间的注意力权重会更高。✅结论自注意力通过计算序列内任意两个位置之间的注意力权重有效建模了词与词之间的长距离依赖关系因此本题正确。50. Transformer 的应用范围题目Transformer 只能用于机器翻译任务。× 解析Transformer 最初确实在 2017 年的论文“Attention Is All You Need”中被提出用于机器翻译任务但它的应用范围远不止于此。Transformer 的广泛应用领域领域代表模型/应用自然语言处理NLPBERT、GPT、ChatGPT、LLaMA️计算机视觉CVViTVision Transformer、DETR、Swin Transformer️语音处理Whisper、Conformer生物信息学AlphaFold2蛋白质结构预测多模态CLIP、DALL·E、Flamingo时间序列预测Informer、Autoformer关键理解Transformer 本质上是一种通用的序列建模架构只要任务涉及序列数据文本、图像 patch 序列、音频帧等都可以使用 Transformer。❌结论Transformer 绝非只能用于机器翻译它已成为当今深度学习的基础架构广泛应用于各个领域因此本题错误。51. 多头注意力的原理题目多头注意力就是多次计算注意力并合并结果。√ 解析多头注意力Multi-Head Attention的核心思想可以简洁地概括为以下三步步骤1将 Q、K、V 分别投影到 h 个不同的子空间即 h 个头 步骤2在每个子空间中独立计算注意力并行执行 h 次注意力计算 步骤3将所有头的输出拼接Concat再通过线性变换合并为最终结果数学表达为MultiHead ( Q , K , V ) Concat ( head 1 , head 2 , … , head h ) W O \text{MultiHead}(Q,K,V) \text{Concat}(\text{head}_1, \text{head}_2, \dots, \text{head}_h) W^OMultiHead(Q,K,V)Concat(head1​,head2​,…,headh​)WO其中每个头head i Attention ( Q W i Q , K W i K , V W i V ) \text{head}_i \text{Attention}(QW_i^Q, KW_i^K, VW_i^V)headi​Attention(QWiQ​,KWiK​,VWiV​)为什么要用多头单头注意力多头注意力只关注一种关系模式不同头可以关注不同的关系模式表达能力有限能从多个子空间捕捉丰富信息类比理解就像看电影时一个人只能从一个角度看多头注意力相当于多个人从不同角度同时观看最后汇总各自的理解得到更全面的认识。✅结论多头注意力确实是多次多个头计算注意力并合并结果因此本题正确。52. YOLOv5 的单阶段检测题目YOLOv5 是一种单阶段目标检测算法它将目标定位和分类任务统一在一个网络中完成不需要生成候选区域。√ 解析目标检测算法分为两大类类型代表算法流程特点两阶段Faster R-CNN先生成候选区域Region Proposal→ 再分类和回归精度高速度慢单阶段YOLO 系列、SSD直接在特征图上同时预测类别和边界框速度快适合实时检测YOLOv5 的核心架构输入图像 → Backbone特征提取→ Neck特征融合→ Head检测头 ↓ 同时输出类别 边界框 置信度YOLOv5 的关键特点✅不需要 RPNRegion Proposal Network生成候选区域✅ 将目标检测视为一个回归问题一次前向传播即可完成定位和分类✅ 推理速度极快适合实时检测场景✅结论YOLOv5 是典型的单阶段检测器统一完成定位和分类无需候选区域生成因此本题正确。53. YOLOv5 中的锚框题目在 YOLOv5 中锚框Anchor Boxes是预先设定的一组固定尺寸和长宽比的边界框用于辅助预测真实目标框。√ 解析锚框Anchor Boxes是目标检测中的重要概念锚框 预先定义的一组参考框不同尺寸 不同长宽比YOLOv5 中锚框的工作流程1. 通过 K-Means 聚类分析训练集 → 得到一组最优锚框尺寸 2. 推理时每个网格点预设多个锚框作为基准 3. 网络预测的是相对于锚框的偏移量而非绝对坐标 4. 最终框 锚框 预测偏移量YOLOv5 默认锚框示例COCO 数据集尺度锚框尺寸 (w, h)小目标P3(10,13), (16,30), (33,23)中目标P4(30,61), (62,45), (59,119)大目标P5(116,90), (156,198), (373,326)关键理解锚框提供了一个良好的初始化起点网络只需要学习在锚框基础上偏移多少大大降低了学习难度加速收敛。✅结论锚框确实是预先设定的固定尺寸和长宽比的参考框用于辅助预测因此本题正确。54. NMS 的 IoU 阈值题目YOLOv5 的推理过程中非极大值抑制NMS的 IoU 阈值设置得越大保留的重复框就越少。× 解析非极大值抑制NMS, Non-Maximum Suppression的作用是去除冗余的重叠检测框。NMS 的工作流程1. 按置信度从高到低排序所有检测框 2. 选置信度最高的框保留它 3. 计算其余框与它的 IoU交并比 4. 删除 IoU 阈值的框认为它们是重复检测 5. 重复步骤 2~4直到处理完所有框IoU 阈值的影响核心考点IoU 阈值效果保留框数量较小如 0.3判断标准严格稍有重叠就删除保留的框更少较大如 0.7判断标准宽松允许较大重叠保留的框更多图解理解假设两个框的 IoU 0.5 阈值 0.3 → 0.5 0.3 → 删除认为重复→ 保留更少 阈值 0.7 → 0.5 0.7 → 保留不认为重复→ 保留更多❌结论IoU 阈值越大判断越宽松保留的重复框反而越多不是越少。题目说法恰好相反因此本题错误。55. YOLOv5 多尺度预测题目YOLOv5 采用多尺度预测策略其中小尺度特征图20×20感受野大适合检测小物体。× 解析YOLOv5 的多尺度预测基于 FPN特征金字塔网络思想在不同尺度的特征图上进行检测特征图尺度分辨率感受野适合检测大尺度80×80高小小物体中尺度40×40中中中等物体小尺度20×20低大大物体原理分析输入图像 640×640 ↓ 下采样 8 倍 80×80 特征图 → 保留更多细节和空间信息 → 小物体检测 ↓ 下采样 16 倍 40×40 特征图 → 平衡细节与语义 → 中等物体检测 ↓ 下采样 32 倍 20×20 特征图 → 语义信息丰富空间信息少 → 大物体检测记忆口诀“大图看小物小图看大物”大特征图80×80分辨率高、细节多 → 检测小物体小特征图20×20感受野大、语义强 → 检测大物体❌结论20×20 的小尺度特征图感受野虽大但适合检测的是大物体而非小物体。题目说适合检测小物体是错误的因此本题错误。56. COCO 与 VOC 数据集对比题目COCOCommon Objects in Context数据集和 VOCVisual Object Classes数据集都是用于目标检测任务的常用数据集其中 VOC 数据集的类别数量多于 COCO 数据集。× 解析两个数据集的详细对比对比维度VOCPascal VOCCOCOMS COCO类别数量20 类80 类图像数量~11,000 张~330,000 张标注数量~27,000 个目标~1,500,000 个目标标注格式XMLPascal格式JSON场景复杂度相对简单复杂日常场景评估指标mAP0.5mAP0.5:0.95VOC 的 20 个类别人person、鸟bird、猫cat、牛cow、狗dog、马horse、羊sheep、飞机aeroplane、自行车bicycle、船boat、汽车car、摩托车motorbike、公交车bus、火车train、瓶子bottle、椅子chair、餐桌dining table、盆栽potted plant、沙发sofa、电视tv/monitorCOCO 的 80 个类别涵盖更广泛的日常物体包括各种运动器材、食物、厨房用品等。❌结论VOC 仅20个类别而 COCO 有80个类别COCO 的类别数量远多于 VOC。题目说反了因此本题错误。 本篇总结题号知识点答案一句话总结49自注意力✅ √自注意力通过 Q/K/V 建模词间关系50Transformer❌ ×Transformer 是通用架构远不止机器翻译51多头注意力✅ √多头 多次计算 拼接合并52YOLOv5 单阶段✅ √单阶段定位分类一步到位无需候选区域53YOLOv5 锚框✅ √锚框是预定义的参考框辅助回归54NMS IoU阈值❌ ×IoU 阈值越大 → 越宽松 → 保留越多55多尺度预测❌ ×小特征图20×20检测大物体大特征图检测小物体56COCO vs VOC❌ ×COCO 80 类 VOC 20 类系列导航《深度学习》期末练习题 | 判断题第1篇《深度学习》期末练习题 | 判断题第2篇《深度学习》期末练习题 | 判断题第3篇《深度学习》期末练习题 | 判断题第4篇本篇✍️作者的话如果这篇博客对你有帮助欢迎点赞 收藏⭐ 关注三连支持期末加油祝大家都能取得好成绩