《深度学习》期末练习题 | 填空题第2篇逐题精讲前言本篇为《深度学习》期末复习填空题第2篇第26-49题紧接上篇内容。本篇重点覆盖模型训练核心机制、CNN/RNN/Transformer架构细节、以及YOLOv5目标检测实战知识。每道题不仅给出标准答案还附带原理图解与代码示例助你从“记住答案”进阶到“理解本质”。适合期末冲刺、考研复试及算法岗面试复习。目录误差函数/损失函数梯度下降法Dropout防过拟合BatchNormalization的作用清空梯度函数多分类损失函数ReLU激活函数特性CNN两大核心思想常见池化方式多卷积核的作用Inception模块核心迁移学习核心LSTM遗忘门RNN长序列问题n-gram马尔可夫假设机器翻译术语RNN参数共享多头注意力机制Transformer组成目标检测评价指标mAPYOLOv5 Backbone结构NMS抑制依据YOLOv5多尺度预测置信度阈值过滤26. 误差函数/损失函数题目______ 是 BP 神经网络训练中用于衡量预测值与真实值差距的函数。答案误差函数 / 损失函数Loss Function讲解损失函数是模型优化的指南针。BP反向传播算法的核心就是计算损失函数对参数的梯度然后更新参数使损失减小。任务类型常用损失函数公式简述回归MSE (均方误差)1 n ∑ ( y − y ^ ) 2 \frac{1}{n}\sum(y-\hat{y})^2n1∑(y−y^)2二分类Binary Cross Entropy− [ y log y ^ ( 1 − y ) log ( 1 − y ^ ) ] -[y\log\hat{y}(1-y)\log(1-\hat{y})]−[ylogy^(1−y)log(1−y^)]多分类Cross Entropy− ∑ y c log ( y ^ c ) -\sum y_c \log(\hat{y}_c)−∑yclog(y^c)注意损失函数越小说明模型预测越接近真实值但过小可能过拟合。27. 梯度下降法题目在神经网络训练中沿着损失函数减小的方向更新参数的方法称为梯度 ______ 法。答案下降讲解梯度∇ L \nabla L∇L指向损失函数增长最快的方向因此负梯度方向− ∇ L -\nabla L−∇L就是损失减小最快的方向。参数更新公式w n e w w o l d − η ⋅ ∇ L ( w ) w_{new} w_{old} - \eta \cdot \nabla L(w)wnewwold−η⋅∇L(w)其中η \etaη为学习率Learning Rate控制步长大小。沿负梯度方向损失更小当前位置新位置逐步逼近最优解28. Dropout防过拟合题目______ 技术在训练时随机丢弃部分神经元用于防止神经网络过拟合。答案Dropout讲解Dropout 在训练时以概率p pp随机将神经元输出置零迫使网络不依赖特定神经元组合从而增强泛化能力。训练时随机失活 缩放除以1 − p 1-p1−p保持期望不变推理时所有神经元参与不做Dropout⚠️ PyTorch中nn.Dropout(p)的p是丢弃概率而非保留概率。29. BatchNormalization的作用题目批标准化BatchNormalization的主要作用是缓解训练过程中的 ______ 问题。答案内部协变量偏移Internal Covariate Shift讲解随着网络层数加深每一层的输入分布会因前一层参数更新而不断变化导致训练不稳定。BN通过将每层输入拉回均值0、方差1的标准分布稳定了数据分布带来三大好处允许使用更大学习率减少对初始化的敏感性具有轻微正则化效果30. 清空梯度函数题目PyTorch 中用于清空上一轮计算梯度的函数是 ______。答案optimizer.zero_grad()讲解PyTorch默认会累加梯度为了支持梯度累积等高级用法。如果不清空梯度会越来越大导致训练发散。标准训练循环fordata,labelinloader:optimizer.zero_grad()# ✅ 1. 清空梯度outputmodel(data)# 2. 前向传播losscriterion(output,label)# 3. 计算损失loss.backward()# 4. 反向传播optimizer.step()# 5. 更新参数 PyTorch 1.7 推荐optimizer.zero_grad(set_to_noneTrue)内存效率更高。31. 多分类损失函数题目用于多分类任务的损失函数为 ______。答案交叉熵损失函数Cross Entropy Loss讲解交叉熵衡量两个概率分布的差异。在分类任务中真实标签是one-hot分布模型输出是Softmax概率分布。PyTorch实现# 方式1LogSoftmax NLLLosscriterionnn.NLLLoss()# 方式2推荐直接封装criterionnn.CrossEntropyLoss()# 内部自动做Softmax32. ReLU激活函数特性题目神经网络中常用的 ReLU 激活函数在输入为负数时输出恒为 ______。答案0讲解ReLU公式f ( x ) max ( 0 , x ) f(x) \max(0, x)f(x)max(0,x)优点计算简单、缓解梯度消失正区间导数恒为1缺点Dead ReLU问题负区间梯度为0神经元永久死亡改进版Leaky ReLU (0.01 x 0.01x0.01x)、ELU、GELU33. CNN两大核心思想题目卷积神经网络的两个核心思想是______ 和 ______。答案局部感知权值共享讲解思想含义优势局部感知每个神经元只连接输入的局部区域感受野减少参数量保留空间结构权值共享同一卷积核在所有位置使用相同权重大幅减少参数赋予平移不变性这两个思想使CNN相比全连接网络参数量降低了数个数量级。34. 常见池化方式题目常见的池化方式有______ 和 ______。答案最大池化Max Pooling平均池化Average Pooling讲解Max Pooling取区域内最大值 → 提取最显著特征纹理、边缘保留背景信息少Avg Pooling取区域内平均值 → 保留整体背景信息平滑特征 现代网络趋势有时用步长卷积Strided Conv替代池化以保留更多可学习信息。35. 多卷积核的作用题目多个卷积核可以提取不同的______。答案特征讲解每个卷积核是一个特定的特征检测器。例如核A检测水平边缘核B检测垂直边缘核C检测45°斜线输出通道数 卷积核个数每个通道对应一种特征图。36. Inception模块核心题目Inception 模块的核心思想是进行 ______ 特征提取。答案多尺度讲解Inception在同一层并行使用多种尺寸的卷积核1×1, 3×3, 5×5和池化然后将结果拼接。这样网络可以同时捕获不同尺度的特征无需人工选择最佳卷积核尺寸。Input ├── 1×1 Conv ──┐ ├── 3×3 Conv ──┼── Concat ── Output ├── 5×5 Conv ──┤ └── MaxPool ───┘37. 迁移学习核心题目迁移学习的核心思想是利用 ______ 模型进行新任务训练。答案预训练Pre-trained讲解在大数据集如ImageNet上预训练的模型已经学到了通用的视觉特征边缘、纹理、形状。将其迁移到新任务时冻结底层通用特征提取器微调顶层或替换分类头用小数据集即可达到高性能 这是当前深度学习落地的主流范式极大降低了数据和算力门槛。38. LSTM遗忘门题目LSTM 中用于控制上一时刻细胞状态中信息保留程度的是 ______ 门。答案遗忘Forget Gate讲解LSTM三大门控机制门作用公式关键遗忘门决定丢弃哪些旧信息f t σ ( W f ⋅ [ h t − 1 , x t ] b f ) f_t \sigma(W_f \cdot [h_{t-1}, x_t] b_f)ftσ(Wf⋅[ht−1,xt]bf)输入门决定存入哪些新信息i t , C ~ t i_t, \tilde{C}_tit,C~t输出门决定输出哪些信息o t o_tot遗忘门输出接近0 → 完全遗忘接近1 → 完全保留。39. RNN长序列问题题目传统 RNN 在处理长序列时容易出现 ______ 或梯度爆炸问题。答案梯度消失讲解RNN通过时间反向传播BPTT梯度需要连乘多个时间步的权重矩阵。当权重1时连乘后梯度指数级衰减→梯度消失当权重1时→梯度爆炸。解决方案梯度消失→ LSTM / GRU门控机制梯度爆炸→ 梯度裁剪Gradient Clipping40. n-gram马尔可夫假设题目著名的 n-gram 模型的核心思想是基于 ______ 假设该假设认为下一个词只依赖于前面有限个词。答案马尔可夫Markov讲解马尔可夫假设未来状态只与当前及最近n-1个状态有关与更早的历史无关。Unigram (n1)P ( w t ) P(w_t)P(wt)独立Bigram (n2)P ( w t ∣ w t − 1 ) P(w_t|w_{t-1})P(wt∣wt−1)Trigram (n3)P ( w t ∣ w t − 1 , w t − 2 ) P(w_t|w_{t-1}, w_{t-2})P(wt∣wt−1,wt−2)⚠️ 局限性无法捕获长距离依赖这正是RNN/Transformer要解决的问题。41. 机器翻译术语题目在机器翻译中被转换的语言称为 ______转换后的语言称为 ______。答案源语言Source Language目标语言Target Language讲解Seq2Seq模型中Encoder处理源语言序列Decoder生成目标语言序列例如英译中 → 英语源语言中文目标语言。42. RNN参数共享题目RNN 在不同时间步之间参数是 ______ 的。答案共享讲解RNN在所有时间步使用同一组权重矩阵W x , W h , W y W_x, W_h, W_yWx,Wh,Wy。这意味着参数量与序列长度无关模型学到的是状态转移规则而非特定时刻的模式这也是BPTT能够实施的基础43. 多头注意力机制题目多头注意力可以从不同 ______ 学习信息。答案角度 / 子空间Subspace讲解Multi-Head Attention将Q/K/V投影到h hh个不同的子空间各自独立计算注意力后拼接。单头只能关注一种关系模式多头不同头可以分别关注语法、语义、位置等不同维度的信息MultiHead ( Q , K , V ) Concat ( h e a d 1 , . . . , h e a d h ) W O \text{MultiHead}(Q,K,V) \text{Concat}(head_1,...,head_h)W^OMultiHead(Q,K,V)Concat(head1,...,headh)WO44. Transformer组成题目Transformer 模型通常由编码器和 ______ 两部分组成。答案解码器Decoder讲解原始TransformerAttention Is All You Need采用Encoder-Decoder架构Encoder双向自注意力理解输入Decoder掩码自注意力 交叉注意力生成输出 后续变体BERT只用EncoderGPT只用DecoderT5用Encoder-Decoder。45. 目标检测评价指标mAP题目目标检测的常用评价指标中______填英文缩写是综合评估模型在不同 IoU 阈值下的平均精度分数越高表示检测性能越好。答案mAPmean Average Precision讲解mAP计算流程对每个类别计算PR曲线下的面积 → AP对所有类别的AP求平均 → mAPCOCO标准使用多个IoU阈值0.5:0.05:0.95的平均mAP比单一IoU0.5更严格全面。46. YOLOv5 Backbone结构题目YOLOv5 的主干网络Backbone采用 CSPDarknet53 结构该结构通过______减少计算量并提高特征提取能力。答案跨阶段局部连接Cross Stage Partial Connection讲解CSPCross Stage Partial将特征图分成两部分一部分经过密集块处理另一部分直接跳过最后合并。这样做既保留了足够的特征表达能力又减少了约20%的计算量和内存访问。47. NMS抑制依据题目YOLOv5 推理时非极大值抑制NMS将保留局部置信度最大的框并抑制与其 ______ 超过阈值的框最终得到干净的检测结果。答案IoU交并比Intersection over Union讲解NMS流程按置信度排序选最高分框作为保留框计算其余框与该保留框的IoUIoU 阈值 → 认为是同一物体 → 抑制重复直到处理完所有框 IoU衡量两个框的重叠程度范围[0,1]。48. YOLOv5多尺度预测题目YOLOv5 的检测头Head会在 ______ 个不同尺度的特征图上进行预测这种设计称为多尺度预测目的是更好地检测不同大小的物体。答案3讲解YOLOv5沿用FPNPAN结构在三个尺度输出尺度特征图大小检测目标大80×80小物体中40×40中等物体小20×20大物体每个尺度分配3个Anchor共9个Anchor。49. 置信度阈值过滤题目YOLOv5 推理时通过设置 ______ 阈值可以过滤掉模型认为可靠性较低的检测框。答案置信度Confidence Score讲解YOLOv5输出的置信度 Objectness × Class ProbabilityObjectness框内有物体的概率Class Prob属于某类的条件概率推理时通常设置conf_thres0.25低于此值的框直接丢弃再进行NMS。这平衡了召回率和精确率。 本篇知识体系总结深度学习核心机制 ├── 训练基础 │ ├── 损失函数MSE/CE │ ├── 梯度下降 zero_grad() │ ├── 正则化Dropout/BN │ └── 激活函数ReLU ├── CNN架构 │ ├── 局部感知 权值共享 │ ├── 池化Max/Avg │ ├── 多尺度Inception │ └── 迁移学习预训练 ├── 序列模型 │ ├── RNN参数共享、梯度消失 │ ├── LSTM遗忘门 │ ├── n-gram马尔可夫假设 │ └── Transformer编解码器、多头注意力 └── 目标检测YOLOv5 ├── BackboneCSPDarknet53 ├── Head3尺度预测 ├── 后处理NMS(IoU)、置信度阈值 └── 评价mAP✍️ 复习建议对比记忆将本篇与第1篇知识点串联如正则化在两篇均有涉及L1/L2 vs Dropout/BN代码验证对PyTorch相关题目zero_grad、Dropout、CrossEntropyLoss务必动手实验画图辅助LSTM门控、Transformer架构、YOLOv5结构建议手绘一遍加深理解关注YOLOv5细节近年考试中目标检测实战题比重上升CSP、NMS、多尺度是高频考点系列预告《深度学习》期末练习题 | 选择题/简答题篇即将上线敬请关注如果本文对你有帮助欢迎点赞 收藏⭐ 关注❤三连支持你的鼓励是我持续创作的最大动力有问题欢迎评论区交流~