尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

智能计算系统5-8章复习地图:深度学习、框架与芯片协同

发布时间:2026/9/29 7:25:57

资讯中心
01
ARTICLE

智能计算系统5-8章复习地图:深度学习、框架与芯片协同

智能计算系统5-8章复习地图:深度学习、框架与芯片协同
期末复习智能计算系统最崩溃的时刻往往不是概念记不住而是发现第五到第八章的内容像一张网——深度学习是上游编程框架是中间层芯片架构是底座最后所有东西又汇到软硬件协同设计这条主线上。单独背每一章都能懂一旦合在一起考综合题就发懵。这篇文章就是冲着这个痛点来的帮你把5到8章的核心知识点压缩成一份可以直接背、直接刷、直接上考场的复习地图。我会按章节顺序拆重点每一块都告诉你哪些是必考概念、哪些是必会计算、哪些是容易掉进的坑内容适合这门课正在准备期末的同学也适合考研想快速抓主干的人。本课程不同学校、不同教材的章节号可能略有差异但主线内容基本一致深度学习模型、编程框架原理、智能计算芯片、软硬件协同与系统优化。你只需要对照自己的教学大纲做微调就行。1. 先把五到八章的知识版图铺开复习的第一步不是逐页背书而是先把四章的骨架拉出来。智能计算系统这门课的前半部分大多在讲基础——计算机体系结构、深度学习基本概念等。到了5到8章就进入真正的系统视角开始回答三个核心问题智能计算要算的是什么模型、用什么编程抽象来写框架、写出来的程序最终怎么在硬件上高效跑起来芯片与协同设计。1.1 五到八章在整门课里的定位我翻了好几个版本的智能计算系统课程大纲第5到第8章虽然标题不同主线逻辑惊人的一致前面几章搭深度学习的基础包括神经网络、卷积网络、循环网络这些模型的底层计算逻辑中间会单独开一章讲编程框架通常是PyTorch或者TensorFlow重点不在API怎么调用而在框架底层的张量、算子、自动求导、执行模式这些机制接着切入芯片架构从CPU为什么不适合深度学习说起讲到GPU架构、AI专用芯片如NPU/TPU的结构与设计思路最后一章收在系统级优化上涉及算子融合、混合精度、量化剪枝、分布式并行这些上硬件的优化手段。这条逻辑线本身就是整门课的精华。期末如果你想拿高分必须能在两道问答题里体现出这种算法—软件—硬件分层的系统思维这部分在后面我会展开说。1.2 为什么期末大题总往这四章出几乎每套期末卷的大题都出自这四章原因很简单前几章概念性太强只能出简答这四章则具备了出综合题的三个条件——有模型、有计算过程、有工程取舍。比如给一个卷积层让你手算输出尺寸再让你分析这个层如果在GPU上运行瓶颈在计算还是访存又比如给一个矩阵乘法先让你手推反向传播再问你怎么用并行化拆到不同计算单元上。这种题目一道就能覆盖三个章节的知识点是老师最喜欢的出题方式。所以说复习的落脚点不是背住模型名称而是把模型计算过程—框架如何描述—硬件如何执行这条链路练成反射弧。理解了这一点下面各章的重点才不会变成孤立的知识点列表。2. 第5章复习核心从神经网络计算到模型结构的考点密度第5章大致是深度学习技术本身的深入部分。很多同学觉得这部分内容熟悉因为人工智能导论里学过但智能计算系统这门课里考得更深重点不在CNN能做什么而在CNN每一步算的是什么、参数量多少、计算量多大。2.1 反向传播计算必须形成肌肉记忆反向传播是本学期第一个手算必考点。给你一个两层或三层的全连接网络给好输入、权重、偏置让求某个参数的梯度这种题几乎每年都出。复习时不要只背公式要拿具体的数字实际推一遍比如设输入 x [0.5, -0.2]第一层权重 W1 为 2×2 的矩阵偏置 b1激活函数用 Sigmoid输出层用 MSE 损失。现在要求 loss 对 W1[0][0] 的偏导。正确的推导链路是先算前向得到隐藏层输出 h再算输出层预测 y_hat然后求 loss 对 y_hat 的梯度再利用链式法则一层一层往回传先到 w2再到 h再到激活函数的导数 Sigmoid(z)最后到 W1。这里有两个常考陷阱。第一Sigmoid 的导数可以写成 σ(z) * (1 - σ(z))如果前向时你手里已经留了隐藏层的输出就不需要重新计算 σ(z)直接用输出值就能算导数——这个技巧在试卷上能省不少时间。第二链式法则的两个分支要分清楚损失经过两条路径传到某个权重时梯度要相加而不是相乘。2.2 CNN的尺寸计算与感受野题目里的定式套路卷积网络这部分最稳定的送分题是输出特征图尺寸计算输出尺寸 (W - K 2P) / S 1。这个公式要练到条件反射同时注意带小数的情况。我记得有一次真题给的是输入32×32、卷积核5×5、步长2、填充0计算结果直接出现小数很多同学没意识到这种情况说明卷积核不能完整覆盖实际是向下取整后再加偏移在框架里甚至会直接报错。考试时遇到不能整除的尺寸要敏感地检查参数组合是否合理。感受野的计算也是高频考点公式是 RF_new RF_old (K - 1) * 跳跃步长。多层卷积叠加时从最后一层往前倒推。我建议你在复习时把三类经典题各做两遍单层卷积尺寸计算、两层卷积叠加后感受野、带空洞卷积的感受野。空洞卷积的感受野要特别注意等效卷积核尺寸 K K (K - 1) * (dilation - 1)这是最容易漏的地方。2.3 常见模型结构对比与Loss、梯度问题RNN、LSTM、注意力机制在这门课里属于常考简答区间。一定要能画出LSTM的三个门结构解释遗忘门、输入门、输出门各自的作用以及为什么LSTM能缓解梯度消失——Sigmoid 的连乘变成了门的逐元素操作让梯度有一条接近恒等的通路。这个为什么比背结构更重要简答题和问答题都爱从这里切入。Transformer 相关的基础也要了解尤其是自注意力机制的计算过程Q、K、V 的生成、缩放点积注意力公式、为什么要除以根号 d_k防止内积过大导致 Softmax 梯度饱和。如果老师课堂上强调过 Transformer 里的位置编码作用也建议整理成一句话给并行输入的自注意力机制注入序列顺序信息。复习第5章时我自己的体会是不要在上面堆太多新模型。考试范围不会超出教材把经典模型的参数计算和设计动机搞透比追着最新的模型名词背要有效得多。你可以列一个模型对比表模型、关键结构、参数量特点、擅长任务、主要问题考前扫一眼比重新翻书快。3. 第6章复习核心编程框架的底层机制比API更值得花时间第6章讲编程框架。如果你平时做作业用的是PyTorch这一章读起来会比较顺但考试的考察点和你平时调API的习惯差距很大——试卷不会问 torch.nn.Conv2d 怎么用而会问自动求导是怎么实现的、动态图和静态图的区别是什么。这些底层问题才是复习重心。3.1 张量与算子是框架的数据操作二重奏框架里的所有计算都建立在张量和算子两个概念上。张量至少要把这几个属性说清楚形状、数据类型、所在设备、是否需要梯度算子则是张量上的基本运算单元卷积、矩阵乘、ReLU、Softmax 都是算子。这里有个概念辨析题的高频考点算子的前向和反向。前向算子是真正计算结果的反向算子则是求梯度用的。它们成对出现比如卷积前向对应卷积反向矩阵乘法前向对应两个转置形式的反向算子。框架是怎么知道反向用哪个算子的靠计算图记录。PyTorch 在前向执行时会同步记录一张动态的计算图图的节点是张量边是算子反向传播就是在这张图上做反向遍历逐个调用反向算子。理解了这张图机制自动求导题基本就稳了。3.2 静态图和动态图的对比一道经典简答题这道题真的几乎每届都考。静态图的思路是先定义完整的计算图再传入数据执行典型代表是 TensorFlow 1.x 的 Graph 模式动态图则是边执行边建图代表就是 PyTorch 的默认模式。我建议你从三个角度准备这道题的答案调试难度动态图可以像普通 Python 代码一样打印中间结果、打断点静态图则需要在图构建阶段调试复杂度高性能优化静态图因为整图可见编译器可以做更激进的操作融合、内存复用、计算调度优化动态图的图结构逐次生成优化空间受限灵活性动态图对循环、条件分支等控制流的处理更自然静态图处理控制流需要专门的循环控制节点写起来绕。另外要提一句 JIT 编译的概念比如 PyTorch 的 torch.jit.script 和 torch.compile 就是试图在动态图之上获取静态图的性能优势这种取两者之长的思路也经常被拿来出简答或论述。3.3 自动求导的实现从计算图到链式法则自动求导是框架里最核心的机制和第5章手推反向传播直接呼应。你要能说清楚框架不是像数值差分那样逐个扰动参数求近似梯度也不像符号求导那样产出符号表达式它做的是把链式法则预藏在反向算子里在反向遍历时把数值梯度一路乘出来这叫反向模式自动微分。还有一个常考的点是反向传播时的内存问题。因为每个节点的中间结果比如激活输出都可能被后向计算再次用到框架要么在前向阶段缓存这些张量要么用重计算的方式在反向时重新执行前向算子来拿中间值后者用时间换内存。现在一些大模型训练中常用的激活重计算就是这个思路。关于框架这一章我复习时的经验是把 PyTorch 的 tensor.backward() 背后的流程在纸上画一遍loss 标量怎么初始化梯度为1怎么沿着计算图一路传播到每个 requires_grad 的张量梯度累加到 .grad 属性里的过程。画完这一张图简答和填空题都不虚。4. 第7章复习核心芯片架构中输入输出、存储与计算的关系从第7章开始视角切换到硬件。这门课里芯片部分的底层逻辑一句话就能讲透深度学习计算的特点是并行度高、数据量大、算术强度相对高传统CPU偏重低延迟和复杂控制逻辑在深度学习这种海量规则运算面前反而力不从心。所以智能计算芯片在架构设计上做了三件事——堆并行计算单元、加专用矩阵运算单元、优化数据搬运。4.1 CPU为什么跑深度学习吃力从架构找原因很多人一看到这个问题就脱口而出CPU 核心少但这是不准确的回答至少不完整。你得从 CPU 的设计哲学切入CPU 要处理通用任务需要大量晶体管留给控制逻辑、分支预测、乱序执行、大容量缓存真正用于浮点运算的算力单元占的面积比例不高。每个核的算力强但核数相对少面对深度学习里动辄千万级的矩阵运算数据中心场景里CPU 的算力密度和能效比都跟不上。作答时建议加上对比GPU 把更多晶体管留给算术逻辑单元核心数能达到数千级别通过大规模线程并行掩盖访存延迟更擅长吞吐量的计算任务AI专用芯片比如 NPU 则在 GPU 基础上进一步精简只保留深度学习常用的低精度运算单元去掉图形渲染相关硬件把能效比推到极致。这种从设计哲学到结构体现到适用场景的答题框架在任何硬件题里都能用。4.2 GPU的结构要点从SM到Warp到存储层级GPU 这块的复习要点包括这些关键词流多处理器SM、CUDA 核心、Tensor Core、线程束Warp、线程块Block、全局内存、共享内存、寄存器。你不需要背具体型号的参数但要能画出简化的层次结构GPU 由多个 SM 组成每个 SM 里面有若干 CUDA 核心、共享内存、寄存器堆线程以 Warp 为单位调度一般 32 个线程一组以 SIMT单指令多线程方式执行。Tensor Core 是英伟达从 Volta 架构开始引入的专用矩阵乘累加单元能在单个时钟周期完成 4×4 矩阵乘运算对深度学习的卷积和全连接层提升巨大。复习时一定要理解 Tensor Core 解决的是算术密集型算子的问题不要把它的作用和访存优化混在一起。存储层级是GPU章节必考的一环。从寄存器、共享内存、全局内存到主机内存带宽和延迟逐级变差。算子优化时凡是算力利用率上不去的八成是数据搬运卡脖子。这里有个常考的量化指标叫算术强度Arithmetic Intensity定义是单位数据量上执行的计算量单位是 FLOPs/Byte。判断一个算子属于计算密集型还是访存密集型就看它的实际算术强度与芯片的 Ridge Point 比较。这个指标在最后算法优化那边还会再次出现。复习到此芯片章节最容易犯的错就是只记架构名词、不记设计权衡trade-off)。比如为什么不用全部SRAM做缓存因为成本高、面积大而且深度学习访存模式相对规律用软件管理共享内存反而更可控。考试时凡是出现为什么用A不用B的题目本质上考的都是设计权衡答出硬件资源有限访存特征导致两部分才拿满分。5. 第8章复习核心软硬件协同设计与优化的三条主线第8章的综合性最强所有前面的知识都在这里收拢。这一章讨论的是模型写好后怎么让它尽可能快地跑在芯片上。核心思想是软硬件协同设计——算法特性决定硬件设计方向硬件结构反过来决定算法和编译器的优化策略。复习时我建议抓住三条主线算子级优化、推理部署优化、分布式并行。5.1 算子级优化融合、向量化、内存布局算子级优化关注单个算子在目标硬件上的执行效率。最高频的是算子融合Operator Fusion。最经典的例子是 Conv BN ReLU 融合把卷积、批归一化、激活函数这三个前后相连的算子合并成一个算子。为什么能融合因为 BN 在推理阶段可以化简成 y a * x b 这样的线性变换ReLU 是分段函数模型推理时卷积算完的结果不需要写回全局内存直接在片上完成 BN 和激活再进入下一层。融合省掉的是一次完整的数据写回和读取。内存访问往往是能耗和延迟的大头省掉这次搬运对性能提升非常显著。这也能解释为什么向量化指令、张量内存布局比如 NCHW 与 NHWC调整也是算子优化的常用手段——本质上都是为了让数据访问更连续、更便于向量化和并行读取。5.2 推理部署优化量化、剪枝、知识蒸馏与混合精度这部分几乎是必考简答和论述的富矿。我的建议是把每种技术的原理、动机、代价组成一个回答框架量化把 FP32 的权重和激活转成 INT8 甚至 INT4 的表示。带来的收益是模型体积缩小、访存量减少、整数运算在某些芯片上吞吐更高。代价是精度损失于是有训练后量化PTQ和量化感知训练QAT两种路线。PTQ 是跑少量校准集统计动态范围后直接量化QAT 是模拟量化误差做梯度训练精度更高但需要改动训练流程。剪枝去掉冗余权重或神经元。区分非结构化剪枝和结构化剪枝很重要。非结构化剪枝把不重要的单个权重置零模型变稀疏但需要特殊硬件才能加速结构化剪枝直接剪掉整个通道或卷积核能直接减少实际计算量但精度损失可能更大。知识蒸馏用一个大的教师模型指导一个小学生模型训练让学生模型模拟教师模型的输出分布往往能在压缩参数的同时保留大部分精度。理解这个思路的核心点学生学的不只是正确答案还有教师模型中类间的相似结构信息。混合精度利用 FP16 的存储和计算速度配合 FP32 做梯度累加关键在 Loss Scaling——当梯度值过小小于FP16表示下限时先放大 loss 再反传梯度更新前再缩回来。这个细节考过好几次。复习时建议动手整理成一张表格列清楚优化技术、解决什么问题、主要收益、主要代价/风险考前记忆效率会高很多。5.3 分布式训练数据并行、模型并行、混合并行与AllReduce分布式训练是第8章最容易考综合题的模块。三种并行方式必须区分清楚数据并行每张卡持有一份完整模型副本喂不同批次数据各自算梯度然后通过通信把所有梯度聚合求平均再同步更新参数。这里的关键是梯度聚合通信比如 Ring-AllReduce 的通信量不随卡数线性增长而是 (N-1)/N * 2 * 模型大小比传统 PS 架构参数服务器版的高效之处就在这里。画一张 Ring-AllReduce 的图能帮助你理解笔试时如果要求简述流程就按分块—做环—归并—广播四步来说。模型并行当模型太大放不进单卡时把模型切成多份放在不同卡上。又分张量并行同一个 Transformer 层内的矩阵按维度切到多卡和流水线并行不同的层放在不同卡上数据像流水线一样逐层流过。对比角度张量并行通信频繁适合卡间高速互联流水线并行通信量小但存在流水线气泡导致利用率下降。实际大模型训练都是混合并行——数据并行、张量并行、流水线并行组合使用。前几年大模型刚兴起的时期国内几大AI实验室的大规模训练框架几乎都在这个框架内做调度。你答题时能补一句实际系统通常采用混合并行策略以同时规避单卡显存限制和提升整体吞吐就能拿到区分度分数。5.4 性能评估算力、带宽与Roofline模型第8章还有一个计算型考点是把硬件的算力和程序的需求做匹配典型工具是Roofline模型。我会在下一节专门列计算题套路这里先说概念以算术强度为横轴、可达性能为纵轴先画出一个平台的最优性能上限再画出带宽限制下的性能斜率。实际程序落在屋顶之下瓶颈可能是计算也可能是访存。Roofline题目的核心操作是计算算术强度再对比 Ridge Point就能下结论该优化访存还是优化计算。6. 期末实战高频考法与易错点复盘复习完上面四个章节你需要进入做题模式。期末最常见的题型是填空、简答、计算、综合论述四类。下面按题型复盘。6.1 概念对比题出现频率最高的四张对比表老师最喜欢把相近概念放在一起让你辨析历年卷里出现率极高的几组对比我整理在这儿建议你自己也默写加固记忆静态图 vs 动态图框架章节调试灵活性 vs 编译优化空间计算密集型 vs 访存密集型芯片章节靠算力峰值还是靠带宽非结构化剪枝 vs 结构化剪枝优化章节灵活但需特殊硬件 vs 直接减算量数据并行 vs 模型并行分布式章节模型放得下 vs 模型放不下Roofline模型 vs 带宽/延迟性能评价章节瓶颈判断依据。这类对比题的答题公式我摸索出来一个先一句话各自定义再列2到3个维度的差异最后补一句适用场景或权衡结论。每道题控制在150字以内逻辑清晰又得分。6.2 计算题套路四个必会算例期末出现的计算题基本是这四种类型反向传播手推。解法前向逐层算出中间值并保留反向用链式法则回传梯度有多个分支时先求和。卷积特征图尺寸、参数量、FLOPs。输出尺寸公式要用熟参数量注意 卷积核尺寸×输入通道数×输出通道数卷积核偏置再加1FLOPs 约等于参数量×输出特征图空间尺寸×2乘加算两次操作。算术强度与瓶颈判断。算术强度 总FLOPs ÷ 总访存量一般算读一次输入写一次输出。算完和 Ridge Point 峰值算力 ÷ 峰值带宽 比较大于则是计算瓶颈优化方向是提升算子并行效率小于则是访存瓶颈优化方向是融合、复用、压缩数据。Ring-AllReduce 通信量计算。设模型梯度大小为 M卡数是 N通信量为 2 * (N-1)/N * M。把推导过程写上每个卡发和收各 (N-1) 块梯度每块大小为 M/N。6.3 论述题思维框架算法到芯片的映射最后一类压轴题通常是开放论述比如请结合智能计算系统的基本思想论述CNN模型从编程框架到AI芯片的执行过程。这种题不要慌答案是有固定框架的。按应用层—框架层—编译层—硬件层四层写应用层定义网络结构和参数框架层把网络转成计算图并做自动求导准备编译层完成算子映射、优化把计算图转化成硬件可执行指令同时做算子融合和内存规划硬件层通过大规模并行单元执行卷积、矩阵乘数据在存储层次间搬运。最后落点在算法设计和硬件结构相互配合才能实现高能效智能计算。平时复习时你可以在笔记本上把每章出现的所有箭头关系整理出来考前一天看箭头回忆细节比逐字读课本效率高。7. 我的复习节奏安排和考场提速技巧这门课的知识点密集程度在期末考试中算高的不建议考前两三天突击因为计算题和论述题都需要手感。我的方法是把复习拆成三轮第一轮用两天把各章知识点按上文框架过一遍把最容易考的简答题在网上白纸上写一遍关键词框架第二轮用一天半主攻计算题四类必会题目各做两遍做到不看答案能完整写出推导过程第三轮也就是考前一晚只看自己整理的概念对比表和易错点清单。这三轮配合下来知识点基本能稳住在能写出来的程度。考场上一个重要的提速技巧是看到论述题先别急着动笔花30秒在草稿纸上列出答题层的四个关键词比如静态图/动态图/融合/存储这样再按框架展开。这能防止写着写着漏掉关键得分点。计算题则先把公式和单位写在显眼位置再代入数值就算结果算错公式分也能保住。我第一遍学这门课的时候最困惑的地方就是不知道哪些知识需要记细节、哪些只需要理解大意总是花了很多时间背芯片型号和框架API后来才发现考试根本不会考这些考察的是架构对比和设计权衡。这份整理帮你把范围收窄、把主线理顺照着重点去复习比闷头啃全本教材有效得多。祝期末顺利。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。