尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

[新手小白也能学会] 00-深度学习简介

发布时间:2026/9/27 22:59:25

资讯中心
01
ARTICLE

[新手小白也能学会] 00-深度学习简介

[新手小白也能学会] 00-深度学习简介
摘要本文系统讲解深度学习的基础知识从人工智能、机器学习与深度学习三者的包含关系切入回顾机器学习固定五步流程及其处理图像、文本的局限引出深度学习以人工神经网络为架构、自动提取特征的核心定义。随后拆解神经网络ANN的输入层、隐藏层、输出层结构说明神经元加权求和与激活函数的作用并介绍张量、全连接层、黑盒特性及反向传播训练原理。接着总结深度学习的四大特点梳理 CNN、RNN、Transformer 等常见模型及其在图像、文本处理中的应用最后给出应用场景、发展历史与知识速查表帮助读者建立完整的深度学习知识框架。目录一、什么是深度学习1.1 人工智能、机器学习与深度学习的关系1.2 先回顾机器学习是怎么工作的流程固定核心五步数据预处理标准化与归一化三大任务按实际使用频率局限处理图像、文本能力较弱1.3 深度学习的核心定义1.4 深度学习 vs 传统机器学习二、神经网络ANN深度学习的骨架2.1 三种层输入层、隐藏层、输出层2.2 隐藏层每个神经元只做两件事2.3 关于深度层数与神经元个数2.4 全连接层在哪里2.5 底层数据结构张量且输入必须是二维2.6 为什么说深度学习是黑盒2.7 拓展神经网络是怎么训练的——反向传播课堂补充三、深度学习的特点四、常见深度学习模型图像与文本怎么处理4.1 图像 → CNN计算机视觉 CV4.2 文本 → RNN自然语言处理 NLP4.3 其他模型要点4.4 深度学习计算框架五、应用场景六、发展历史6.1 人工智能发展历史6.2 深度学习发展历史七、知识速查表一、什么是深度学习1.1 人工智能、机器学习与深度学习的关系三者是包含关系人工智能Artificial Intelligence, AI └── 机器学习Machine Learning, ML └── 深度学习Deep Learning, DL概念定义人工智能AI让机器表现出智能行为的科学与工程目标是让机器仿智机器学习ML实现人工智能的一种途径让计算机从数据中学习规律而无需显式编程深度学习DL机器学习的一个子集基于人工神经网络通过多层非线性变换自动学习数据的特征深度学习是机器学习的子集所以要理解深度学习深在哪、新在哪得先看机器学习是怎么工作的。1.2 先回顾机器学习是怎么工作的流程固定核心五步机器学习的处理流程是固定的获取数据 → 数据预处理 → 特征工程 → 模型训练 → 模型评估与预测其中特征工程由人来完成——这是机器学习最依赖人工经验的环节也是它和深度学习最核心的区别。数据预处理标准化与归一化预处理最常见的操作是把不同量纲的特征缩放到接近的范围两种常用方法方法英文公式效果标准化StandardizationZ-scorez (x − μ) / σ变换成均值 0、标准差 1 的分布形状不变归一化NormalizationMin-Maxx (x − min) / (max − min)把数据压缩到 [0, 1] 区间两个统计量均值 μ所有数加起来除以个数代表平均水平。如[2, 4, 6]的均值为4。标准差 σ衡量数据的波动程度即每个数离均值平均有多远。σ 大说明数据忽高忽低σ 小说明数据都挤在均值附近。为什么要做缩放不同特征量纲差异很大如年龄范围 0~100收入可达几十万大数值特征会压住小数值特征、主导训练过程缩放后各特征公平参与模型收敛更快更稳定。经验数据近似正态分布或存在异常值时用标准化需要固定范围如图像像素 0~255 → 0~1时用归一化。三大任务按实际使用频率任务英文说明使用频率分类Classification预测离散类别如垃圾邮件 / 正常邮件大概率用回归Regression预测连续数值如房价、温度也会用聚类Clustering无监督把相似样本自动分组很少用一般只在项目初期做样本相似性分析且不会从 0 开始造轮子直接用现成工具局限处理图像、文本能力较弱机器学习处理图像、文本这类非结构化数据的能力较弱——图像是高维的像素矩阵文本是离散的符号序列人工很难设计出有效的特征。这正是要引入深度学习的原因能不能让算法自己学特征1.3 深度学习的核心定义深度学习Deep Learning是机器学习的分支是一种以人工神经网络为架构、对数据进行特征学习的算法。深度指网络中使用多层结构。核心思想通过模仿人脑的神经网络来处理和分析复杂的数据从大量数据中自动提取复杂特征擅长处理高维数据如图像、语音和文本。核心要点基于人工神经网络模仿人脑神经元结构构建计算模型深度网络中使用多层结构逐层抽象每层通过非线性变换处理数据逐渐提取更复杂、更抽象的特征端到端学习从原始数据直接到最终结果无需人工设计特征1.4 深度学习 vs 传统机器学习两种流程放在一起看区别一目了然机器学习 输入 → 人工特征提取 → 分类 → 输出 深度学习 输入 → 算法自动特征提取 分类 → 输出对比维度传统机器学习深度学习特征提取依赖人工设计特征并进行特征提取不需要人工依赖算法自动提取特征处理流程输入 → 人工特征提取 → 分类 → 输出输入 → 自动特征提取 分类 → 输出数据需求相对较少通常需要大量标注数据计算资源要求较低需要强大的计算资源如 GPU可解释性相对较好可解释性差被称为黑箱擅长领域结构化数据、简单任务高维数据图像、语音、文本关键区别传统机器学习算法依赖人工设计特征并进行特征提取而深度学习方法不需要人工而是依赖算法自动提取特征。深度学习通过模仿人脑的神经网络来处理和分析复杂的数据从大量数据中自动提取复杂特征尤其擅长处理高维数据图像、语音、文本。这也是深度学习被看做黑盒子、可解释性差的原因为什么会变成黑箱第二章 2.6 节展开。深度学习的架构是人工神经网络那么神经网络长什么样下面把它拆开看。二、神经网络ANN深度学习的骨架2.1 三种层输入层、隐藏层、输出层ANNArtificial Neural Network人工神经网络由三种层组成输入层 ──→ 隐藏层一层或多层 ──→ 输出层 (特征数) (神经元 激活函数) (由任务决定)层神经元个数由什么决定作用输入层特征数如鸢尾花 4 个特征 → 4 个神经元只接收数据不做计算隐藏层人为设定经验值特征提取的核心逐层抽象输出层任务目标二分类 1 个多分类 类别数回归 预测值个数给出最终结果2.2 隐藏层每个神经元只做两件事加权求和z w₁x₁ w₂x₂ … wₙxₙ bw 是权重 weightb 是偏置 bias激活函数a f(z)如 ReLU、Sigmoid为什么必须有激活函数如果只有加权求和线性运算无论叠多少层整体仍等价于一层线性变换加入非线性激活函数后网络才能拟合复杂的非线性关系。举例输入x [1, 2]权重w [0.5, 0.4]偏置b 0.1则z 0.5×1 0.4×2 0.1 1.4经 ReLU 激活后输出a max(0, 1.4) 1.4。2.3 关于深度层数与神经元个数网络的深度 隐藏层的层数输入层和输出层不计入。隐藏层越多网络越深能提取的特征越抽象。课程约定每个隐藏层的神经元至少 2 个——只有 1 个神经元的隐藏层等价于感知机网络结构失去意义。开发经验隐藏层神经元数按前层多、后层逐层递减的漏斗形设置效果通常较好具体数值没有公式靠经验调参。2.4 全连接层在哪里全连接层Fully Connected Layer又称 Dense Layer / 稠密层指前一层的每个神经元都与后一层的每个神经元相连的层最朴素的 ANN如多层感知机 MLP整个网络全是全连接层。CNN 中全连接层在网络末端——前面卷积层、池化层负责提特征保留空间结构最后展平Flatten后接全连接层负责综合所有特征做分类。RNN 中全连接层也在末端——词嵌入层 → 循环网络层 → 全连接层输出结果。缺点全连接意味着参数量最大n个输入、m个输出需要n×m m个参数所以 CNN 里它总是放在最后收口。2.5 底层数据结构张量且输入必须是二维深度学习框架底层的统一数据结构是张量Tensor0 维是标量、1 维是向量、2 维是矩阵、3 维及以上统称张量。张量中只能存放数值——所以文本、类别标签等都必须先转成数值才能进入网络。ANN 的输入是二维张量(样本数 × 特征数)。而图像天然是三维的高 × 宽 × 通道所以要么先展平Flatten成向量再进全连接网络会丢失空间结构要么先用 CNN 提取特征、保留空间信息再进全连接层——这就是 CNN 存在的意义第四章展开。2.6 为什么说深度学习是黑盒深度学习模型内部的参数动辄百万千万人无法逐个解读每个参数的含义模型内部的运作机制相对不透明因此被称为黑箱可解释性差。理解模型为什么做出特定决策比较困难这对某些应用场景是一个挑战。更根本的问题连为什么 4 层比 3 层效果好这类结构问题目前也没有数学公式能解释。只有少数研究者尝试用数学工具如神经正切核 NTK 等理论去解释业界仍以经验调参为主。结构看懂了下一个问题自然是网络里成千上万个参数w、b是怎么定下来的答案是训练——反向传播。2.7 拓展神经网络是怎么训练的——反向传播以最简单的单参数模型y wx b为例训练一共有四个步骤循环往复① 前向传播Forward拿当前的参数算出预测值。② 计算损失Loss用损失函数衡量预测值 ŷ 与真实值 y 的差距如均方误差L (ŷ − y)²。③ 反向传播Backpropagation拿着结果反推——从损失出发利用链式法则逆向算出损失对每个参数的梯度∂L/∂w、∂L/∂b。梯度含义参数往这个方向动一点损失会怎么变。④ 更新参数权重新参数 上一次的参数 − 学习率 × 梯度梯度下降法Gradient Descent即w ← w − η · (∂L/∂w) b ← b − η · (∂L/∂b)这就是参数是在上一次的基础上加减一个修正量——每次只修正一小步步长由学习率 η 控制而不是凭空重算。数值示例真实规律y 4输入x 2初始参数w 1, b 0学习率η 0.1步骤计算结果前向传播ŷ 1×2 0ŷ 2损失L (2 − 4)²L 4求梯度∂L/∂w 2(ŷ−y)·x −8∂L/∂b 2(ŷ−y) −4梯度都是负的更新参数w 1 − 0.1×(−8) 1.8b 0 − 0.1×(−4) 0.4w1.8, b0.4再来一遍ŷ 1.8×2 0.4 4.0L 0损失归零为什么要循环深度网络中参数动辄成千上万个反向传播每轮把所有参数的梯度一次性算出并全部更新更新完再用数据跑一遍前向 反向如此反复数据完整过一遍叫一个epoch直到损失不再明显下降训练结束。一句话总结前向传播算损失反向传播算梯度梯度下降更新参数。三、深度学习的特点看完结构与训练方式深度学习的四个特点就顺理成章了多层非线性变换模型由多个层次组成每一层都应用非线性激活函数对输入数据进行变换2.2 节。较低层级捕捉简单特征边缘、颜色等更高层级识别更复杂的模式物体、面部等。自动特征提取能自动从原始数据中学习有用的特征不需要人工特征工程对比 1.2 节机器学习的人工特征工程。大数据和计算能力通常需要大量标注数据和强大的计算资源如 GPU。大数据 高性能计算使深度学习在图像识别、自然语言处理等领域取得显著突破。可解释性差内部运作机制不透明被称为黑箱2.6 节已展开。层级捕捉的特征较低层级简单的特征如边缘、颜色等更高层级更复杂的模式如物体或面部识别四、常见深度学习模型图像与文本怎么处理传统机器学习处理图像、文本的能力较弱1.2 节深度学习针对不同数据类型发展出了专门的模型。先看总表再逐个展开最常用的两个。模型英文全称简称主要应用卷积神经网络Convolutional Neural NetworksCNN图像识别、计算机视觉CV循环神经网络Recurrent Neural NetworksRNN序列数据、自然语言处理NLP自编码器AutoencodersAE数据降维、特征学习、异常检测生成对抗网络Generative Adversarial NetworksGAN图像生成、数据增强TransformerTransformer—自然语言处理、大模型基础深度强化学习Deep Reinforcement LearningDRL游戏 AI、机器人控制图神经网络Graph Neural NetworksGNN图结构数据、社交网络4.1 图像 → CNN计算机视觉 CVCVComputer Vision计算机视觉领域使用CNNConvolutional Neural Networks卷积神经网络输入层 → 隐藏层卷积层 → 池化层 → … → Flatten → 全连接层 → 输出层卷积层用卷积核在图像上滑动自动提取局部特征边缘、纹理等并保留图像的空间结构。用于图像分类、目标检测、图像分割等任务。池化层缩小特征图尺寸减少参数数量提高计算效率。全连接层位于网络末端综合特征完成分类呼应 2.4 节。图像的两种排布HWC 与 CHW排布顺序使用场景HWC高Height× 宽Width× 通道Channel图像读取与存储的常见格式如 OpenCV、PIL 读进来的图像RGB 图通道为 3CHW通道 × 高 × 宽PyTorch 等框架内部计算的格式批量形式为 NCHW送入网络前需要转换图像张量是三维HWC而 ANN 只吃二维输入2.5 节这正是 CNN 要先卷积提特征、再 Flatten 进全连接层的原因。4.2 文本 → RNN自然语言处理 NLPNLPNatural Language Processing自然语言处理领域使用RNNRecurrent Neural Networks循环神经网络输入层 → 词嵌入层Embedding → 循环网络层 → 全连接层 → 输出层词嵌入层把文字词映射成低维数值向量——因为张量只能存数值2.5 节文本必须先数值化。循环网络层具有记忆功能处理输入数据的时间依赖性但标准 RNN 难以捕捉长期依赖关系后来由 LSTM、GRU、Transformer 逐步解决。全连接层末端输出结果。序列数据与依赖关系序列数据Sequence Data有先后顺序、前后相互关联的数据如文本词序、语音、股价、传感器读数。时间依赖 / 长期依赖当前的输出不仅取决于当前输入还依赖之前出现过的信息。例如我今天去银行取了____必须结合前文才能填出钱。梯度下降法Gradient Descent课堂提到的梯度训练时沿损失下降最快的方向更新参数w ← w − η·∇L——已在 2.7 节反向传播中详细讲过这里不再重复。语音的处理声音信号先转成频谱图Spectrogram——横轴时间、纵轴频率的图像化序列特征——再作为序列数据输入 RNN。4.3 其他模型要点自编码器AE由编码器把输入压缩成低维表示和解码器从低维表示重建原始输入两部分组成无监督学习。GAN包含生成器制造以假乱真的样本和判别器区分真假样本二者对抗训练。现在热度已不高图像生成领域逐渐被扩散模型Diffusion Model如 Stable Diffusion取代但原理仍值得学习。Transformer摒弃递归结构采用自注意力机制self-attention可并行处理整个序列在机器翻译、文本摘要等任务中表现出色是 BERT、GPT 等大模型的基础。4.4 深度学习计算框架框架现状PyTorch当前学界与工业界主流接口接近 Python上手容易TensorFlow热度已明显下降口语说过时存量项目仍在使用两个框架底层都是张量运算学会一个后另一个迁移成本很低。Transformer 架构是后续大模型的基础必须掌握。五、应用场景应用领域具体场景计算机视觉图像分类、目标检测、人脸识别、图像生成自然语言处理机器翻译、文本分类、情感分析、问答系统自动驾驶环境感知、路径规划、决策控制推荐系统个性化推荐、广告投放、内容分发多模态与智能体图文理解与生成文生图、视觉问答、AI Agent任务规划与工具调用医疗健康医学影像分析、疾病诊断、药物发现工业与制造业质量检测、预测性维护、智能机器人语音与音频处理语音识别、语音合成、音乐生成此外深度学习还广泛应用于智能安防、智能零售、智慧教育、智能家居、智能汽车等领域。具体展开计算机视觉Computer Vision, CV图像分类将图像分为不同类别。如社交媒体自动标注照片、医疗影像病变检测。目标检测Object Detection在图像或视频中定位并分类多个对象。如自动驾驶中的行人检测、监控视频入侵检测。面部识别分析面部特征进行身份验证。如手机解锁、安防监控。图像生成基于输入生成新图像如风格转换、超分辨率、老旧照片修复。自然语言处理Natural Language Processing, NLP课堂在此补充了梯度、序列数据、长期依赖见 4.2 节机器翻译一种语言自动翻译成另一种。如 Google 翻译、实时语音翻译。情感分析分析文本情感倾向。如社交媒体监控、产品评论分析。文本生成生成符合语法与语义的文本。如自动写作助手、新闻生成。语音识别语音转文字。如智能助手、自动字幕。聊天机器人Chatbot理解用户输入并生成合理回应。如客服机器人、GPT 类模型。推荐系统Recommendation Systems电影、音乐推荐根据历史评分与行为推荐。如 Netflix、Spotify。电商推荐根据购买与浏览习惯推荐商品。如亚马逊、淘宝。社交媒体推荐分析社交行为推荐内容或好友。如 Facebook、Instagram。六、发展历史6.1 人工智能发展历史阶段时间主要特征标志性事件符号主义20 世纪 50-70 年代专家系统占主导1950图灵提出图灵测试并设计国际象棋程序1962IBM 的 Arthur Samuel 跳棋程序战胜人类高手第一次浪潮统计主义20 世纪 80 年代-2000 年主要用统计模型解决问题1995Cortes 和 Vapnik 提出支持向量机SVM1997IBM 深蓝战胜国际象棋世界冠军卡斯帕罗夫第二次浪潮神经网络21 世纪初期神经网络、深度学习流派2012AlexNet——深度学习在 CV 领域的开山之作2016Google AlphaGo 战胜李世石第三次浪潮大规模预训练模型2017-至今大规模预训练模型2017NLP 的 Transformer 框架出现2018BERT 和 GPT 出现2022ChatGPT 出现进入大模型 AIGC 阶段6.2 深度学习发展历史阶段时间主要进展早期探索1940s-1980s1943McCulloch 和 Pitts 模仿生物神经系统构建计算模型M-P 神经元1957Frank Rosenblatt 提出感知器Perceptron能做简单二分类1960 年代末出现多层感知器MLP但受限于计算能力和数据量应用受限挑战与瓶颈1980s-1990s1986Rumelhart、Hinton、Williams 发表反向传播Backpropagation, BP算法使多层神经网络能通过梯度下降优化参数、解决复杂非线性问题因计算资源限制且对图像、语音等复杂数据处理能力较弱深度学习未广泛应用SVM、决策树等传统方法成为主流复兴与突破2000s-2010s2006Hinton 团队提出深度置信网络DBN引入无监督预训练标志深度学习复兴2012Krizhevsky 等设计的AlexNet在 ImageNetILSVRC竞赛中夺冠将 Top-5 错误率从 26.2% 降至 15.3%标志深度学习在 CV 领域的成功2014Goodfellow 提出生成对抗网络GAN开启生成模型新时代2015何恺明等提出ResNet残差网络解决梯度消失 / 爆炸问题使训练上百层的网络成为可能爆发期2016-至今2016AlphaGo 战胜李世石深度强化学习进入公众视野2017Transformer 框架出现奠定预训练语言模型基础2018BERT 和 GPT 出现2022ChatGPT 出现进入大模型 AIGC 阶段
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。