模型评估模型泛化能力定义模型在训练集上学得很好放到从来没见过的新数据上依然能保持不错效果这个能力就是泛化能力。过拟合背熟了训练数据新样本直接翻车 →泛化差欠拟合训练集本身就学不好 → 泛化自然也差理想状态训练集效果 ≈ 测试集效果 → 泛化能力优秀为什么泛化能力会变差过拟合模型容量太大参数过多把训练集的随机噪声、个别样本特征当成普遍规律记住了训练数据不足 / 样本分布单一数据覆盖的场景太少训练集和测试集分布不一样分布偏移训练时间过长模型反复迭代记住训练细节提升泛化能力的常用手段数据层面增大数据集数据增强图像翻转、文本改写保证训练 / 测试数据分布一致模型结构适当降低模型复杂度不要盲目堆参数量正则化RegularizationL1 / L2 权重衰减限制权重不要过大Dropout训练时随机丢弃一部分神经元防止神经元过度耦合记忆样本训练策略早停 Early Stopping监控验证集损失验证集效果下跌就停止训练交叉验证 K‑fold评估真实泛化水平权重初始化、BN 批归一化稳定训练间接改善泛化损失函数损失函数用来衡量模型当前预测值 和 真实标签之间差了多少也就是模型 “错得有多离谱”。 它输出一个损失值 loss值越大预测结果偏差越大loss 越小预测越准。Loss损失值单个样本的误差 拿一张图片算一次错多少Cost代价 / 损失函数均值整个 batch 全部样本 loss 的平均值 一批数据整体误差训练更新权重用的就是这个值损失函数在训练里干什么模型输入数据输出预测结果损失函数对比预测 vs 真实标签算出 loss反向传播用 loss 求梯度更新神经网络权重反复迭代不断降低 loss提升模型效果学习率学习率Learning Rate控制每一次参数更新的时候权重走多大一步。 梯度算出更新方向之后学习率决定步子大小。lr 过大损失震荡、不收敛loss 越来越大lr 过小收敛速度极慢训练耗时很久lr 适中loss 平稳下降顺利收敛公式直观理解举一个爬山下山的例子我们的目标走到山谷最低点loss 最小学习率太大步子跨很大容易左右来回震荡直接跨过最低点loss 不降甚至发散学习率太小步子特别小下山走得极慢训练很久都没收敛容易卡在局部最小值合适的学习率前期大步快速靠近谷底后期小步精细走到最低点特征工程1.特征工程就是对原始数据清洗、加工、变换构造出模型更容易学习、更有区分度的输入特征用来提升最终模型效果。 原始数据好比粗矿石特征工程就是提炼出含金量更高的矿石喂给模型去训练。举个例子 判断用户会不会购买商品 原始数据时间字符串2026‑09‑05 19:30人工构造新特征小时、星期几、是否周末这些就是加工后的优质特征。2. 完整流程数据清洗剔除异常值、填充缺失值、去重特征选择扔掉冗余、无关的特征减少噪声防止过拟合特征变换归一化、标准化、对数变换、离散分箱特征构造基于旧特征计算出新特征差值、比值、组合字段特征编码类别文本转数字如独热编码、标签编码3. 为什么特征工程很重要传统机器学习LR、树模型效果上限基本由特征决定 大模型虽然可以直接接收原始文本弱化人工特征但预处理依然属于广义的特征工程。 好的特征模型简单也能拿到不错的精度差的特征再复杂的网络也很难训练出好结果。无监督学习1. 核心定义训练数据没有人工标注的标签模型自己去挖掘数据内部隐藏的规律、结构、模式没有标准答案可以对照。对比一下更好记监督学习数据带标签图片标好是猫 / 狗模型学「输入→输出」的映射无监督学习只有一堆原始数据没有结果标签模型自己找相似性、分组、内在特征2. 生活化例子给你一堆乱七八糟的照片没人告诉你每张是什么。 机器自动把相似的分到一组猫放一堆、狗放一堆、风景放一堆这个聚类过程就是典型的无监督学习。3. 两大经典任务聚类 把相似样本自动分成一类 例子用户分群、商品归类、K‑Means降维 / 特征提取 把高维复杂数据压缩成少量关键信息保留主要特征 例子PCA 主成分分析自编码器 AE补充大模型预训练阶段很多也是自监督学习属于无监督的一个分支利用文本本身构造监督信号不需要人工打标签。模型压缩一、模型压缩大模型训练出来之后参数量巨大几十亿、上千亿参数体积大、占用显存高、推理很慢。 模型压缩在尽量不损失精度的前提下通过一系列技术手段减小模型体积、降低参数量 / 计算量得到一个更小、更快的轻量化版本。二、做模型压缩的核心目的降低显存 / 内存占用 原始大模型跑起来需要很高配置的 GPU压缩之后可以在普通显卡、手机、边缘设备部署。加快推理速度降低延迟 线上调用接口、本地对话时响应更快用户不用长时间等待。减少算力成本 企业线上服务部署时节省 GPU 资源降低服务器开销。适配端侧部署 把大模型放到手机、平板、嵌入式设备上本地运行端侧大模型。一句话总结目标保精度、变小、变快、省钱、能在轻量设备跑。三、四大主流压缩手段量化 Quantization 把 32 位浮点数FP32转成 16bit、8bit 甚至 4bit 整数减少单个参数占用的存储空间比如 GPTQ、AWQ。剪枝 Pruning 删掉权重里数值很小、对结果几乎没影响的参数去掉冗余权重。知识蒸馏 Knowledge Distillation 用一个大而准的教师模型去教一个小型学生模型让小模型学到大模型的能力。稀疏化 / 权重共享 多个神经元共用一套权重减少参数量。注意力机制一、什么是注意力机制注意力机制来源于人的视觉习惯人看一句话、一张图时不会平等对待每一个字 / 像素会重点关注关键信息忽略无关内容。放到大模型Transformer里 模型在处理序列文本时给不同的 token单词 / 字分配不同的权重分数权重越高代表这个词对当前位置的预测越重要。二、核心功能捕捉词语之间的依赖关系无论距离远近 传统 RNN 长距离文本容易丢失早期信息注意力可以直接计算第一个词和最后一个词的关联。 举例子“小明把杯子递给小红她接过了杯子。” 预测「她」是谁时注意力会拉高小红的权重。区分信息重要程度 无关的词语权重压低关键词语权重拉高减少噪声干扰。实现并行计算Transformer 优势 自注意力可以一次性计算整段文本全部词之间的关联不像 RNN 逐词串行运算训练速度更快。提升上下文理解能力 做多轮对话、翻译、摘要时模型能精准抓住上下文关键语义。三、简单流程Self‑Attention 自注意力通过 Query、Key、Value 计算注意力分数当前词生成查询向量 Q所有词生成 K、V 向量Q 和 K 做点积算出两两之间的相似度Softmax 归一成 0~1 之间的权重权重总和 1使用权重对 V 加权求和得到最终输出